専門家混合

Mixture of Experts (MoE)

入力ごとに一部のパラメータ(専門家)だけを選んで使う疎活性化のモデル構造。ルータが各入力を担当する専門家に振り分けるため、総パラメータ数を増やしても1入力あたりの計算コストをほぼ一定に保てる。大規模モデルのコスト効率を左右する設計として使われる。

詳細

概要

Mixture of Experts(MoE)は、モデル内に複数の部分ネットワーク(専門家)を並べ、入力ごとにその一部だけを活性化する構造である。Switch Transformer の論文は、通常のモデルが全入力に同じパラメータを再利用するのに対し、MoE は入力ごとに異なるパラメータを選ぶと説明し、その結果として膨大なパラメータ数を持ちながら計算コストは一定になると述べている。

技術的な要点

ルータ(ゲート)が各トークンをどの専門家に送るかを決める。Switch Transformer は、この振り分けを 1 トークンあたり 1 専門家に単純化し、通信量と計算量を下げた。専門家への負荷が偏らないようにする工夫や、bfloat16 のような低精度形式での安定した学習が実装上の論点になる。専門家は複数の計算ノードに分散して配置されるため、ノード間の通信が性能のボトルネックになりやすい。

産業での位置づけ

総パラメータ数と、実際に 1 トークンを処理するのに使う活性パラメータ数が乖離するため、モデルの規模を単純なパラメータ数で比較できなくなる。推論時は全専門家をメモリに載せる必要がある一方、演算量は抑えられるので、メモリ容量と演算性能のどちらが制約になるかで最適な構成が変わる。