Mixture of Experts (MoE)
Mixture of Experts(MoE)は、モデル内に複数の部分ネットワーク(専門家)を並べ、入力ごとにその一部だけを活性化する構造である。Switch Transformer の論文は、通常のモデルが全入力に同じパラメータを再利用するのに対し、MoE は入力ごとに異なるパラメータを選ぶと説明し、その結果として膨大なパラメータ数を持ちながら計算コストは一定になると述べている。
ルータ(ゲート)が各トークンをどの専門家に送るかを決める。Switch Transformer は、この振り分けを 1 トークンあたり 1 専門家に単純化し、通信量と計算量を下げた。専門家への負荷が偏らないようにする工夫や、bfloat16 のような低精度形式での安定した学習が実装上の論点になる。専門家は複数の計算ノードに分散して配置されるため、ノード間の通信が性能のボトルネックになりやすい。
総パラメータ数と、実際に 1 トークンを処理するのに使う活性パラメータ数が乖離するため、モデルの規模を単純なパラメータ数で比較できなくなる。推論時は全専門家をメモリに載せる必要がある一方、演算量は抑えられるので、メモリ容量と演算性能のどちらが制約になるかで最適な構成が変わる。