Transformer
Transformer は 2017 年に Vaswani らが発表した系列変換モデルのアーキテクチャである。原論文は、それまで主流だった再帰型・畳み込み型のネットワークを用いず、注意機構(attention)だけで構成する設計を提示した。当初の評価対象は機械翻訳と英語の構文解析であった。
中核は自己注意(self-attention)で、入力系列の各位置が他の全位置を参照して重み付き和をとる。再帰構造を持たないため系列方向の逐次依存が切れ、学習時に系列全体を並列処理できる。位置情報は別途エンコードして与える。注意の計算量は系列長の二乗に比例するため、長い文脈を扱う際のコスト増が構造的な課題として残る。
言語だけでなく画像、音声、生体配列など、系列や集合として表現できるデータに広く転用されている。並列化しやすい性質が GPU クラスタでの大規模学習と噛み合い、計算資源の投入量を増やせば性能が伸びるという開発様式を成立させた。後続の Mixture of Experts や状態空間モデルも、多くは Transformer を基準点として設計され、比較されている。