Speculative Decoding
投機的デコーディングは、大規模Transformerモデルの推論を高速化する手法である。通常の自己回帰生成ではKトークンを得るのにK回の逐次実行が必要になるが、この手法は近似モデルによる先読みと大規模モデルによる並列検証を組み合わせることで、逐次実行の回数を減らす。
出発点となる観察は、難しい言語モデリングのタスクにも、より効率的な小型モデルで十分に近似できる部分タスクが含まれるという点である。まず小型の近似モデル(ドラフトモデル)が複数トークンを連続して生成する。次に大規模モデルが、それらの候補位置における確率分布を一度の並列計算で評価する。採択・棄却のサンプリング規則を適切に設計することにより、結果として得られる出力の分布は大規模モデル単体で生成した場合と一致する。すなわち近似モデルの精度は速度にのみ影響し、出力品質を劣化させない。原論文ではT5-XXLでの実装により、標準のT5X実装に対して2〜3倍の高速化を、出力を同一に保ったまま達成したと報告されている。近似モデルの当たり率と、その実行コストの比が実効的な加速率を決める。
推論コストとレイテンシが直接的な運用費に結びつくモデル提供事業において、モデルを変更せずに単位計算あたりの生成量を増やせる手法として広く実装されている。