1 回の評価に時間や費用がかかる目的関数を、少ない試行回数で最適化する手法である。ガウス過程回帰などで目的関数の代理モデルと不確実性を構築し、そこから定義した獲得関数によって次に評価すべき点を決めることで、探索と活用の均衡を決定理論的にとる。
演算性能の向上に対してメモリ帯域とインターコネクト帯域の向上が追いつかず、データ移動が全体性能を律速する状態。サーバのピーク演算性能が2年で3.0倍に伸びる一方、DRAM帯域は1.6倍、インターコネクト帯域は1.4倍にとどまるとされ、推論のサービングで特に問題となる。
要求ごとに性能とコストの異なる複数の言語モデルから実行先を選ぶ仕組みである。強いモデルと弱いモデルへ動的に振り分けるルータを学習する研究では、応答品質を損なわずにコストを2倍以上削減できた場合があると報告されている。エージェント基盤における推論コスト最適化の主要な手段のひとつである。
AIアクセラレータ同士を接続するためのオープンな業界標準インターコネクト。ノードやラックの内部でアクセラレータを密結合するスケールアップ領域を対象とし、異なるベンダの機器を組み合わせられることを狙う。200G世代の1.0仕様が公開されている。
モデルの重みや活性値を浮動小数点から低ビットの離散値に置き換えて保持・計算する手法。メモリ使用量と推論の遅延を減らせる。ビット幅を下げるほど圧縮率は上がるが精度劣化と釣り合わせる必要があり、どこをどの精度で表現するかの設計が中心的な論点になる。
生成モデルの推論において、リクエスト単位ではなく生成の1反復単位でスケジューリングを行う方式である。各反復の終了時に完了したリクエストをバッチから外して即座に応答を返し、待機中の新しいリクエストを空いた枠へ差し込む。生成長がばらつく状況での計算資源の遊びを減らす。