Memory Wall
メモリの壁とは、演算器の処理能力ではなくデータの供給能力が全体性能を決めてしまう状態を指す。arXivに公開された論文「AI and Memory Wall」は、サーバハードウェアのピークFLOPSが2年あたり3.0倍で伸びているのに対し、DRAM帯域とインターコネクト帯域はそれぞれ2年あたり1.6倍、1.4倍でしか伸びていないと指摘している。この差が積み重なった結果、データ移動が制約要因になったとされる。
同論文は、AIアプリケーション、とくに推論のサービング局面において帯域が主要なボトルネックであると論じ、言語生成に用いられるデコーダ型トランスフォーマでこの制約が顕著になるとしている。生成時のデコードは1トークンごとに重みとキャッシュを読み出す一方で演算量が小さく、演算強度が低いためである。対策としてモデル設計・学習方法・展開方式そのものの見直しが提起されており、量子化やKVキャッシュの圧縮などの手法がこの文脈に位置づけられる。
ハードウェア側では広帯域メモリの世代更新、チップレットによるダイ間帯域の拡大、コパッケージドオプティクスによるパッケージ外帯域の確保が、いずれもこの制約への応答として進められている。演算能力の指標だけでは実効性能を説明できないという認識が、AI基盤の設計思想を規定している。