メモリの壁

Memory Wall

演算性能の向上に対してメモリ帯域とインターコネクト帯域の向上が追いつかず、データ移動が全体性能を律速する状態。サーバのピーク演算性能が2年で3.0倍に伸びる一方、DRAM帯域は1.6倍、インターコネクト帯域は1.4倍にとどまるとされ、推論のサービングで特に問題となる。

詳細

概要

メモリの壁とは、演算器の処理能力ではなくデータの供給能力が全体性能を決めてしまう状態を指す。arXivに公開された論文「AI and Memory Wall」は、サーバハードウェアのピークFLOPSが2年あたり3.0倍で伸びているのに対し、DRAM帯域とインターコネクト帯域はそれぞれ2年あたり1.6倍、1.4倍でしか伸びていないと指摘している。この差が積み重なった結果、データ移動が制約要因になったとされる。

技術的な要点

同論文は、AIアプリケーション、とくに推論のサービング局面において帯域が主要なボトルネックであると論じ、言語生成に用いられるデコーダ型トランスフォーマでこの制約が顕著になるとしている。生成時のデコードは1トークンごとに重みとキャッシュを読み出す一方で演算量が小さく、演算強度が低いためである。対策としてモデル設計・学習方法・展開方式そのものの見直しが提起されており、量子化やKVキャッシュの圧縮などの手法がこの文脈に位置づけられる。

産業での位置づけ

ハードウェア側では広帯域メモリの世代更新、チップレットによるダイ間帯域の拡大、コパッケージドオプティクスによるパッケージ外帯域の確保が、いずれもこの制約への応答として進められている。演算能力の指標だけでは実効性能を説明できないという認識が、AI基盤の設計思想を規定している。