Knowledge Distillation
知識蒸留は、学習済みの大きなモデル(教師)の振る舞いを、小さなモデル(生徒)に転写する手法である。Hinton、Vinyals、Dean の 2015 年の論文が枠組みを提示した。同論文は、多数のモデルを同じデータで学習して予測を平均するアンサンブルがほぼどんな手法でも性能を改善する簡便な方法である一方、そのまま配備するには計算負荷が大きいという点を出発点にしている。
生徒は正解ラベルだけでなく、教師が出力するクラス全体の確率分布を目標として学習する。分布には正解以外のクラスの相対的な近さという情報が含まれ、これが硬いラベルよりも豊かな教師信号になる。同論文はアンサンブルの知識を単一の配備可能なモデルへ圧縮できることを MNIST と商用の音響モデルで示し、あわせて汎用モデルと、細かいクラスの区別を担当する専門モデルを組み合わせる構成も提案している。
量子化や枝刈りと並ぶモデル圧縮の柱であり、端末上での実行や応答時間の制約がある用途で使われる。近年は大規模モデルの生成した出力を小型モデルの学習データに用いる運用も広がっており、教師にあたるモデルの利用条件がライセンス上の論点になる。