Scaling Laws
スケーリング則は、言語モデルの交差エントロピー損失が、パラメータ数、データセットサイズ、学習に用いた計算量のそれぞれに対してべき乗則で改善するという経験的な関係を指す。Kaplan らの 2020 年の論文がこれを体系的に報告し、傾向の一部は 7 桁以上にわたると述べている。
同論文は、幅や深さといった構造上の細部は広い範囲で影響が小さく、支配的なのは規模であるとした。さらに、過学習の度合いがモデルとデータセットの比で決まること、学習速度がモデルサイズで決まることを単純な式で記述し、固定の計算予算に対する最適な配分を決められると結論している。大きいモデルほどサンプル効率が高いため、計算効率の観点では非常に大きなモデルを比較的少ないデータで学習し、収束のかなり手前で止めるのが最適だと述べている。なおパラメータ数とデータ量の最適な比率については後続研究で異なる結論も示されており、係数は前提条件に依存する。
学習に投じる計算資源と得られる性能の関係を事前に見積もる根拠になるため、計算基盤への投資規模や研究開発計画の前提として参照される。一方で、べき乗則が予測するのは損失であり、下流のタスクでの有用性を直接保証するものではない。