大規模言語モデル

Large Language Model (LLM)

大規模言語モデル(LLM)は、Transformerを大規模コーパスで事前学習した言語モデルのうち、パラメータ規模が大きいものを指す呼称である。小規模モデルにない能力が現れることが報告されている。

詳細

概要

大規模言語モデル(LLM)は、事前学習済み言語モデル(PLM)のうち、パラメータ規模が大きいものを区別するために研究コミュニティが用いるようになった語である。

技術的な要点

言語モデリングは統計的言語モデルからニューラル言語モデルへと発展し、その後Transformerを大規模コーパスで事前学習するPLMが登場した。モデルを大きくすると性能が向上することが分かり、規模をさらに拡大した研究が進んだ。パラメータ規模が一定水準を超えると、小規模モデルには見られない特別な能力が現れることが報告されており、この規模の違いを区別するためにLLMという語が生まれた。

産業での位置づけ

LLMは基盤モデルの代表例であり、学習と推論に大規模な計算資源を要するため、AI向け半導体やデータセンター、推論最適化技術の需要を生んでいる。