Reinforcement Learning from Human Feedback (RLHF)
RLHF は、人間の選好を報酬信号に変換して言語モデルを調整する手法である。InstructGPT の論文は、モデルを大きくするだけでは利用者の意図に沿う出力が得られず、真実でない出力や有害な出力、単に役に立たない出力が生じると述べ、人間のフィードバックによる微調整をその解として示した。
同論文の手順は 3 段階である。第一に、望ましい応答の人手によるデモンストレーションを集め、教師あり学習でモデルを微調整する。第二に、モデル出力に対する人手の順位付けデータを集めて報酬モデルを学習する。第三に、その報酬モデルを用いて PPO(近接方策最適化)でさらに更新する。論文は、13 億パラメータの InstructGPT の出力が 1750 億パラメータの GPT-3 の出力より人手評価で好まれたこと、真実性が改善し有害な出力が減った一方で公開ベンチマークでの性能低下は最小限だったことを報告している。
事前学習の規模だけでなく、後段の調整工程が製品としての使い勝手を大きく決めることを示した事例である。人手の選好データを継続的に収集する体制自体が競争要素になる。同時に、評価者の構成や指示内容がモデルの挙動に反映されるため、誰の選好を基準にするかがガバナンス上の論点になる。