強化学習

Reinforcement Learning (RL)

エージェントが動的な環境との試行錯誤的な相互作用を通じて行動を学習する枠組みである。各時点の正解は与えられず、報酬信号のみを手がかりに方策を改善する。マルコフ決定過程を理論的基盤とし、探索と活用の均衡や遅延報酬の扱いが中心的な論点となる。

詳細

概要

強化学習は、動的な環境との試行錯誤的な相互作用を通じて行動を学習するエージェントが直面する問題として定義される。教師あり学習のように各時点の正解が与えられるのではなく、行動の結果として得られる報酬だけを手がかりに方策を改善する点が異なる。心理学における強化の概念と用語を共有するが、方法論は大きく異なる。

技術的な要点

理論的な基盤はマルコフ決定過程に置かれ、状態、行動、遷移、報酬の枠組みで問題が記述される。中心的な論点は、未知の行動を試す探索と有望と分かっている行動を使う活用のトレードオフ、および行動から時間を隔てて与えられる遅延報酬の扱いである。学習を加速する手段として、環境の経験的モデルの構築、関数近似による汎化、階層構造の利用、部分観測(隠れ状態)への対処が挙げられる。手法は価値ベース、方策ベース、両者を組み合わせた actor-critic に大別される。

産業での位置づけ

ロボット制御では、実機での試行回数と費用を抑えるためシミュレーション上での並列学習と実機転移が併用される。実演データからの模倣学習で方策の初期値を得たうえで、強化学習によって信頼性と動作速度を高める構成が採られることが多い。