World Model
世界モデルは、エージェントが置かれた環境の圧縮された空間的・時間的表現を教師なし学習で獲得し、行動に応じた将来の状態を予測する生成モデルである。HaとSchmidhuberによる研究では、環境の表現を学習するモデルを用いてエージェントを訓練し、モデルが生成する内部シミュレーション(「夢」)の中だけで学習した方策を、実環境に転移できることが示された。
典型的な構成は三つの部品からなる。第一に、高次元の観測(画像など)を低次元の潜在表現へ圧縮する視覚モデル。第二に、潜在表現の時系列を扱い、次の潜在状態を確率的に予測する記憶・予測モデル。第三に、抽出された特徴を入力として行動を出力する小規模な制御器である。予測モデルが環境ダイナミクスを担うため、制御器自体は小さく単純に保てる点が特徴とされる。予測モデルを用いれば、実環境で試すことなく多数の行動系列を内部で展開して評価でき、計画やデータ効率の改善につながる。一方で、モデル誤差が累積すると予測が現実から乖離するため、長時間先の予測精度と不確実性の扱いが課題となる。
ロボット制御や自動運転の分野で、センサ入力から周囲の将来状態を予測する基盤として位置づけられる。実車・実機での走行データ収集コストが大きい領域ほど、シミュレーション生成能力の価値が高い。