Imitation Learning (IL)
現代の脚型ロボット制御は、最適化に基づくモデル予測制御(MPC)、報酬に基づく強化学習(RL)、そして模倣学習(IL)という3つの基本的な制御パラダイムに支えられている。
報酬設計を慎重に行う必要がある強化学習と異なり、模倣学習はデモンストレーションデータが豊富にある場合、開発サイクルの短縮、ハイパーパラメータ感度の低さ、自然なスケーラビリティという利点をもつ。
2019年以降、模倣学習は複数の方法論的系統に分化している。状態と行動の対から直接教師あり学習を行う行動クローニング(BC)や、識別器を用いる敵対的動作事前分布(AMP/GAIL)などが含まれる。データ取得手段としての遠隔操作は形態的に整合したデータを与える一方、全身の歩行パターンを捉える難しさと収集にかかる労力が制約となる。