模倣学習

Imitation Learning (IL)

ロボットが熟練者のデモンストレーションを直接再現することで技能を獲得する学習手法。モデル予測制御、強化学習と並ぶ基本的な制御パラダイムの一つ。

詳細

3つの制御パラダイム

現代の脚型ロボット制御は、最適化に基づくモデル予測制御(MPC)、報酬に基づく強化学習(RL)、そして模倣学習(IL)という3つの基本的な制御パラダイムに支えられている。

強化学習との比較

報酬設計を慎重に行う必要がある強化学習と異なり、模倣学習はデモンストレーションデータが豊富にある場合、開発サイクルの短縮、ハイパーパラメータ感度の低さ、自然なスケーラビリティという利点をもつ。

手法の系統

2019年以降、模倣学習は複数の方法論的系統に分化している。状態と行動の対から直接教師あり学習を行う行動クローニング(BC)や、識別器を用いる敵対的動作事前分布(AMP/GAIL)などが含まれる。データ取得手段としての遠隔操作は形態的に整合したデータを与える一方、全身の歩行パターンを捉える難しさと収集にかかる労力が制約となる。