拡散方策

Diffusion Policy

ロボットの行動生成を条件付きデノイジング拡散過程として定式化した視覚運動方策の学習手法。行動分布のスコア関数の勾配を学習し、推論時に反復的に最適化することで、同じ観測に複数の妥当な行動が存在する多峰性のある分布と、高次元の行動空間を安定して扱える。

詳細

概要

拡散方策は、ロボットの行動生成を「条件付きデノイジング拡散過程」として表現する視覚運動方策の学習手法である。原論文は、行動分布のスコア関数の勾配を学習し、推論時に確率的ランジュバン動力学の反復によってその勾配場に沿って行動を最適化すると説明している。画像等の観測を条件として、離散的な1ステップの行動ではなく行動系列を生成する点が従来手法との違いである。

技術的な要点

原論文は3つの技術要素を挙げる。将来の行動系列を生成しつつ一部のみを実行して再計画する後退ホライズン制御、視覚観測を条件付けに用いるビジュアルコンディショニング、および時系列拡散トランスフォーマである。この構成により、同じ観測に対して複数の妥当な行動が存在する多峰性を表現でき、高次元の行動空間でも学習が安定するとされる。評価では4つのロボット操作ベンチマークの12タスクにおいて、既存手法に対し平均46.9%の改善が報告されている。

産業での位置づけ

少数の人間デモンストレーションから操作スキルを獲得する模倣学習の標準的な選択肢となり、大規模行動モデルなど多タスクのロボット基盤モデルの土台としても採用されている。一方で推論時に反復計算を要するため、実時間制御に向けた計算量の削減が実装上の課題となる。