Dexterous manipulation
巧緻マニピュレーションは、Bicchi による定義として広く受け入れられている「操作対象物の位置と姿勢を、与えられた基準配置から、手の作業空間内で任意に選んだ別の配置へ変化させる能力」として理解される。取り上げて置き直すだけの作業は単純なグリッパで足りるが、手の中での持ち替え、工具の使用、対象物の再配向といった作業には多指ハンドが必要になる。
ハンドの自由度は構成によって幅があり、3 本指の TriFinger が 9 自由度、5 本指の Shadow Hand が 24 自由度といった例が知られる。自由度が増えるほど操作能力は高まるが制御の難度も上がる。学習手法は、価値ベース(DQN など、連続行動空間で不利)、方策ベース(PPO、TRPO など、分散が大きい)、両者を統合した actor-critic に分類され、現在は actor-critic 系が中心である。強化学習は大量の試行錯誤データを要し、実機での収集は費用が高いため、実演からの学習とシミュレーションから実機への転移がサンプル効率の改善に用いられる。
物流や製造の現場では、対象物の形状や姿勢が定まらない作業が自動化の障壁として残ってきた。汎用ロボットやヒューマノイドの実用性は、この巧緻性をどこまで確保し、動作の信頼性と速度を同時に満たせるかで評価される。