Video-Action Models: 動画モデルのバックボーンは VLA の未来か

・ mimic robotics AG その他

Video-Action Models: Are video model backbones the future of VLAs?

mimic robotics は、ロボット制御のバックボーンに Vision-Language Model ではなく事前学習済みの動画生成モデルを用いる Video-Action Model「mimic-video」を発表した。従来の VLA と比べてサンプル効率が約10倍高く、器用な操作タスクで高い性能に到達するのに必要な軌跡データは約500件で済むという。大規模な人間の動画データで事前学習することで、高コストなロボット遠隔操作データへの依存を減らしつつ、収束の速さと推論性能の向上を両立している。

mimic robotics AG 公式ニュースルームで全文を読む ↗

mimic robotics AG の他のリリース