Video-Action Models: Are video model backbones the future of VLAs?
mimic robotics は、ロボット制御のバックボーンに Vision-Language Model ではなく事前学習済みの動画生成モデルを用いる Video-Action Model「mimic-video」を発表した。従来の VLA と比べてサンプル効率が約10倍高く、器用な操作タスクで高い性能に到達するのに必要な軌跡データは約500件で済むという。大規模な人間の動画データで事前学習することで、高コストなロボット遠隔操作データへの依存を減らしつつ、収束の速さと推論性能の向上を両立している。
mimic robotics AG 公式ニュースルームで全文を読む ↗
無料登録で、調達額・投資家・記事全文が読めます(メールアドレスのみ)。
無料で登録する