視覚言語行動モデル

Vision-Language-Action Model (VLA)

事前学習した視覚言語モデルをロボットの実機データでファインチューニングし、画像と言語指示から直接動作指令を出力させるモデル。2024年に公開されたOpenVLAは70億パラメータで97万件の実機デモを学習し、汎化する視覚運動制御方策を得る方法として研究の中心になっている。

詳細

概要

大規模に事前学習された視覚言語モデルを土台に、ロボットの行動出力を加えて学習させたモデルを指す。画像と自然言語の指示を入力として、ロボットの動作指令を直接生成する。2024年に公開されたOpenVLAは、この方式のオープンソース実装として広く参照されている。

技術的な要点

OpenVLAは70億パラメータ規模で、言語側にLlama 2、視覚側にDINOv2とSigLIPの特徴を組み合わせたエンコーダを用いる。学習には多様な出所から集めた97万件の実機デモンストレーションを使う。29のタスクと複数のロボット機体にわたる評価で、550億パラメータのクローズドソースモデルRT-2-Xを絶対成功率で16.5ポイント上回り、パラメータ数は7分の1であると報告されている。事前学習済みモデルをファインチューニングすることで、頑健で汎化する視覚運動制御方策が得られる点が主張の核である。

産業での位置づけ

タスクごとに制御則を作り込む従来の方式に対し、データを増やすことで対応タスクを拡張する開発モデルを提示する点で、ロボット産業の費用構造そのものに関わる。実機データの収集規模、機体をまたいだ汎化、推論の実時間性と車載可能な計算資源が、実用化における主要な制約となる。