視覚言語モデル

Vision-Language Model (VLM)

画像や映像と自然言語を共通の表現空間で扱い、視覚内容の説明や質問応答、言語による指示の解釈を行うモデルである。大規模言語モデルを視覚領域へ拡張する試みとして発展し、汎用のマルチモーダル基盤モデルのほか、ロボットの行動生成や自動運転のシーン理解の構成要素としても組み込まれる。

詳細

概要

視覚言語モデルは、画像・映像と言語を結びつけて処理する機械学習モデルの総称である。arXivの解説論文「An Introduction to Vision-Language Modeling」は、「大規模言語モデル(LLM)の近年の普及を受けて、それを視覚領域へ拡張する試みがいくつも行われてきた」と述べている。

技術的な要点

言語は離散的な記号列であるのに対し、視覚情報は高次元かつ連続的で、常に容易に離散化できるわけではない。この差を埋めるため、画像エンコーダが抽出した特徴を言語モデルが扱えるトークン列に射影し、両モダリティを共通の表現空間で扱う構成が一般的である。学習は画像とテキストの対応付けを大規模に行う対照学習や、画像を条件とした生成学習などを組み合わせる。前掲論文はVLMを、視覚内容を言語記述に対応づけ、視覚支援ナビゲーションからテキストによる画像生成まで幅広い応用を可能にする、モダリティ横断の変換・理解のための仕組みとして位置づけている。評価では幻覚(hallucination)の抑制や、空間関係・数量の正確な把握が課題として挙げられる。

産業での位置づけ

汎用のマルチモーダル基盤モデルとして提供されるほか、ロボットの行動生成モデルや自動運転のシーン理解モジュールの構成要素として組み込まれる。視覚から得た状況を言語で表現できるため、判断根拠の説明や運用ログの検索と組み合わせやすい点も実用上の利点とされる。