鳥瞰図(BEV)認識

Bird's-Eye-View Perception (BEV)

複数のカメラやセンサから得た観測を、車両を真上から見下ろす統一座標系の表現に変換したうえで、三次元物体検出や地図セグメンテーションを行う自動運転向けの知覚手法である。センサごとの視点差を吸収でき、経路計画や地図と座標系を共有できるため、認識結果をそのまま下流モジュールへ渡せる。

詳細

概要

BEV認識は、車載カメラなど複数視点の観測を、車両中心の俯瞰平面上に統合した表現に変換する自動運転向けの知覚方式である。BEVFormerの論文は、この表現を「三次元物体検出や地図セグメンテーションといった自動運転タスクを支える、複数カメラ視点からの統一表現の学習」と位置づけている。

技術的な要点

個々のカメラ画像は透視投影された二次元像であり、そのままでは距離や位置関係の統合が難しい。BEV方式では、格子状に定義したBEVクエリを介して各カメラの特徴量を空間的に集約する。BEVFormerでは、複数カメラ間の対応づけに空間クロスアテンション、過去フレームの情報取り込みに時間的セルフアテンションを用い、空間情報と時間情報の双方を活用する。この構成により、カメラ画像のみでLiDARベース手法に匹敵する性能が報告されている。俯瞰平面は経路計画や地図情報と同じ座標系であるため、認識結果をそのまま下流モジュールに渡せる点も実装上の利点である。

産業での位置づけ

カメラ中心の自動運転スタックにおける標準的な中間表現となりつつあり、量産車の運転支援から自動運転トラックまで幅広く採用が進む。センサ構成が変わっても表現形式を共有できるため、車種横断でのモデル再利用や、地図・予測・計画モジュールとの統合を容易にする。