小規模 VLM のファインチューニング

・ Sereact その他

Fine-Tuning small VLMs

Sereact は、小規模な vision-language モデル(VLM)を産業用ロボティクスの実運用に載せるための 3 段階の学習パイプラインを解説している。手順は、視覚モデルと言語モデルのアライメント、教師あり学習によるタスク固有の能力の習得、検証可能な報酬を用いた強化学習の適用である。これによりピッキング、キッティング、検査の各タスクで約 93% の完全一致精度を達成したという。対象は同社が展開する 200 台超のシステム群である。

Sereact 公式ニュースページで全文を読む ↗

Sereact の他のリリース