VLA視覚言語行動モデル

VLAは、画像と言語の指示を入力として受け取り、ロボットの動作を出力するAIモデルである。

記事1本
最終言及

VLA(視覚言語行動)モデルは、カメラ画像と自然言語の指示をあわせて理解し、関節位置や動きの軌道といったロボットの動作を直接生成するモデルである。視覚と言語を扱う大規模モデルにロボットの動作データを加えて学習させる手法が広く使われている。

言語と画像を処理する視覚言語モデルと異なり、出力が物理的な行動である点が特徴である。

この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。

この項目を扱った記事

Gemini Robotics 2はVLA、つまり視覚・言語・行動(vision-language-action)モデルです。


© 2026 AIPOST. All rights reserved.

AIPOSTは、AIの活用法、AIセキュリティ、性能、起業、ヘルスケア、倫理、業界ニュースを扱うAI専門メディアです。会員登録なしで利用でき、個人情報の取り扱いはプライバシーポリシーで確認できます。