VLA视觉-语言-动作模型
VLA即视觉-语言-动作模型,是以图像和语言指令为输入、输出机器人动作的AI模型。
1篇文章
最近提及 VLA(视觉-语言-动作)模型能够同时理解摄像头图像和自然语言指令,并直接生成关节位置、运动轨迹等机器人动作。常见做法是在处理视觉和语言的大模型基础上,再用机器人动作数据进行训练。
与处理语言和图像的视觉-语言模型不同,其输出是物理动作。
本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。
VLA即视觉-语言-动作模型,是以图像和语言指令为输入、输出机器人动作的AI模型。
VLA(视觉-语言-动作)模型能够同时理解摄像头图像和自然语言指令,并直接生成关节位置、运动轨迹等机器人动作。常见做法是在处理视觉和语言的大模型基础上,再用机器人动作数据进行训练。
与处理语言和图像的视觉-语言模型不同,其输出是物理动作。
本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。
AIPOST是一家报道AI应用方法、AI安全、性能、创业、健康、伦理与行业资讯的AI专业媒体。无需注册即可使用,个人信息的处理方式请参阅隐私政策。