VLA시각-언어-행동 모델
VLA는 이미지와 언어 지시를 입력받아 로봇의 동작을 출력하는 AI 모델이다.
기사 1편
최근 언급 VLA(vision-language-action) 모델은 카메라 이미지와 자연어 지시를 함께 이해해 관절 위치, 움직임 궤적 같은 로봇의 동작을 직접 만들어 내는 모델이다. 시각과 언어를 다루는 대규모 모델에 로봇 동작 데이터를 더해 학습하는 방식이 널리 쓰인다.
언어와 이미지를 처리하는 vision-language 모델과 달리 출력이 물리적인 행동이라는 점이 특징이다.
이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.