multimodal멀티모달

multimodal은 AI가 텍스트·이미지·음성 등 서로 다른 형태의 데이터를 함께 처리하는 성질이다.

기사 2편
최근 언급

multimodal(서로 다른 형태의 데이터를 함께 처리하는 성질)은 AI 모델이 텍스트, 이미지, 음성 같은 두 종류 이상의 데이터를 입력받거나 생성하는 것을 뜻한다. 텍스트처럼 한 종류의 데이터만 다루는 단일 모달 모델과 구별된다.

2023년 무렵부터 GPT-4, Gemini 등 주요 대규모 언어 모델이 이미지 입력을 지원하면서 널리 쓰이는 말이 됐다. 화면을 인식해 마우스와 키보드로 컴퓨터를 조작하는 computer-use 모델도 화면 이미지와 텍스트 지시를 함께 처리한다.

이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.

이 항목을 다룬 기사

multimodal 응답은 중첩 경로를 하드코딩하지 말고 으로 나눠 처리합니다.

한 AI agent 스타트업이 공개한 Navigator n2는 multimodal(화면 이미지와 텍스트를 함께 입력받는) computer-use(화면을 인식해 마우스와 키보드로 컴퓨터를 조작하는 방식) 모델로, OSWorld-v2에서 부분 정확도 65.2%, 작업당 약 $1.46을 기록…


© 2026 AIPOST. All rights reserved.

AIPOST는 AI 활용법, AI 보안, 성능, 창업, 헬스, 윤리, 업계 소식을 다루는 AI 전문 미디어입니다. 회원 가입 없이 이용하며, 개인정보를 처리하는 방법은 개인정보 처리방침에서 확인할 수 있습니다.