multimodal멀티모달
multimodal은 AI가 텍스트·이미지·음성 등 서로 다른 형태의 데이터를 함께 처리하는 성질이다.
기사 2편
최근 언급 multimodal(서로 다른 형태의 데이터를 함께 처리하는 성질)은 AI 모델이 텍스트, 이미지, 음성 같은 두 종류 이상의 데이터를 입력받거나 생성하는 것을 뜻한다. 텍스트처럼 한 종류의 데이터만 다루는 단일 모달 모델과 구별된다.
2023년 무렵부터 GPT-4, Gemini 등 주요 대규모 언어 모델이 이미지 입력을 지원하면서 널리 쓰이는 말이 됐다. 화면을 인식해 마우스와 키보드로 컴퓨터를 조작하는 computer-use 모델도 화면 이미지와 텍스트 지시를 함께 처리한다.
이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.
이 항목을 다룬 기사
한 AI agent 스타트업이 공개한 Navigator n2는 multimodal(화면 이미지와 텍스트를 함께 입력받는) computer-use(화면을 인식해 마우스와 키보드로 컴퓨터를 조작하는 방식) 모델로, OSWorld-v2에서 부분 정확도 65.2%, 작업당 약 $1.46을 기록…