OSWorld
OSWorld는 실제 컴퓨터 환경에서 앱을 조작해 과제를 수행하는 AI agent의 능력을 측정하는 benchmark다.
기사 2편
최근 언급 OSWorld는 홍콩대학교 등의 연구진이 2024년 공개한 benchmark(성능 평가 기준)로, AI agent가 컴퓨터 화면을 보고 앱을 조작해 주어진 과제를 완료하는 능력을 평가한다. Ubuntu, Windows, macOS 같은 실제 운영체제 환경에서 과제를 실행하고 결과를 확인하며, 정적인 질의응답이나 웹 환경에 한정된 평가와 달리 여러 앱을 오가는 데스크톱 작업을 다룬다. 과제와 평가 환경을 점검해 고친 OSWorld-Verified와 후속판 OSWorld-v2가 있다.
이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.
이 항목을 다룬 기사
…agent 스타트업이 공개한 Navigator n2는 multimodal(화면 이미지와 텍스트를 함께 입력받는) computer-use(화면을 인식해 마우스와 키보드로 컴퓨터를 조작하는 방식) 모델로, OSWorld-v2에서 부분 정확도 65.2%, 작업당 약 $1.46을 기록했습니다.