Terminal-Bench터미널벤치

Terminal-Bench는 AI agent가 터미널 명령으로 주어진 작업을 자율 수행하는 능력을 평가하는 benchmark다.

기사 5편
최근 언급

Terminal-Bench는 Stanford University와 Laude Institute가 2025년에 공개한 benchmark(표준 과제로 성능을 비교하는 평가)로, AI agent(도구를 사용해 과제를 수행하는 AI)가 터미널에서 명령을 실행하며 작업을 완료하는 능력을 평가한다. 코드 저장소의 문제 수정을 중심으로 평가하는 SWE-bench와 달리 터미널을 통한 작업 수행 전반에 초점을 맞춘다. 과학 연구 작업에 초점을 맞춘 Terminal-Bench Science도 있다.

과제마다 격리된 실행 환경과 결과를 확인하는 테스트가 주어지며, 이후 개정판이 이어서 나왔다. AI 기업들이 coding agent나 모델의 자율 작업 성능을 발표할 때 자주 인용한다.

이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.

이 항목을 다룬 기사

Haiku 5.5는 그 밖에 Humanity's Last Exam에서 도구 없이 45.9%, 도구를 쓰면 57.4%를 기록했고, agent 코딩 benchmark인 Terminal-Bench 4.0에서 39.2%, FrontierCode 1.1에서 46.4%를 받았습니다.

Claude Sonnet 5.5는 Claude Opus 5.5의 절반 가격이면서 agent 코딩 benchmark(모델 성능을 비교하는 시험)인 Terminal-Bench 4.0에서 70.6%로 Opus 5.5(64.4%)를 앞섰습니다.

Terminal-Bench 4.0 57.4% 58.2% 57.9% 66.4%

Anthropic이 2026년 9월 28일 출시한 Claude Sonnet 5.5는 코딩 평가인 Terminal-Bench 4.0에서 Claude Opus 5.5보다 높은 점수를 기록했습니다.

Terminal-Bench 4.0 (터미널 자율 작업) 66.4% 55.8% 57.9% 최고 기록


© 2026 AIPOST. All rights reserved.

AIPOST는 AI 활용법, AI 보안, 성능, 창업, 헬스, 윤리, 업계 소식을 다루는 AI 전문 미디어입니다. 회원 가입 없이 이용하며, 개인정보를 처리하는 방법은 개인정보 처리방침에서 확인할 수 있습니다.