Humanity's Last Exam인류의 마지막 시험

Humanity's Last Exam은 여러 전문 분야의 어려운 문제로 AI 모델의 지식과 추론 능력을 평가하는 benchmark다.

기사 2편
최근 언급

Humanity's Last Exam(HLE)은 여러 전문 분야의 고난도 문제로 AI 모델의 지식과 추론 능력을 평가하는 benchmark(모델 성능 비교를 위한 표준 평가)다. Center for AI Safety와 Scale AI가 전문가들과 함께 개발해 2025년 공개했다.

기존 benchmark에서 모델 점수가 높아져 성능 차이를 가리기 어려워지자, 이를 구별할 수 있도록 어려운 문항으로 구성됐다. 결과는 외부 도구 사용 허용 여부 등 조건별로 나누어 제시되기도 한다.

이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.

이 항목을 다룬 기사

Haiku 5.5는 그 밖에 Humanity's Last Exam에서 도구 없이 45.9%, 도구를 쓰면 57.4%를 기록했고, agent 코딩 benchmark인 Terminal-Bench 4.0에서 39.2%, FrontierCode 1.1에서 46.4%를 받았습니다.

Humanity's Last Exam (도구 사용) 67.7% 65.6% 57.2% 선두


© 2026 AIPOST. All rights reserved.

AIPOST는 AI 활용법, AI 보안, 성능, 창업, 헬스, 윤리, 업계 소식을 다루는 AI 전문 미디어입니다. 회원 가입 없이 이용하며, 개인정보를 처리하는 방법은 개인정보 처리방침에서 확인할 수 있습니다.