Humanity's Last Exam인류의 마지막 시험
Humanity's Last Exam은 여러 전문 분야의 어려운 문제로 AI 모델의 지식과 추론 능력을 평가하는 benchmark다.
기사 2편
최근 언급 Humanity's Last Exam(HLE)은 여러 전문 분야의 고난도 문제로 AI 모델의 지식과 추론 능력을 평가하는 benchmark(모델 성능 비교를 위한 표준 평가)다. Center for AI Safety와 Scale AI가 전문가들과 함께 개발해 2025년 공개했다.
기존 benchmark에서 모델 점수가 높아져 성능 차이를 가리기 어려워지자, 이를 구별할 수 있도록 어려운 문항으로 구성됐다. 결과는 외부 도구 사용 허용 여부 등 조건별로 나누어 제시되기도 한다.
이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.
이 항목을 다룬 기사
Humanity's Last Exam (도구 사용) 67.7% 65.6% 57.2% 선두