HumanEval휴먼이벨

HumanEval은 OpenAI가 공개한 AI 모델의 Python 코드 생성 능력 평가용 benchmark다.

기사 1편
최근 언급

HumanEval은 OpenAI가 2021년에 공개한 benchmark로, 함수 설명을 주고 모델이 Python 함수를 작성하게 한 뒤 단위 테스트를 통과하는지로 정답을 가린다. 164개 문제로 이루어져 있으며, 대규모 언어 모델의 코딩 능력을 비교하는 기준으로 널리 쓰인다.

이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.

이 항목을 다룬 기사

HumanEval Remix 100문항 75문항 통과(75%), 5문항 무응답


© 2026 AIPOST. All rights reserved.

AIPOST는 AI 활용법, AI 보안, 성능, 창업, 헬스, 윤리, 업계 소식을 다루는 AI 전문 미디어입니다. 회원 가입 없이 이용하며, 개인정보를 처리하는 방법은 개인정보 처리방침에서 확인할 수 있습니다.