FrontierCode프런티어코드

FrontierCode는 Cognition이 만든 benchmark로, AI 코딩 agent가 낸 코드 수정이 실제로 병합할 만한 품질인지 평가한다.

기사 3편
최근 언급

FrontierCode는 AI 코딩 agent가 실제 오픈소스 저장소의 이슈를 해결하려고 낸 수정(patch)이 저장소 관리자가 병합할 만한지를 평가하는 benchmark(모델 성능을 비교하는 표준 시험)다. AI 코딩 도구 Devin을 만든 Cognition이 2026년 공개했다. 테스트 통과 여부뿐 아니라 정확성, 테스트 품질, 변경 범위, 스타일, 저장소 규칙 준수를 저장소 관리자가 만든 기준으로 채점한다. 1.1판은 가장 어려운 과제 100개(Main)와 전체 150개(Extended)로 나눠 결과를 낸다.

이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.

이 항목을 다룬 기사

Haiku 5.5는 그 밖에 Humanity's Last Exam에서 도구 없이 45.9%, 도구를 쓰면 57.4%를 기록했고, agent 코딩 benchmark인 Terminal-Bench 4.0에서 39.2%, FrontierCode 1.1에서 46.4%를 받았습니다.

FrontierCode v1.1 49.4%·High 설정 54.4%·설정 미기재

FrontierCode v1.1 54.4% 50.3% 53.3% 근소한 선두


© 2026 AIPOST. All rights reserved.

AIPOST는 AI 활용법, AI 보안, 성능, 창업, 헬스, 윤리, 업계 소식을 다루는 AI 전문 미디어입니다. 회원 가입 없이 이용하며, 개인정보를 처리하는 방법은 개인정보 처리방침에서 확인할 수 있습니다.