FrontierCode

FrontierCode是Cognition推出的基准测试,评估AI编程智能体提交的代码修改是否达到可合并的质量。

3篇文章
最近提及

FrontierCode是一项基准测试,评估AI编程智能体针对真实开源仓库问题(issue)提交的修改(补丁)是否达到维护者愿意合并的质量。它由开发AI编程工具Devin的Cognition于2026年推出。除测试是否通过外,还依据仓库维护者制定的标准,对正确性、测试质量、修改范围、代码风格以及对项目规范的遵循情况评分。1.1版分为最难的100个任务(Main)和全部150个任务(Extended)两组报告结果。

本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。

涉及该条目的文章

Haiku 5.5在Humanity's Last Exam上不使用工具得分45.9%,使用工具得分57.4%;在智能体编程测试Terminal-Bench 4.0上得分39.2%;在FrontierCode 1.1和视觉推理测试Chartography上均为46.4%。

FrontierCode v1.1 High effort下49.4%;最高46.2% 54.4%

FrontierCode v1.1 54.4% 50.3% 53.3%


© 2026 AIPOST. All rights reserved.

AIPOST是一家报道AI应用方法、AI安全、性能、创业、健康、伦理与行业资讯的AI专业媒体。无需注册即可使用,个人信息的处理方式请参阅隐私政策。