FrontierCode
FrontierCode是Cognition推出的基准测试,评估AI编程智能体提交的代码修改是否达到可合并的质量。
3篇文章
最近提及 FrontierCode是一项基准测试,评估AI编程智能体针对真实开源仓库问题(issue)提交的修改(补丁)是否达到维护者愿意合并的质量。它由开发AI编程工具Devin的Cognition于2026年推出。除测试是否通过外,还依据仓库维护者制定的标准,对正确性、测试质量、修改范围、代码风格以及对项目规范的遵循情况评分。1.1版分为最难的100个任务(Main)和全部150个任务(Extended)两组报告结果。
本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。
涉及该条目的文章
FrontierCode v1.1 High effort下49.4%;最高46.2% 54.4%
FrontierCode v1.1 54.4% 50.3% 53.3%