FrontierCode
FrontierCodeは、AIコーディングエージェントが作ったコード修正がマージに値する品質かを評価する、Cognitionのベンチマークである。
記事3本
最終言及 FrontierCodeは、AIコーディングエージェントが実際のオープンソースリポジトリの課題(issue)に対して作った修正(パッチ)が、メンテナーがマージできる品質かを評価するベンチマークである。AIコーディングツールDevinを開発したCognitionが2026年に公開した。テストに通るかどうかだけでなく、正確さ、テストの質、変更範囲、スタイル、プロジェクトの規約への準拠を、リポジトリのメンテナーが作った基準で採点する。バージョン1.1では、最も難しい100課題(Main)と全150課題(Extended)に分けて結果を示す。
この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。
この項目を扱った記事
FrontierCode v1.1 High effortで49.4%、最大で46.2% 54.4%
FrontierCode v1.1 54.4% 50.3% 53.3%