FrontierCode

FrontierCodeは、AIコーディングエージェントが作ったコード修正がマージに値する品質かを評価する、Cognitionのベンチマークである。

記事3本
最終言及

FrontierCodeは、AIコーディングエージェントが実際のオープンソースリポジトリの課題(issue)に対して作った修正(パッチ)が、メンテナーがマージできる品質かを評価するベンチマークである。AIコーディングツールDevinを開発したCognitionが2026年に公開した。テストに通るかどうかだけでなく、正確さ、テストの質、変更範囲、スタイル、プロジェクトの規約への準拠を、リポジトリのメンテナーが作った基準で採点する。バージョン1.1では、最も難しい100課題(Main)と全150課題(Extended)に分けて結果を示す。

この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。

この項目を扱った記事

Haiku 5.5はほかに、Humanity's Last Examでツールなし45.9%、ツールあり57.4%、エージェント型コーディングのテストTerminal-Bench 4.0で39.2%、FrontierCode 1.1と視覚推論のテストChartographyでいずれも46.4%を記録しています。

FrontierCode v1.1 High effortで49.4%、最大で46.2% 54.4%

FrontierCode v1.1 54.4% 50.3% 53.3%


© 2026 AIPOST. All rights reserved.

AIPOSTは、AIの活用法、AIセキュリティ、性能、起業、ヘルスケア、倫理、業界ニュースを扱うAI専門メディアです。会員登録なしで利用でき、個人情報の取り扱いはプライバシーポリシーで確認できます。