Terminal-Bench

Terminal-Benchは、AIエージェントがターミナルで操作し、課題を完了する能力を測るベンチマークである。

記事5本
最終言及

Terminal-Benchは、スタンフォード大学とLaude Instituteが2025年に公開したベンチマークで、AIエージェントがターミナルでコマンドを実行し、課題を完了できるかを評価する。リポジトリの問題修正を中心に評価するSWE-benchとは異なり、ターミナルを通じた作業全般を対象とする。科学研究の作業に焦点を当てたTerminal-Bench Scienceもある。

各課題には隔離された実行環境と結果を確かめるテストが用意されており、その後改訂版も公開された。AI企業がモデルやコーディングエージェントの自律的な作業性能を発表する際に広く引用されている。

この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。

この項目を扱った記事

Haiku 5.5はほかに、Humanity's Last Examでツールなし45.9%、ツールあり57.4%、エージェント型コーディングのテストTerminal-Bench 4.0で39.2%、FrontierCode 1.1と視覚推論のテストChartographyでいずれも46.4%を記録しています。

Claude Sonnet 5.5の価格はClaude Opus 5.5の半分ですが、エージェントによるコーディングのベンチマークであるTerminal-Bench 4.0では70.6%を記録し、64.4%のOpus 5.5を上回りました。

Terminal-Bench 4.0 57.4% 58.2% 57.9% 66.4%

Terminal-Bench 4.0では、Claude Sonnet 5.5が最大effortで70.6%に達し、Claude Opus 5.5の54.4%を上回りました。

Terminal-Bench 4.0 66.4% 55.8% 57.9%


© 2026 AIPOST. All rights reserved.

AIPOSTは、AIの活用法、AIセキュリティ、性能、起業、ヘルスケア、倫理、業界ニュースを扱うAI専門メディアです。会員登録なしで利用でき、個人情報の取り扱いはプライバシーポリシーで確認できます。