Terminal-Bench
Terminal-Benchは、AIエージェントがターミナルで操作し、課題を完了する能力を測るベンチマークである。
Terminal-Benchは、スタンフォード大学とLaude Instituteが2025年に公開したベンチマークで、AIエージェントがターミナルでコマンドを実行し、課題を完了できるかを評価する。リポジトリの問題修正を中心に評価するSWE-benchとは異なり、ターミナルを通じた作業全般を対象とする。科学研究の作業に焦点を当てたTerminal-Bench Scienceもある。
各課題には隔離された実行環境と結果を確かめるテストが用意されており、その後改訂版も公開された。AI企業がモデルやコーディングエージェントの自律的な作業性能を発表する際に広く引用されている。
この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。
この項目を扱った記事
Claude Sonnet 5.5の価格はClaude Opus 5.5の半分ですが、エージェントによるコーディングのベンチマークであるTerminal-Bench 4.0では70.6%を記録し、64.4%のOpus 5.5を上回りました。
Terminal-Bench 4.0 57.4% 58.2% 57.9% 66.4%
Terminal-Bench 4.0では、Claude Sonnet 5.5が最大effortで70.6%に達し、Claude Opus 5.5の54.4%を上回りました。
Terminal-Bench 4.0 66.4% 55.8% 57.9%