Terminal-Bench
Terminal-Bench是评估人工智能智能体通过终端操作自主完成任务能力的基准测试。
5篇文章
最近提及 Terminal-Bench是斯坦福大学与Laude Institute于2025年发布的基准测试,评估人工智能智能体通过在终端执行命令来完成任务的能力。与侧重解决软件代码库问题的SWE-bench不同,它考察的是基于终端操作的更广泛任务。此外还有侧重科学研究任务的Terminal-Bench Science。
每项任务都配有隔离的运行环境和用于核验结果的测试,此后又推出了修订版本。人工智能企业在公布模型或编程智能体的自主任务表现时经常引用该基准。
本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。
涉及该条目的文章
Claude Sonnet 5.5的价格只有Claude Opus 5.5的一半,却在智能体编程基准测试Terminal-Bench 4.0中拿下70.6%,超过了Opus 5.5的64.4%。
Terminal-Bench 4.0 57.4% 58.2% 57.9% 66.4%
在Terminal-Bench 4.0上,Claude Sonnet 5.5在最高effort下达到70.6%,而Claude Opus 5.5的成绩为54.4%。
Terminal-Bench 4.0 66.4% 55.8% 57.9%