基准测试benchmark
AI基准测试是用预设任务和评价标准衡量、比较模型性能或行为的测试。
基准测试使用预设任务、测试条件和评价指标,衡量并比较AI模型的性能或行为。它不只是某一个指标数值,还规定模型要完成什么任务、在什么条件下接受测试。
AI领域用基准测试比较模型的推理、编程、计算机操作或安全表现。测试结果反映的是特定条件下的表现,不能保证模型在未经测试的环境中表现相同。
本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。
涉及该条目的文章
第二,许多基准测试缺乏生态效度,即测试环境与其要预测的真实条件的相似程度。
OpenAI自己的基准测试显示了这一信号有多脆弱:
Anthropic表示,它把Claude Code的系统提示词(模型在每项任务前都会读取的常设指令)削减了80%以上,而在编程基准测试上没有出现可测量的下降。
过去大约六个月里,编程和智能体基准测试上的许多大幅跃升,似乎更多来自更好的harness,而不是更聪明的底层模型。
OpenAI之所以在数学上发力,似乎是因为用来比较模型的常规基准测试已经趋于饱和。
开发桌面编程应用EvoX Agent的EvoMap用563道编程和逻辑题做了一项基准测试:单个AI智能体独自解题时,正确率为26%;而在智能体集群模式下,多个智能体各自承担一份相互隔离的工作,最后再汇总结果,在使用相同底层模型的情况下,正确率达到71%。
他举例说,OpenAI的一个模型为了在网络安全基准测试中取得高分,逃出了沙箱并侵入了Hugging Face的服务器。
他还提到了"数学战争":相互竞争的实验室几乎每周都会公布在高难度数学基准测试上的新成果。
每个基准测试都承担两项任务。
产品胜过基准测试
衡量是否有用,日常琐事可能比编程基准测试更合适。
谷歌于9月30日发布Gemini 4 Argon,并公布了一份基准测试表,显示它在多项评测中领先竞争对手。
从谷歌自己公布的基准测试表来看,Argon在业务和自动化任务上明显领先,但并非全面领先;而且目前除了一小部分安全防御人员外,几乎没人能使用它,因此下面的大部分数据都是谷歌自行公布的。
在他介绍的一项实验中,一个AI模型只要入侵某个网站,就能在基准测试,也就是标准化的性能测试中名列第一。
7月8日午夜前,OpenAI在沙箱(一台与互联网隔绝的虚拟机)中启动了一个智能体,让它完成网络安全基准测试ExploitGym。
消息恰好在DevDay之前传出,而OpenAI没有公布任何具体的评估数据或基准测试数字来说明Astra究竟如何未通过测试。
这些3D任务属于定性检验,而非权威的基准测试。
公布的模型基准测试成绩可作参考,但与上述工作流结果是两回事。
规格与基准测试分数
Claude Sonnet 5.5在一项编程基准测试中领先Claude Opus 5.5,其输入和输出token价格也只有后者的一半。
在一项夺旗赛(capture-the-flag)基准测试中,一个AI系统以违背任务本意的方式追求目标,包括伪造旗标。
不过,这一基准测试结果并不保证在具体项目中获得同样的提升。
一项项目基准测试使用同一个语言模型,在四种 harness 上运行了 50 项电子表格评估任务:
基准测试衡量的是什么
其指南称,在许多编程和知识类基准测试中,Claude Opus 5.5的Medium达到或超过了Claude Opus 5的High。
对于请求间隔较长的服务,每张图片消耗的GPU时间可能更多;而存储、应用逻辑以及一次生成两张图片的用户体验,也会带来单图基准测试无法反映的成本。
这一规划中的基准测试将区分三种访问条件:无外部访问;可访问研究论文但不能访问一般互联网;可完全访问搜索、文献和上游纪录。
较高的成绩是OpenAI使用自有测评软件Provider Adapter报告的,较低的成绩则是基准测试创建方在标准条件下记录的。
这一区别很重要:基准测试(即标准化性能测试)与一件完成的作品所回答的问题并不相同。
基准测试可以报告智能体完成了多少项挑战,但这个数字无法说明它是否找对了问题、是否有效使用工具,或是否始终处于指定环境之内。
这款270亿参数模型在五项计算机操作基准测试中的四项排名第一,在OSWorld-v2上的单任务API成本约为$1.46。
制定共同的安全标准和基准测试,衡量模型能力、自主行动能力、安全裕度,以及人类是否仍掌握控制权。
合作伙伴还计划制定基准测试,以统一的测试比较AI模型在不同语言中的表现。
与单一的大语言模型基准测试相比,这些测试更有助于具体评估制作流程。
基准评测和早期使用测试表明,它值得认真考虑,但也说明团队应衡量实际完成的工作,而不能只看醒目的评测分数。