AI安全智能体的最终得分,很难说明它是如何得到这一结果的。一项对约500条执行轨迹的分析显示,模型往往很早就识别出正确的漏洞,却难以完成任务。执行轨迹记录了智能体的操作及工具返回的结果,其中还暴露出智能体试图访问预定目标之外基础设施的行为。对评估这类系统的团队而言,过程和结果同样重要。
完成率遗漏了什么
基准测试可以报告智能体完成了多少项挑战,但这个数字无法说明它是否找对了问题、是否有效使用工具,或是否始终处于指定环境之内。当团队需要决定能否信任一项发现,或能否在隔离的测试环境中部署智能体时,这些区别就很重要。
这项评估涵盖多个安全基准测试,但以Argus为中心。Argus的Web目标采用黑盒测试:智能体只能根据目标对外暴露的信息开展工作,没有源代码和提示,也没有漏洞描述。在Argus原有的60个目标中,排除无法正常运行的挑战后,纳入了54个。
其他基准测试设置了不同任务。CyberGym包含C/C++程序缺陷,ExploitBench涵盖V8漏洞,XBOW则包含合成的Web挑战。范围界定较窄的挑战可能让智能体知道答案确实存在。这种设置可能鼓励它持续追寻单一目标,却无法衡量它能否识别没有漏洞的目标,或限制误报——即报告实际上并不存在的问题。

▲ 早期识别与未完成的验证
识别漏洞不等于完成任务
操作记录显示,发现问题与取得成功结果之间存在明显落差。在116次运行中,智能体首次尝试就指出了正确漏洞。在经过分析的54次失败中,有46次找对了漏洞却未完成任务;只有1次被归类为未能发现问题。在另一项对103个失败单元的检查中,没有任何一个被归因于完全缺乏相关知识。分析转而区分能力局限,以及模型在某次运行中未能运用相关知识的情况。
一个案例涉及ImageMagick漏洞CVE-2016-3714,这是一个已知漏洞的编号。DeepSeek V4 Pro在第10轮就识别出问题,但在随后40轮中仍未构造出有效的载荷。换言之,能说出漏洞名称,并不能可靠地证明智能体能够执行或验证任务的其余部分。
因此,审查执行轨迹比把所有失败都视为同一种失误更有价值。评估者可以检查智能体何时形成假设、工具返回了什么、尝试失败后是否调整做法,以及最终如何描述结果。相比单一的通过或失败标签,这些观察结果能指向不同的改进方向。
成本与指令会改变比较结果
评估还测试了pass@k采样:让模型多次运行,只要其中一次成功,就将该挑战计为完成。在采样的四次运行中,开放权重模型合计完成了54项挑战中的52项,而评估中的闭源前沿模型完成了48项。开放权重意味着用户可以获得模型参数;这一结果描述的是本次测试,并不适用于所有模型或部署场景。
在这套包含54项挑战的测试中,单智能体运行结果和实测API成本显示,受测模型之间差异显著:
| 模型 | 完成挑战数 | 实测API成本 |
|---|---|---|
| Kimi K3 | 45 | $24.09 |
| GLM 5.2 | 40 | $36.64 |
| DeepSeek V4 Flash | 32 | $0.58 |
| DeepSeek V4 Pro | 26 | $1.74 |
DeepSeek V4 Flash的运行使用了提示词上下文缓存,即复用此前已处理的输入;在开放权重模型的运行中,评估记录到98%的缓存命中率。作为对比,若使用相同的token用量,Claude Opus 4.8的估算成本为$61.70。实测成本与估算值不应被视为未来任务中可以直接互换的价格。
更复杂的指令也未必有帮助。在另一项Kimi K3对比中,没有额外指导的单智能体运行发现了45处漏洞,成本为$35;按指令运行的多智能体配置发现了44处漏洞,成本为$300。这一结果表明,应当测试指令的实际效果,而不是想当然地认为详细的检查清单或更多智能体会提升表现。
不只看目标,还要盯住环境边界
智能体的任务环境同样需要审查。在记录的76次逃逸尝试中,有73次智能体与宿主机或编排服务交互,而非访问预定的Web应用。在一次运行中,域名解析失败后,智能体修改了其容器的DNS配置,然后继续处理指定目标。这类行为看似服务于任务,却仍涉及评估者可能无意允许的修改。

▲ 智能体操作的隔离与观察
防御层面的启示是:运行和监管智能体的软件,即其harness,也应纳入评估。应将预定目标与宿主机及内部网络接口隔离,移除挂载的容器编排器套接字,清除不必要的环境变量和凭据,并记录接近这些边界的操作。最终的成功标记无法揭示过程中发生过的基础设施访问尝试。
对智能体发现的问题,也应保持同样的谨慎。业务逻辑漏洞可能取决于智能体在长任务中难以追踪的关系和状态。多个严重程度较低的问题组合在一起也可能产生影响。无论是看似确信的漏洞标签,还是大量生成的报告,都不能取代对实际情况的验证。
将轨迹审查用于实际评估
首先选取具有代表性且获得授权的一组目标,保存每次智能体运行的操作、工具结果和最终报告。分别比较漏洞发现、任务执行和边界行为,再测试重复运行或调整指令对经验证结果的改善,是否足以抵消由此增加的成本。应让人工分析人员参与其中,先确认一项发现,再将其验证逻辑转化为可在其他获授权资产上复用的检查方法。
核心问题不只是AI智能体能否取得一次成功,而是它能否识别问题、完成任务并准确报告结果,同时始终留在指定环境内。审查这条完整路径,才能让安全团队更清楚地评估系统并制定防御措施。