Claude Opus 5.5为开发者提供了一个性能更强、成本也可能更低的编程和知识工作选择,但最昂贵的设置不一定是最合适的。Anthropic称,与Claude Opus 5相比,该模型完成同等任务的总成本降低了40%。基准评测和早期使用测试表明,它值得认真考虑,但也说明团队应衡量实际完成的工作,而不能只看醒目的评测分数。
哪些方面取得提升,哪些方面没有
Claude Opus 5.5面向智能体编程而构建。在这类任务中,模型使用工具完成多步骤开发工作。与Claude Fable 5.1相比,它在基于终端的编程和知识工作评测中取得了较大提升。Elo分数是一种用于比较表现的相对评分;GDPVal-AA评分越高,表示在该评测中的表现越强。
| 评测 | Claude Opus 5.5 | Claude Fable 5.1 | GPT-6 Astra |
|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 55.8% | 57.9% |
| FrontierCode v1.1 | 54.4% | 50.3% | 53.3% |
| GDPVal-AA v2.1 | 1846 Elo | 1735 Elo | 1542 Elo |
| AutomationBench | 40.0% | 28.9% | 41.4% |
| Terminal-Bench Science | 58.7% | 52.6% | 64.6% |
| Humanity’s Last Exam with tools | 67.7% | 65.6% | 57.2% |
整体表现比单项排名更值得关注。Claude Opus 5.5在通用终端工作流、FrontierCode、GDPVal-AA和使用工具的Humanity’s Last Exam评测中领先,但GPT-6 Astra在AutomationBench和Terminal-Bench Science上仍占优。在另一项CursorBench 4.0评测中,Opus 5.5得分为57.8%,Claude Fable 5.1为51.8%,Claude Opus 5为46.6%。它在计算机操作和图表识别方面的提升则较小,两项成绩分别为81.8%对80.7%、89.0%对88.4%,表明提升幅度因任务而异。
成本问题不只是Token单价
API,即应用程序编程接口,使软件能够向模型发送请求。API账单按Token计费,Token是模型读取和生成文本的计量单位。与Claude Opus 5相比,Claude Opus 5.5的各项标价均有所降低:
| 每百万Token价格 | Claude Opus 5.5 | Claude Opus 5 |
|---|---|---|
| 输入 | $4.00 | $5.00 |
| 输出 | $20.00 | $25.00 |
| 提示词缓存读取 | $0.20 | $0.50 |
| 提示词缓存写入 | $5.00 | $6.25 |
提示词缓存用于保存可重复使用的上下文,应用程序便不必在每次请求时都完整处理这些内容。缓存读取价格降低了60%,标准输入和输出价格均降低了20%。Anthropic还称,Opus 5.5生成Token的速度比Opus 5快30%以上。其所称的同等任务总成本降低40%,不仅反映了标价变化,也反映了Token用量减少和执行速度加快。这一数字仅代表Anthropic所报告的对比结果,并不意味着每种部署都能省下同样多的成本。Pro、Max和Team订阅用户的使用额度也提高至原来的五倍。

▲ 推理强度与任务成本
推理强度,即分配给一次回答的思考量,也会改变成本计算。可用档位包括低、中、高、超高和最高。在AutomationBench上,中档推理强度以每项任务远低于$0.80的成本,达到约30%的通过率。GPT-6 Astra的通过率达到40%,但每项任务成本接近$2.00。在Terminal-Bench 4.0上,Opus 5.5采用高档推理强度时,每次尝试成本约为$4.00,准确率超过66%;Astra采用最高档推理强度时,准确率约为58%,每次尝试成本超过$10.00。
增加推理强度并不一定能得到更好的答案。在FrontierCode v1.1上,Opus 5.5成本低于$1.00的中档设置,表现优于成本超过$5.00的最高档设置。表现曲线并非稳步上升,而是起伏不均。对于选择默认设置的团队,中档和高档比最高档更值得优先尝试;合适的档位仍取决于任务以及一次失败尝试的代价。
早期实际工作测试揭示了什么
基准评测无法完整描述模型在应用程序中的表现。在一个早期企业案例中,一名测试人员用不到24小时迁移了一个包含68万行代码的代码仓库。在全栈Web开发测试中,Claude Opus 5.5首次尝试便完成了40项任务中的39项。这些是值得关注的个别结果,不能据此预测它在另一家机构的代码仓库或应用程序中的表现。
输出更便于审查,也是一项切实的改进。在一项计费系统重构修复的说明对比中,Opus 5.5把发现的问题和代码改动放在开头,而不是先写对话式文字。当多个智能体同时工作时,这种格式可能有助于人工检查改动。它在视觉设计、前端样式和3D网页开发方面的提升看起来也有前景,尽管这些质量更难用单一基准分数衡量。
模型的配套运行环境同样重要。运行框架由系统指令、工具定义和执行环境组成,使模型能够采取行动。Opus 5.5在工具调用方面有所提升,也就是更善于选择和使用合适的软件工具。Anthropic精简了部分默认系统提示词,并发布了一套插件评估套件,用于测试自定义工具和技能究竟是帮助了模型,还是限制了模型。对开发者来说,实际启示是测试现有指令和工具描述,而不要想当然地认为增加内容就能改善结果。
部署仍须考虑安全控制
Anthropic称,该模型在其综合对齐评估中取得了迄今最高分。这类评估衡量模型在多大程度上遵循预期行为。发布前测试还包括外部评估人员参与的评估、自动化行为审计,以及持续时间更长的测试场景。检查内容包括提示词注入,即模型处理的材料中嵌入指令,试图改变其行为;还包括刻意设计的不可能完成的任务,用于发现不可靠的走捷径行为。

▲ 模型安全防护与评估
Anthropic对先进的生物学和网络安全能力实施严格的安全防护和访问控制。通过Life Sciences Verification Program和Cyber Verification Program,部分能力仅向获得批准的机构开放。对于考虑部署的企业,更强的编程性能并不意味着可以忽略这些控制措施,也不能省去在自身工具和权限环境中评估模型行为的步骤。
如何决定是否切换
Claude Opus 5.5最有说服力的定位,是日常编程和知识工作的默认模型候选:它在多项主要评测中表现更强,同时API价格更低、Token生成更快。但它并非在所有测试中都领先,早期使用案例也无法证明它在不同工作流中的表现会有多稳定。已经使用Claude Fable 5.1处理重大规划、架构设计或关键审查任务的团队,可能需要分别比较这些任务,而不是一次性全部迁移。
一种直接有效的试用方法是:选取当前工作流中的代表性任务,分别以中档和高档推理强度运行,检查实际完成的工作及其人工审查负担,并与现有模型比较每项成功任务的总成本。如果应用程序会重复使用上下文,计算时应纳入提示词缓存。如果依赖自定义工具,则应使用插件评估套件,并检查冗长的指令是否仍有帮助。与单看基准评测领先或Token单价更低相比,这些实测结果能为是否切换提供更可靠的依据。