Claude Sonnet 5.5在一项编程基准测试中领先Claude Opus 5.5,其输入和输出token价格也只有后者的一半。但这两点并不意味着每项编程任务的成本都会减半。两款模型的缓存读取价格相同,而一项任务所用的计算量可能大幅改变其总成本。因此,实际比较需要同时考察团队实际使用的effort设置下的准确率和支出。
Anthropic于2026年9月28日发布Claude Sonnet 5.5,比Claude Opus 5.5晚一周。据介绍,在常规工作负载上,新模型比Claude Sonnet 5快约30%,成本低约30%。这是与上一代Sonnet模型的比较,与和Claude Opus 5.5的每token价格比较是两回事。
编程结果因测试而异
智能体编程基准测试衡量AI系统处理需要多个步骤的软件任务的能力。在Terminal-Bench 4.0上,Claude Sonnet 5.5在最高effort下达到70.6%,而Claude Opus 5.5的成绩为54.4%。Claude Sonnet 5在该测试中仅得10.2%,新模型的提升幅度也很明显。但在对比中的另外两项编程基准测试上,Claude Opus 5.5领先。

▲ 各编程测试结果不同
这些结果并不支持任何一款模型在编程上全面更强的说法。不同测试的结果各不相同,而Claude Sonnet 5.5自身的分数也会随effort设置变化,即模型为一次请求投入的计算量。
| 编程基准测试 | Claude Sonnet 5.5 | Claude Opus 5.5 |
|---|---|---|
| Terminal-Bench 4.0 | 最高effort下70.6% | 54.4% |
| CursorBench 4.0 | High effort下52.9%;最高51.5% | 57.8% |
| FrontierCode v1.1 | High effort下49.4%;最高46.2% | 54.4% |
在Terminal-Bench 4.0上,随着effort从中等升至最高,Claude Sonnet 5.5的表现不断提升。CursorBench 4.0和FrontierCode v1.1则说明,不应认为这一规律适用于所有编程任务:两项测试中,Sonnet在最高effort下的分数都低于High effort。Terminal-Bench上的领先值得关注,但仅凭一项基准测试,无法判断两款模型在团队自身软件工作中的高下。
token单价减半不等于任务成本减半
API按token计费,token是模型处理或生成文本的单位。Claude Sonnet 5.5的缓存写入、输入token和输出token公布价格,恰好是Claude Opus 5.5的一半。缓存读取即复用已存储的输入,两款模型价格相同。
| API计费项目 | Claude Sonnet 5.5每百万token | Claude Opus 5.5每百万token |
|---|---|---|
| 缓存读取 | $0.20 | $0.20 |
| 缓存写入 | $2.50 | $5.00 |
| 输入 | $2.00 | $4.00 |
| 输出 | $10.00 | $20.00 |
按照这一价格表,“成本减半”的说法只适用于三类token,并不适用于所有工作负载的全部账单。如果任务用量中包含缓存读取,这部分不会变便宜。如果某项设置使模型消耗的token大幅增加,较低的单价也未必意味着每次完成尝试的成本更低。

▲ effort、准确率与任务成本
基准测试的成本数据让这一区别更加具体。在Terminal-Bench 4.0的最高effort下,Claude Sonnet 5.5平均每次尝试花费$12.54,尽管其公布的token单价更低,仍略高于Claude Opus 5.5在最高设置下的$11.24。在FrontierCode v1.1上,Claude Sonnet 5.5在High effort下每项任务花费$0.42,得分49.4%。调至最高effort后,每项任务成本升至$21,分数却降至46.2%。这意味着在该测试中,成本增加50倍,结果反而更差,但这并不是对编程工作的普遍价格预测。
因此,在编程任务上评估Claude Sonnet 5.5时,从High effort而非最高effort起步更有参考价值。Extra High effort也值得一试,但公布的FrontierCode成本与分数对比只涉及High和最高两档。在把任一设置视为生产环境的最佳选择之前,团队需要先用自己的任务得出结果。
更广泛的性价比评估
相关工作负载不只有编程。在覆盖44种职业的知识工作评测GDPval-AA上,Claude Sonnet 5.5得分1844,接近Claude Opus 5.5的1846,高于Claude Sonnet 5的1449。这一结果可能让较低的token单价在日常工作中更具吸引力,但它既不能消除编程基准测试上的差异,也不能证明任务层面的成本节省。
安全设置也会影响由哪款模型处理请求。当请求触发高风险网络安全或生物领域的安全防护时,Anthropic的系统会从Claude Sonnet 5.5回退到Claude Sonnet 5。在这些领域评估合规工作的机构,在解读结果时应考虑到这种可能性。
切换前需要确认什么
Claude Sonnet 5.5在Terminal-Bench 4.0上成绩突出,多数token类别的价格也更低,而Claude Opus 5.5在其余已公布的编程测试中领先。对于编程工作流,应先在具有代表性的任务上、在明确的effort设置下比较两款模型。记录准确率、所用token数和每次尝试的总成本,而不只是公布的每token价格。在认定最高effort有帮助之前先测试High effort,估算节省金额时也要计入缓存读取用量。只有这样,才能判断较低的API价格能否让重要工作的账单真正降低。