Claude Opus 5.5在实际工作中展现了最有说服力的能力:直接给出文字回答、用代码生成动画,并制作交互式网页设计。为期两周的模型测试与工作流集成使用了价值约$3000的API token,即模型处理文本的计量单位。Anthropic发布Opus 5.5仅两小时后,OpenAI就推出了GPT-6 Sol和GPT-6 Luna。这一时间点自然引发比较,但本文详述的工作样例来自Opus 5.5,而非对三款新模型开展的同题测试。

未标注的彩色评测方块,与空白纸张图形和交互式布局卡片分开摆放

▲ 基准分数与实际产出

这一区别很重要:基准测试(即标准化性能测试)与一件完成的作品所回答的问题并不相同。Anthropic的内部对比表显示,Opus 5.5相较GPT-6占优。但该表并未分别展示Sol和Luna在下文所述写作、动画及设计任务中的表现。

数字比较的是什么

指标 报告结果 对比对象
基准测试 Opus 5.5在9项中领先7项 Anthropic内部表格中的GPT-6
运行成本 低40% 此前的Opus档位
输出生成速度 高30% 此前的模型

成本和速度数据不能证明Opus 5.5在价格或速度上优于GPT-6 Sol或GPT-6 Luna。基准测试表也没有提供与这两款新变体的同题对比。从这些结果看,Opus 5.5似乎表现强劲,但要为具体工作选择模型,仍需检查它在该任务上的产出。

直奔重点的写作

一位Anthropic工程师表示,Opus 5.5此次更新着重提升语句清晰度、将重要信息放在前面,并遵守用户的写作要求。与Claude Opus 5相比,它的排版不那么密集。在一个实际技术问题示例中,Opus 5.5没有以寒暄式的铺垫开场,而是直接给出诊断。

当用户需要尽快用上答案时,这种表现可能和分数一样重要。此次测试认为,Opus 5.5的文字比早期版本更自然、直接,但这仍是定性判断。这不能证明GPT-6 Sol或GPT-6 Luna面对同一提示词会更啰唆;本次比较并未纳入这两款模型的对应写作样例。

动画测试及一个值得注意的限制

Opus 5.5接到的任务是制作一部动画短片:以单个自包含的HTML文件交付,使用原生JavaScript的canvas绘图,并通过Web Audio API生成声音。Canvas可用于在网页中绘制图形;Web Audio API则让代码能够生成声音。最终动画呈现了一颗多彩的球穿行于水彩风格的风景之间,画面中还有船只和飞鸟。相比生成静态图片,这项测试要求更高,因为模型必须安排不断变化的画面和连续的场景。

动画画面中,一颗鲜亮的球穿过水彩风景,附近有一艘小船和远处的飞鸟

▲ 代码生成的风景动画

输出包含约1300行代码,分布在一个HTML文件和一个辅助渲染脚本中。任务要求以单个自包含文件交付,因此即使视觉效果颇具吸引力,额外的脚本仍值得注意。另一个创意编程示例也使用JavaScript绘图和生成的音频,制作了一个多场景故事。这些样例共同表明,Opus 5.5能够编写相当规模的动画代码;但它们不能说明模型无需修改就能满足每一项交付要求的频率。

设计:不仅是代码,更是可查看的成果

在Claude Projects中,Opus 5.5为一个商业预告页面生成了带有样式、可交互的预览。设计包含字体排版选择、流动的渐变图形,以及适配手机屏幕的响应式布局。它还制作了一份七页演示文稿,将Anthropic的基准测试和性价比数据可视化。这些成果可以直接在Claude中查看,而不只是需要到别处组装的原始代码块。

这一区别改变了评价方式。对于前端工作,值得关注的问题包括:布局能否传达预期信息、在手机尺寸下能否正常呈现,以及后续修改是否方便。这些样例显示了Opus 5.5完成度较高的初步产出,但不能据此断定Sol或Luna无法制作出同等水平的设计。它们也不能取代对最终页面内容和行为的审查。

如何让比较更有用

从实际样例来看,简洁写作、创意编程和视觉前端工作都值得试用Opus 5.5。基准测试数据提供了背景信息,但不能代替在与你相关的任务上直接测试GPT-6 Sol和GPT-6 Luna。有针对性的比较不必复杂:

  1. 向每个模型提出相同的写作要求,包括期望篇幅和先给出答案的要求。比较文字的清晰度和所需的编辑量。
  2. 如果工作涉及动画或网页设计,明确交付成果和文件限制。既检查可见效果,也核对文件是否符合要求。
  3. 记录审查和修正每份产出所花的时间。如果修正智能体工作的耗时超过手动完成任务,就应调整工作流,而不是认为基准测试的领先能解决问题。

Opus 5.5的工作样例提供了试用它的理由,但现有数据尚不能回答它与Sol、Luna孰优孰劣。可以用分数表决定要研究什么,再根据同题任务、可用的产出,以及工作所需的审查投入作出选择。