本周最有用的AI新闻,与其说是排行榜之争,不如说是价格、速度以及人们实际使用这些工具的方式。Anthropic发布了Claude Haiku 5.5,这是一款面向低成本、大批量任务的小型模型。OpenAI开启了为期28天的每日发布,并向所有用户开放了GPT-6和Intelligent UI。xAI则把Grok Bot变成了可以把任务交给其他公司模型的助手。下面梳理有哪些变化、费用多少,以及各项发布值得在哪些场景尝试。
Claude Haiku 5.5以顶尖智能换取低成本
Anthropic称Claude Haiku 5.5是其速度最快、性价比最高的小型模型。它面向的是摘要、数据压缩、数据库查询和分类等重复性强、数量大的工作,而不是最前沿的推理。在软件开发中,Anthropic建议把它作为子智能体,也就是承接大模型分派的小任务的助手,与Sonnet 5.5或Opus 5.5搭配使用。
在基准测试中,Haiku 5.5追不上更大的模型,但相比上一代Haiku进步明显。
| 基准测试 | Haiku 5.5 | Sonnet 5.5 | Haiku 4.5 |
|---|---|---|---|
| GDPval-AA v2.1,知识型工作 | 1620 | 1840 | 735 |
| AA-Briefcase v1.1,知识型工作 | 1578 | 1824 | 614 |
| OSWorld 2.1,计算机操作 | 72.4% | 83.9% | 15.7% |
OpenAI的GPT-6 Luna在GDPval-AA v2.1上得分为1437。Haiku 5.5在Humanity’s Last Exam上不使用工具得分45.9%,使用工具得分57.4%;在智能体编程测试Terminal-Bench 4.0上得分39.2%;在FrontierCode 1.1和视觉推理测试Chartography上均为46.4%。
更值得关注的是每一美元换来的准确率。Claude允许用户把effort,即模型作答前思考多久,从Low设到Max。在OSWorld 2.1上,extra-high effort下的Haiku 5.5以每次尝试$0.28的成本达到67.6%的准确率;medium effort下的Sonnet 5.5则以每次$0.93达到66.0%。在这项测试中,让小模型多想一会儿,就能以不到三分之一的成本追平大模型。
| 每百万token价格 | Haiku 5.5,提示词不超过10万token | Haiku 5.5,超过10万token | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|---|
| 输入 | $0.10 | $0.50 | $1.00 | $2.00 |
| 输出 | $0.50 | $2.50 | $5.00 | $10.00 |
token是模型读写文本时使用的小单位,也是计价单位。缓存读取为每百万token $0.01(超过10万token为$0.05),缓存写入为$0.125(超过10万token为$0.625)。在Artificial Analysis的独立排行榜上,Haiku 5.5的智能指数排在Kimi k3、GLM 5.3和Grok 4.7之后,但每项任务约$0.21的成本处于最低一档。它输出偏多,每项任务产生的推理和输出token仅次于Sonnet 5.5,但较低的单价仍让总费用保持低廉。
Haiku 5.5在哪里划算
使用每月$20及以上Claude付费套餐的用户,在聊天窗口里大概仍会继续用Sonnet或Opus。Haiku 5.5最能体现价值的地方,是token节省会不断累积的场景:API自动化、Claude Code和智能体工具。Anthropic建议的组合是由大模型负责规划和判断,Haiku 5.5处理代码查找、格式整理等快速子任务。

▲ 大模型向小型子智能体分派任务
Claude新增Dashboards和Motion
Anthropic还发布了两款把业务数据变成可视化内容的工具。Claude Dashboards可直接连接Google BigQuery、Databricks、Snowflake和Salesforce等数据仓库与CRM平台,并据此生成实时仪表盘,目前在付费套餐中以测试版提供。与此同时,Claude Docs、Slides和Design已结束测试,包括Free在内的所有套餐均可使用。
Claude Motion可以在Claude内把提示词和想法变成动画讲解视频和动态图形。一个示例把两个站点之间的共享单车出发情况做成了38秒的动画。目前Motion仅限Team和Enterprise套餐使用。个人Pro订阅用户(每月$17-20)和Max订阅用户(每月$100-200)都无法使用。这意味着,每月$20的Team席位能用到的功能,以抢先体验为卖点之一的每月$200的Max套餐却用不到。对个人重度用户来说,这一安排似乎令人费解。类似的动画此前也能用JavaScript或Remotion等框架制作,但直接在Claude中渲染可能会大幅缩短制作过程。
OpenAI的28天连续发布
OpenAI表示,将从10月4日起连续28天,每天推出一项产品改进或一次重置。第一周就已带来多项用户能切实感受到的变化。
GPT-6与Intelligent UI
10月7日,OpenAI向所有用户开放了GPT-6和Intelligent UI,同时改版了ChatGPT界面。Intelligent UI用图形、可点按的按钮、输入表单、交互式图表等控件,取代回答中的大段文字。
- 组装自行车:展示一辆7速自行车的爆炸图,可以单独查看车架、车轮、传动系统、刹车或车把区域
- 规划晚餐:周日烤羊肉,附带按人数计算肉量的工具、食材卡片和备菜时间表
- 旅行:为期七天的意大利婚礼之旅,按天搭配服装,提供灵感图片卡片和交互式行李清单
- 小工具:在对话里直接做出一个五人分摊账单的计算器
把思考程度设为Instant后,询问四冲程发动机的工作原理,几乎立刻就能得到进气、压缩、做功、排气各阶段的图解。OpenAI的一项内部智能体评测显示,GPT-6在准确率更高的同时,把响应时间从215秒缩短到109秒。
速度、审批与会议记录
- 10月5日:GPT-6 Astra和GPT-6.1 Sol的默认生成速度在订阅产品和合作伙伴API中提升了约50%。
- 10月6日:ChatGPT Work和Codex向所有已登录账户免费提供Auto-review。权限菜单现在有三个选项:Ask for approval、Approve for me和Full access。选择Approve for me后,会由另一个智能体监督执行任务的智能体,只在操作风险较高或偏离用户意图时才询问用户。目的是免去在长任务中逐步审批的疲劳。
- Meetings插件:面向macOS版ChatGPT桌面应用的Pro和Business用户,以测试版提供。它在Zoom、Google Meet或Slack通话中同时采集系统音频和麦克风,生成摘要和后续事项,并把记录保存在ChatGPT的记忆中,方便之后起草跟进邮件或更新计划。
- 开发者平台:Decisions API进入公开测试,它返回快速、结构化的判断,而不是长篇文字。OpenAI还把原来的五档速率限制合并为Build、Launch和Grow三档。API累计消费达到$500的账户可升至Grow,前沿模型每分钟最多可用4000万token,Luna每分钟最多可用1.8亿token。
Ultrafast与Instant Steering
10月8日,OpenAI在Codex、ChatGPT Work和API中为GPT-6.1 Sol加入了Ultrafast模式。它的生成速度最高可达标准Sol的8倍,但价格也高得多。
| GPT-6.1 Sol速度 | 相对标准的速度 | 每百万token输入 | 每百万token输出 |
|---|---|---|---|
| Standard | 1倍 | $2 | $10 |
| Fast | 2倍 | $4 | $20 |
| Ultrafast | 最高8倍 | $12 | $60 |
Ultrafast的价格是标准的6倍,在ChatGPT中使用还需要每月$500的Pro套餐。除非延迟确实是瓶颈,比如面向用户的实时应用、交互式编程或操控桌面的智能体,否则这笔溢价似乎难以说得过去。
ChatGPT Work中的Instant Steering可以在回答仍在生成时改变方向。先要一张狗的图片,再排入改成狼的请求并按下Steer,任务会立即转向,而不必等第一个请求完成。一旦发现输出开始跑偏就能马上纠正,既节省等待时间,也节省算力。

▲ 用可视化界面元素作答的ChatGPT
Grok Bot开始把任务交给其他公司的模型
埃隆·马斯克宣布,Grok Bot将把每项任务发送给最合适的模型,其中包括Claude Opus 5.5、Midjourney和Suno等外部模型。xAI的这款助手不再只局限于自家模型,只要外部模型更可能做得好,就会调用外部模型。鉴于目前前沿基准测试由Anthropic的模型领跑,能用上Claude Opus 5.5看来是一项实实在在的优势。
Grok Bot现在还能搜索、阅读和监测X上的帖子。它可以追踪某个细分领域的升温话题,发现正在获得关注的帖子,并根据互动数据建议发帖时间表。它的设计也不同于Dot或Muse这类单线程助手,而是使用专门的智能体,例如连接Gmail并起草回复的Email Triage,以及跟踪行业新闻和新论文的Research Bot。Chief of Staff智能体接收高层指令,再把任务分派给合适的专门智能体。在一个例子中,它分析了某个账户最近75条帖子,找出互动最强的时段,并起草了新的帖子构想。把多步骤的事务性工作拆给专门的智能体,而不是全部塞进一个对话,看来是更灵活的做法。
其他值得了解的发布
- Mistral Large 4:一款开放权重模型,即公开训练好的权重供他人运行;它采用混合专家架构,每个token只激活网络的一部分。模型总参数为1万亿,参数指模型内部学到的数值,每个token激活520亿。Mistral AI称其性能与中国实验室的领先开放权重模型相当。
- Reflection Beam:总参数5010亿、激活参数230亿的开放权重模型,Reflection称其使用25.8万亿token进行了预训练。目前尚不能下载。这两款模型都面向自建服务器的企业,而不是个人电脑。
- Google Playground:一款实验性网页应用,只需文字描述就能生成可玩的2D和3D游戏,面向美国18岁及以上用户开放。
- Google AI Edge Foresight:一款macOS应用,用设备端模型转写和总结会议,音频和记录都不会离开电脑。
- Gemini Agent:Google Cloud的企业级智能体,可在数小时到数天内持续执行长任务而不丢失上下文,并连接Google Workspace、Microsoft 365、Slack、Salesforce、Jira和GitHub。
- SynthID Detector:一款公开工具,可检测图片、视频和音频中隐藏的数字水印。它只能确认来自支持方的带水印内容,无法识别所有AI生成的媒体。
- Hark Pro:Figure创始人布雷特·阿德科克推出的计算机操作智能体,可直接操作屏幕,完成日用品补货、提交报销单据和取消订阅等事务。
- Meta Muse:Meta开源了在Raspberry Pi或ESP32开发板上运行Muse的硬件设计和代码。
- Anthropic使用政策:禁止没有研究目的、持续且不必要地虐待Claude的行为。普通的不满情绪、刻意寻找弱点的红队测试以及模型测试不在此列。
- 就业前景:诺贝尔奖得主、经济学家达龙·阿西莫格鲁估计,未来10年AI只会取代约5%的人类工作,这一观点出自微软AI负责人穆斯塔法·苏莱曼分享的一篇文章。这比业界常见的几乎全面自动化的预测要谨慎得多。
本周可以尝试的事
这些发布的共同点,是以更低的成本、更快的速度和更少的打断完成同样的工作。各家公司的计算机操作智能体也在不断涌现,随着功能趋同,最终的选择可能取决于你已经在用哪个生态。
- 如果你通过API或Claude Code运行重复性任务,可以把分类、摘要、查找等子任务转给Claude Haiku 5.5,对比一下账单。
- 在ChatGPT中,用Instant询问计算、日程或原理说明这类适合图示的问题,看看Intelligent UI会生成什么。
- 如果把长任务交给ChatGPT Work或Codex,可以试试Auto-review中的Approve for me,高风险操作仍会回到你这里确认。
- 只在延迟确实关键的场景考虑Ultrafast,并先权衡6倍的价格和每月$500的套餐。
- 选择会议记录工具时,以数据存放位置为准:Meetings插件把记录保存在ChatGPT中,而Google AI Edge Foresight在Mac上完成全部处理。