谷歌于9月30日发布Gemini 4 Argon,并公布了一份基准测试表,显示它在多项评测中领先竞争对手。不过目前只有指定的网络安全防御人员能够使用它。几乎同一时间,OpenAI把个人智能体平台Dots整合进了ChatGPT,Anthropic则以与Argon完全相同的价格推出了Claude Sonnet 5.5。这里所说的智能体,是指代替用户完成多步骤任务的AI系统。把这几项发布放在一起看,竞争的焦点似乎正在从基准测试分数转向两个问题:模型驱动的智能体能多可靠地使用工具,以及人们每天实际在哪个应用里工作。谷歌若想凭借Argon重新赢得开发者,看来需要对这两个问题都拿出有说服力的答案。
少数人才能试用的模型
在谷歌自己公布的基准测试表上,Gemini 4 Argon在多项评测指标中都胜过竞争对手。但由于只有一小批安全防御人员能够使用,外界实际上无从验证这些数字在真实工作中是否站得住脚。当一款前沿模型先只向少数用户开放时,其他人最好不要急于相信发布时的数据,而是等到有了广泛的实际使用体验再下判断。
保持谨慎是有前车之鉴的。Gemini 3和Gemini 3.1在基准测试图表上同样表现亮眼,但在日常工作中却让用户失望。等Argon开放后,以长期使用的结果来评判它,看来是更稳妥的做法。
价格颇具竞争力。Argon的入门价为每百万输入token $2、每百万输出token $10。token是模型读写文本的基本小单位。这一价格与Claude Sonnet 5.5相同。
| 模型 | 输入(每百万token) | 输出(每百万token) |
|---|---|---|
| Gemini 4 Argon | $2 | $10 |
| Claude Sonnet 5.5 | $2 | $10 |
| Claude Opus 5.5 | $4 | $20 |
Claude Sonnet 5.5的价格只有Claude Opus 5.5的一半,却在智能体编程基准测试Terminal-Bench 4.0中拿下70.6%,超过了Opus 5.5的64.4%。如果Argon真能达到前沿水平,这个价格是合理的;但这也意味着它进入了一个早有强劲对手的价格区间。
有待补上的功课:工具调用
Gemini上一次推出真正有竞争力的模型,可以说是2026年1月的Gemini 3。Gemini 3擅长生成前端代码,也就是应用中用户看到的部分,但不擅长工具调用,即模型调用外部工具来完成工作的能力。没有可靠的工具调用,就很难打造能够自主行动的智能体,这一短板拖了Gemini的后腿。谷歌的AI编程工具Antigravity始终没能广泛普及,看来也是因为开发者和创业者不信任其底层的Gemini模型能胜任日常工作。
Gemini也有明显的长处。它可以直接接收视频作为输入,在大约10秒内读入一整段视频并进行深入分析,这是其他前沿模型比不上的。但仅凭这一长处还不够。整个2026年,谷歌似乎都还没有推出一款让创业者和资深知识工作者每天依赖的模型。

▲ 智能体的工具调用
智能体扎根的应用
竞争对手们正在把自家应用打造成智能体工作的场所。OpenAI的Dots直接内置在ChatGPT桌面应用中。用户可以在手机版ChatGPT应用里通过语音呼叫Dots,把任务交给它。随后,Dots可以通过Slack和电子邮件向同事通报进展,并在需要时在OpenAI的编程工具Codex中开启会话,制作网页设计稿。驱动Dots的快速模型在把工作交给Codex或GPT模型之前,不会消耗套餐额度。与Dots一同推出的还有ChatGPT Space,人和智能体可以在其中共同编辑同一份文档。
Anthropic则让Claude的Projects中的主智能体为每项任务单独开启一个线程,同时处理多项工作,这些线程既可以在云端运行,也可以在用户的Mac上运行。除了ChatGPT和Claude,GrokBot和Cursor也都提供专用的桌面应用。
相比之下,谷歌的AI功能分散在Antigravity、Gemini应用、Google AI Studio和NotebookLM之间,新模型推出后该在哪里使用并不清楚。OpenAI走的是相反的路线,把ChatGPT桌面应用放在首位,让用户每逢新模型推出都有一个明确的去处。除非谷歌把各项功能整合到一个应用里,否则即使Argon实力强劲,也可能难以给用户留下来的理由。

▲ 统一应用与分散工具
现在该做什么
Gemini 4 Argon是值得欢迎的竞争者,但与其只凭基准测试就满怀期待,不如谨慎观望。以下是几条实用建议:
- 评判新模型,要看在自己工作中持续使用的结果,而不是厂商公布的基准测试表。
- Argon开放后,先从依赖工具调用的智能体任务入手测试,看看Gemini过去的短板是否已经补上。
- 如果需要快速分析视频,现在就可以利用Gemini的这一长处。
- 选择智能体工具时,不只看模型分数,还要看它与自己每天工作的应用契合得如何。
- 准备好与同价位的Claude Sonnet 5.5在成本和质量上进行并排比较。