谷歌9月30日发布的Gemini 4 Argon,主打企业知识工作、软件工程和网络安全防御方面的前沿性能。发布者是谷歌DeepMind高级副总裁兼谷歌首席AI架构师Koray Kavukcuoglu。从谷歌自己公布的基准测试表来看,Argon在业务和自动化任务上明显领先,但并非全面领先;而且目前除了一小部分安全防御人员外,几乎没人能使用它,因此下面的大部分数据都是谷歌自行公布的。下面梳理Argon在哪些方面领先、哪些方面落后、价格如何,以及谷歌称已在内部用它做成了什么。

成绩单:智能体工作领先,编程互有胜负

谷歌将Argon与GPT-6 Astra、Claude Fable 5.1和Claude Opus 5.5进行了比较。

基准测试 Gemini 4 Argon GPT-6 Astra Claude Fable 5.1 Claude Opus 5.5
Vals Index(知识工作) 68.9% 63.1% 65.8% 67.0%
AutomationBench 51.3% 41.4% 31.4% 42.5%
Vals Finance Agent v2 65.4% 53.5% 58.9% 58.6%
Harvey Legal Agent Benchmark 19.6% 5.4% 6.7% 3.8%
DeepSWE v1.1 77.9% 74.1% 67.4% 74.2%
Vibe Code Bench 91.9% 89.6% 90.3% 90.3%
FrontierSWE v2 55.0% 65.5% 56.3% 62.3%
Terminal-Bench 4.0 57.4% 58.2% 57.9% 66.4%

差距最大的,是智能体(能自主完成多步骤任务的AI系统)承担实际业务的领域:知识工作、工作流程自动化、财务分析和法律任务。在法律智能体基准测试中,竞争对手的得分在3.8%到6.7%之间,而Argon达到19.6%。编程方面则互有胜负。Argon在DeepSWE v1.1和Vibe Code Bench上领先,但在FrontierSWE v2上落后于GPT-6 Astra,在测试命令行工作的Terminal-Bench 4.0上则明显落后于Claude Opus 5.5。与其说是全面胜出,不如说是跻身顶尖行列、与对手旗鼓相当。

独立评测也指向同一方向。在Artificial Analysis的评测中,以高推理模式运行的Argon在测试智能体SaaS工作流程的AutomationBench-AA上以78%排名第一,在Terminal-Bench 4.0上取得52%,接近榜首。这些进步看起来更像是能力的全面提升,而不是针对特定基准刷分的结果。

100万token输出上限与入门价格

Argon单次回复最多可生成100万个token,是此前6.4万token上限的16倍。token是模型读写文本的基本单位。输出上限与模型一次能读取的输入量、跨会话保留的记忆是不同的概念;它对长链条推理和一次性生成跨多个文件的大规模代码改动很有意义。

API入门价格为每百万输入token $2、每百万输出token $10,缓存输入享受95%折扣。由于这是发布时的价格,未必能长期维持。

AI核心并排输出一张短纸条和一张极长的纸条

▲ 大幅提升的输出上限

谷歌称Argon已经做到的事

谷歌内部已有数千名工程师在开发和研究中使用Argon。谷歌举出的例子包括:

  • 量子计算:在优化量子算法的量子比特和量子门资源时,Argon用40分钟就比已发表的基准结果提升了40%。
  • 数据中心内存:Argon智能体分析了整个机群的性能剖析数据,释放出300多TiB内存,预计最终可节省500TiB到1PiB。在谷歌的规模下,即便是微小的优化也能积累成可观的节省。
  • 迁移到Rust:智能体正在把C和C++代码迁移到内存安全的Rust,其中包括谷歌Fuchsia操作系统Zircon内核的80多万行代码。
  • 视频解码:在谷歌的开源视频解码器libgav1中,智能体审查了现有的Rust移植版本,替换了3.2万行SIMD代码。新版本输出完全相同的视频,速度比之前的Rust移植版本快2.7倍。

libgav1的工作展示了这些智能体的工作方式。它们反复进行基于性能剖析的实验,检查编译器输出,并重新调整Rust代码,让编译器能够自动向量化,也就是把循环转换成一次处理多个数值的指令。提出假设、用可衡量的目标检验、保留有效的改动,并且昼夜不停地重复,这与安德烈·卡帕西描述过的自动化研究循环相似。不过,这些是谷歌自己展示的成果,可能是从大量尝试中挑出的最佳结果。

机器人们在循环中打磨代码块,旁边的速度表不断上升,背景是服务器机柜

▲ 反复实验的代码优化

为何你大概还用不上

Argon正在分阶段推出。目前只有参与谷歌Fairwind Program的可信网络防御人员可以使用,这一安排与美国政府的模型发布前访问规程相协调。下一批是Ultra套餐的付费API用户,个人开发者和普通用户还需要等待。

这也意味着独立开发者暂时无法亲自核实谷歌的数据。早期结果看起来很有希望,但Gemini 4究竟好多少,还要等广泛、独立的实际测试之后才能下定论。

等待期间可以做什么

Argon让谷歌重回第一梯队:在自动化和知识工作上优势明显,在编程上则与对手难分高下。在开放使用之前,可以先做以下准备:

  1. 把Argon领先幅度最大的任务,例如工作流程自动化、财务分析和法律文书工作,列为首批试用对象。
  2. 如果打算用于命令行编程智能体,准备用相同任务与Claude Opus 5.5和GPT-6 Astra进行对比测试。
  3. 把发布时的基准成绩视为谷歌自己的结果,获得使用权后用真实工作负载重新验证。
  4. 每百万输入token $2是入门价格,做预算时要留出余地。
  5. 梳理需要超长输出的工作,例如大规模代码生成,100万token的上限可能改变一次能完成的事情。