2026年10月6日,OpenAI公开了722篇数学手稿,作者是一款尚未发布的内部前沿模型,也就是其仍在开发中的最先进模型。成果数量大约每月增长10倍:8月约10项,9月超过100项,10月第一周达到722篇。不过,真正值得关注的或许并不是数量。在前沿数学领域,难点正开始从寻找证明转向检验和理解证明。

OpenAI公开了什么

在题为“Sharing AI progress in mathematics”的公告中,OpenAI同时在GitHub上开放了一个代码库,收录722篇手稿、模型的推理过程记录、新提出的猜想以及Lean形式化证明。Lean是一种形式化证明语言,可以把证明转写成计算机能够逐行检查的代码。代码库将这些手稿归为372个系列。

发布之前,OpenAI征询了Institute for Advanced Study下属的独立咨询小组Advisory Group on Mathematics and Artificial Intelligence的意见,为成果的分享制定标准和公开建议。

时间 公开的成果
2026年8月 针对10道问题的约10项成果
2026年9月 一项纳维-斯托克斯相关成果,以及另外100多道问题的成果
2026年10月6日 横跨17个领域的722篇手稿

据OpenAI介绍,每项成果消耗的算力大致相当于ChatGPT Pro思考约3小时。这些手稿覆盖17个数学领域,从素数分布、代数学到等离子体物理和量子电路。相比之下,一位人类数学家可能要花40年时间,才能推动代数几何中的一个分支向前发展。

同样值得注意的是,这套系统并不是专攻数学的引擎,而是一款通用大语言模型,与用来起草邮件、编写代码、创作短诗的模型属于同一类型,而且在没有针对具体领域进行调整的情况下完成了这些工作。

机械臂把一个新文件夹放上巨大的书架,架上成组排列着数百个发光的手稿文件夹

▲ AI撰写的数百篇数学手稿

三项突出成果

该模型并没有完全解决黎曼猜想或P与NP问题,它带来的是对多个长期难题的局部进展。

准黎曼猜想的0.875边界

黎曼猜想研究ζ函数的零点位于何处,这与素数如何分布直接相关。伯恩哈德·黎曼在1859年设定的目标是0.5临界线。人类数学家此前排除了1.0这条线,并逐步缩小零点可能存在的区域。这次,模型确立了一条固定在0.875的边界,对ζ函数和所有狄利克雷L函数处处成立。

这类边界可以用云雾笼罩的山峰来理解。登山者看不到山顶,但只要抵达某个位置,就能证明这座山至少有那么高。0.875这条线,就是如今已被牢牢站稳的高度。

贝赫和斯维纳顿-戴尔猜想

贝赫和斯维纳顿-戴尔(BSD)猜想研究椭圆曲线的解。模型针对Selmer余秩为0或1的一大类曲线,给出了完整公式。

戈德菲尔德猜想

戈德菲尔德猜想认为,有理数域上的椭圆曲线中,有理解只有有限个的和有无穷多个的各占一半。模型打通了通往预测中解析秩五五开分布的最后一段桥梁。

这些成果都没有申领克雷数学研究所$100万的千禧年大奖,因为奖金要求给出完整证明。尽管如此,它们可能是这些问题自20世纪70年代末和80年代以来最大的结构性进展。

新的瓶颈在于验证

一天之内发布722篇高深论文,问题随之而来。全世界具备评审此类成果专业能力的数学家只有几百人,最多上千人;而审阅一篇人类撰写的手稿,通常就需要数周到数月。

Lean改变了其中一部分局面。凡是已经形式化的证明,机器都可以自动检查其逻辑。正因如此,数学的核心问题正从“能否证明”转向“能否验证和理解”。

需要注意的是,这722篇手稿尚未经过数学界的完整同行评审。其中一些可能存在细微错误或幻觉,也就是看似合理但实际错误的内容。即便是这些错误也有价值,因为它们能揭示模型的推理在哪里出了问题。如果90%以上的证明经得起检验,这次发布有望成为数学史上最大的突破。

并非所有人都欢迎这种做法。数学界的批评者强烈反对在没有经过常规学术流程的情况下,把722项自动生成的成果直接发布到网上。25位菲尔兹奖得主联署公开信,警告AI可能把数学从人类的探索变成工业化的验证工作。公开信追问:数学的目标究竟是维系一个跨越世代积累理解的人类共同体,还是只为AI系统源源不断地输送经过验证的猜想?计算机科学家斯科特·阿伦森也提到,数学界流传着OpenAI已掌握其他重大未解问题答案的传言,其中包括纳维-斯托克斯方程解的存在性与光滑性问题。

几位数学家在长桌前审阅堆到天花板的文稿,其中一人正在使用笔记本电脑

▲ 等待人工评审的手稿

为什么是数学,为什么是现在

OpenAI之所以在数学上发力,似乎是因为用来比较模型的常规基准测试已经趋于饱和。尚未证明的数学问题有一个难得的特点:结果可以被客观检验,因此是检验前沿智能的理想试验场。

这些成果还可能反哺AI本身。一位OpenAI研究人员认为,纯数学的突破会推动机器学习算法、矩阵乘法和AI芯片设计的改进。谷歌的AlphaEvolve和Sakana AI的研究已经表明,自动化发现正在影响下一代AI系统的设计。如果成果继续以每月10倍的速度增长,把同样的方法用于机器学习研究,可能会加快AI实验室自身的工作。

下一个可能是生物学和医学

数学之所以最先受到冲击,是因为证明是形式化的,可以由计算机验证。生物学和医学依赖真实世界的试验,速度更慢,也更难自动化。因此,数学可能是实证科学未来处境的早期信号。

设想未来某个模型针对重大疾病提出722种新药化合物,验证难度将远远超过检查证明。社会或许不得不做出选择:是放慢AI发现的速度,让它与人类的理解速度相匹配,还是在人们并不深入理解其原理的情况下继续推进。对于先进AI研究是否应暂停,直到有了安全保障,研究人员的看法也存在分歧。

在这背后还有一个更深层的问题:AI会提升人类的理解,还是会走到人类无法跟上的地方?黑猩猩能理解当作工具使用的树枝和骨头,但面对火、车轮和直升机时,理解就中断了。如今,真正理解前沿数学的人只占极少数。ChatGPT之类的工具可以解释艰深的概念,但AI的发现确实存在越过人类再也无法追踪或验证的边界的风险。

值得关注什么,可以做什么

AI产出数学成果的速度已远远超过人类的检验速度,验证成了制约环节。几点实用建议如下:

  • 关注数月间的增长曲线,而不只是单篇论文的质量。
  • 如果对某个领域感兴趣,可以浏览OpenAI公开的代码库,查看手稿、推理过程记录和Lean代码。
  • 借助ChatGPT之类的工具把艰深的论文拆解成通俗的语言,同时确认成果背后是否有Lean形式化验证。
  • 跟踪数学界的验证结果。经得起检验的证明所占比例,很可能决定这次发布的真正分量。
  • 把数学领域的变化视为生物学、医学乃至AI研究本身的先行指标。