OpenAI 称已解决百余道数学难题,验证还在路上
万个智能体证明了 Navier-Stokes 爆破,其余百余项证明尚未公开

一个 OpenAI 内部模型以大约 10,000 个并发 AI 智能体的形式部署,产出了一道流体力学基本问题 —— 数学七大千禧年大奖难题之一 —— 的机器验证证明,公司还表示,同一系统已经解决了 100 多道其他的数学开放问题。但克雷数学研究所没有颁发那 100 万美元的奖金。截至 10 月 8 日,其他被声称解决的问题清单和对应的证明都没有公开。数学界的反应从有保留的参与到尖锐的怀疑不等,一场正在进行的署名权之争又给这次宣布添上了一层争议。
10,000 个智能体在 88 小时里做了什么
9 月 8 日,OpenAI 宣布,它已经产出了一份经 Lean 验证的证明,表明三维 Navier-Stokes 方程可以在有限时间内形成奇点。这份证明由一个未命名的内部模型产出,该模型被描述为「明显比 GPT-6 Astra 更强」,后者是公司公开发布的旗舰模型。该模型于 8 月 28 日开始训练,宣布时尚未公开可用。OpenAI 明确表示,不打算就这一结果申请千禧年大奖。
Navier-Stokes 的计算运行了 88 小时。大约 10,000 个模型实例并发运行,交换了约 270 万条消息,生成了约 1,300 亿个输出 token —— 所有数字均来自 OpenAI,未经独立验证。完成证明后,OpenAI 用 GPT-6 Astra 把结果形式化为 Lean 这种形式化证明验证语言,其中每一步逻辑都要对照数学公理检查 —— 这个过程又花了 17 小时。Lean 证明文件已经公开,随附一篇 166 页的分析论文,已提交同行评审。
是爆破,不是正则性 —— 也不是完整的克雷问题
Navier-Stokes 千禧年大奖关注的是,三维不可压缩方程的光滑解能否在有限时间内形成奇点。克雷研究所的问题表述 包含四个变体(A–D):陈述 A 和 B 涵盖无外力的柯西问题;陈述 C 和 D 加入了一个光滑的外力项。OpenAI 的证明表明,在这样一个光滑外力的作用下,一个涡旋可以向内旋进、拉长并形成奇点 —— 通过证明爆破确实会发生,解决了变体 C 和 D 的问题。
这在技术上是有意义的:此前不存在对有外力情形结果的形式化证明。但解决 C 和 D,不等于解决 A 或 B,而多数职业数学家认为后者才是更难、在物理上也更重要的情形。克雷奖 并不单独认可有外力情形的结果,而且截至 10 月 8 日,克雷研究所仍把 Navier-Stokes 列为有效、待数学界审查。即便这份证明通过同行评审并被广泛接受,克雷的规则还要求结果公开两年之后才能颁奖 —— 这意味着最早要到大约 2028 年底才有资格。
OpenAI 的智能体所利用的数学策略,是由马德里数学科学研究所的 Diego Córdoba 和 CUNEF 大学的 Luis Martínez-Zoroa 经过多年发展出来的,他们开创了构造流体奇点的解析技术。为克雷研究所撰写 Navier-Stokes 问题官方描述的普林斯顿大学的 Charles Fefferman 说,这个故事里真正的英雄是 Córdoba 和 Martínez-Zoroa。
一个治理小组,和一份未经验证的问题清单
9 月 21 日,OpenAI 推出了 AGMAI —— 数学与人工智能咨询小组(Advisory Group on Mathematics and Artificial Intelligence)—— 并宣布同一个内部模型已经解决了 100 多道额外的数学开放问题。这个九人小组设在普林斯顿高等研究院,成员包括菲尔兹奖得主 Timothy Gowers 和 Martin Hairer,以及数学物理学家 Edward Witten,独立于 OpenAI 运作,成员不领取报酬。小组只是咨询性质;它对 OpenAI 的发布时间表没有决定权。
AGMAI 目前的既定任务,是就如何协调发布那些被声称的额外结果向 OpenAI 提供建议。截至本文撰写时,100 多道问题的公开清单和对应的证明都没有出现。这些主张完全依赖于 OpenAI 9 月 21 日的宣布。
延伸阅读:OpenAI 称又一道百万美元数学难题取得进展,而第一道尚未获得验证
数学界有组织的回应早于 AGMAI 的宣布。9 月 11 日,25 位菲尔兹奖得主发表了 「A Severe Misalignment of AI in Mathematics」(AI 在数学中的严重失准),地址是 mathandai.org,警示仓促验证的问题,以及 AI 生成的证明可能污染数学文献的风险。签名者包括 Terence Tao(陶哲轩)、Peter Scholze、Maryna Viazovska、Manjul Bhargava 和 James Maynard。AGMAI 成员中只有一位 —— Camillo De Lellis —— 也在这封信上签了名,这反映出专家群体是分裂的,而不是一致敌对。
一场 OpenAI 部分承认的署名权之争
在 OpenAI 宣布的前一晚,纽约大学数学家 Tristan Buckmaster 发表声明说,他和 Anthropic 的数学家 Levent Alpöge 花了近一年时间,用 Anthropic 和 OpenAI 自己的工具(包括 Codex)的组合,为三维欧拉方程及相关流体系统的有外力爆破构建证明。他们经 Lean 验证的结果于 9 月 7 日发布。
OpenAI 的公告承认了这一背景:公司说,在听到 Alpöge 和 Buckmaster 已经解决了一道千禧年大奖难题的「传闻」之后,于 9 月 1 日开始这项工作。OpenAI 承认他们在欧拉结果上的优先权,并表示在 9 月 6 日联系了他们,提议同时发布,此时才得知他们解决的是有外力的欧拉问题,而不是 Navier-Stokes。OpenAI 表示,其智能体在 Buckmaster 和 Alpöge 的工作公开之前没有看过其中任何内容,随后的调查确认,Buckmaster 的 Codex 提示词「不可能以任何方式影响该系统,包括通过训练」。
Buckmaster 对这一说法的部分内容提出异议,描述了 9 月 6 日那通电话的情形,并指称受到 OpenAI 研究员 Sébastien Bubeck 的施压;Bubeck 否认了这种描述。OpenAI 没有公布调查记录,也不存在能独立核实该结论的外部审计机制。据 Quanta Magazine 的报道,各方给出的是不同的版本,细节仍然不清。这场争议是千禧年大奖相关 AI 研究中第一起引人注目的署名权冲突,在这个领域,工具使用与共同发现之间的界线尚无先例可循。
延伸阅读:泄露显示:谷歌内部数学 AI 瞄准了一道未解的数论难题
FrontierMath 的轨迹与竞争格局
9 月 8 日的结果反映了一条可测量的能力曲线。在 Epoch AI 的 FrontierMath 第四级基准 —— 它测试研究级别的数学推理 —— 上,GPT-4 时代的模型在 2024 年得分约为 5%。到 2026 年年中,GPT-5.6 Sol 已达到 83%。9 月这项工作所用的未命名模型,在 OpenAI 的内部能力量表上位于 GPT-6 Astra 之上。所有 FrontierMath 数字均来自 Epoch AI 和 OpenAI 的报告。
没有其他实验室发表过可比的研究级数学成果。Google DeepMind 的 AlphaProof 与 AlphaGeometry 2 相结合,以 银牌水平 解出了 2024 年 IMO 六道题中的四道 —— 对竞赛数学有意义,但与攻克未解的研究问题在结构上不同。
OpenAI 的多智能体强化学习方法,在架构上不同于 AlphaProof 的博弈树搜索。编排数千个模型实例的做法能否推广到其他数学领域,还是说它恰好特别适合有外力 Navier-Stokes 的结构,目前从公开信息无法判断。
基础设施的要求相当可观。在一次持续多天的运行中,经由 490 万条智能体间消息生成 3,000 亿个 token,所需的算力水平,是任何单个研究团队或大学数学系都无法独立复制的 —— OpenAI 把总成本定在数百万美元。这造成了一种不对称:Lean 证明文件是公开的,但产生它们的研究过程在少数几家前沿实验室之外无法复现。这种不对称正是公开信签名者所指出的结构性担忧的一部分 —— 依赖集中算力资源的数学进展,产出的结果数学界可以验证,却无法独立生成。
AGMAI 的时间表实际决定了什么
AGMAI 的角色意味着任何证明的发布都应遵循一个有结构的时间表。对那篇 166 页论文的同行评审,将提供对 Navier-Stokes 核心结果的第一次独立技术评估。至于克雷奖,公开两年的要求意味着最早的资格窗口大约在 2028 年底 —— 前提是通过同行评审、获得公开认可,并且克雷研究所启动其正式审查程序。
OpenAI 已经证明的是,一个大型多智能体强化学习系统,以天而不是分钟为单位运行,能够产出达到此前任何 AI 成果都未曾企及的水平的、经 Lean 验证的数学。这种能力能否延伸到完整的无外力 Navier-Stokes 问题,或延伸到其他 100 多道被声称的开放问题,将由 AGMAI 协调发布的内容来回答 —— 也取决于更广泛的数学界何时有机会评估它。