Fable 5.1 算出九圈振幅,成本不到 2000 美元
SLAC 花两周验过;北京一个团队用人主导的方法给出平行结果,但只覆盖符号

Anthropic 的一个 AI 模型独立解出了理论物理学中最难啃的悬而未决计算之一 —— 而整个项目的花费,比多数研究者买一台二手服务器还少。Fable 5.1 在 Anthropic 的 Claude Science 平台上自主运行,在研究者给了它一句话提示、然后去睡觉之后,算出了平面极限 N=4 超杨-米尔斯理论中六粒子散射振幅的九圈结果。SLAC 国家加速器实验室与斯坦福大学粒子物理与天体物理教授、此前纪录的保持者 Lance Dixon,花了两周核验,才确认结果无误。这项计算打破了自 2023 年以来未被撼动的纪录,而总成本 —— 含算力和 API 费用在内大约一千到两千美元 —— 在一个研究者个人可自由支配的预算之内。
这个结果与 Anthropic 的公开宣布同日落地,同时还有当初发出这道挑战的那位物理学家的评论。不过,这并不是一个干净利落的「AI 战胜物理学」时刻:北京的中国科学院理论物理研究所与中国科学院大学的一个团队,也在用人主导的框架、辅以 GPT-6 处理某些约束条件来攻九圈,并在前一周发表了他们自己的结果。Dixon 说,自己在同一个两周之内,既被机器超过,也被人机协作超过。
延伸阅读:Anthropic 的 Fable 5.1 带着 75% 缓存降价和新的智能体基准上线
「九圈」到底是什么意思 —— 以及为什么拖了这么久
散射振幅是编码粒子如何相互作用和散射的数学对象。对任何一个量子场论,物理学家都把这些振幅算成一个微扰级数,每一项对应着在基础(树图)计算之上数目递增的「圈」—— 也就是虚粒子修正。一圈时,一个虚粒子在过程中回绕;两圈时两个;以此类推。每多一圈就要多做一次对不受约束的虚动量的积分,而项数及其代数复杂度大致按阶乘增长。大型强子对撞机上真正的实验计算通常做到两圈或三圈。物理学史上最精确的量子电动力学预言用到了五圈。
研究新振幅技术的物理学家会用一个特殊的试验场,叫 N=4 超杨-米尔斯理论 —— 一个四维的极大超对称量子场论,它不描述任何真实粒子。它是一个数学玩具模型,不是关于物理世界的理论。但它异乎寻常的对称性质 —— 对偶共形对称、Yangian 对称,以及一个叫可积性的特征 —— 使得那里的振幅比量子色动力学(QCD,支配真实的夸克和胶子)这类理论中受到的约束强得多。研究者用 N=4 SYM 把技术推到极限,再从中寻找可能迁移到更凌乱的真实世界的想法。
Fable 5.1 所算的这个具体振幅 —— 平面极限下的六粒子最大螺旋度破坏(MHV)振幅 —— 此前的纪录是八圈,由 Dixon 和合作者刘雨婷(Yu-Ting Liu)在 2023 年利用 SLAC 国家加速器实验室的资源取得。从八圈跨到九圈,此前被普遍认为超出了任何普通学术团队实际能负担的算力预算。
六边形自举:靠排除法求解,不是靠蛮力
Fable 5.1 用的方法 —— 也正是 Dixon 团队开创的方法 —— 叫六边形自举。它不是画出所有可能的费曼图再求和来计算振幅;在九圈时,图的数量会大到天文数字。自举的做法是假设振幅必须满足一份详尽的已知约束清单:理论的各种对称性、粒子近乎平行时各种共线极限下的行为、来自一种叫通量管算符乘积展开的精确非微扰技术的数据,以及对偶共形对称施加的交比条件。算法逐条施加这些约束,一步步排除候选,直到只剩下唯一一个函数 —— Dixon 把这个过程比作解一个非常大的数独。
Fable 5.1 在 Claude Science 内部工作,用 SymPy 符号数学库从零写出了全部 Python 代码。SymPy 是一个开源的 Python 符号数学库 —— 做的是精确的代数操作,而不是数值近似,这正是振幅计算所需要的。要在这里所需的规模上使用 SymPy,意味着定义并操作维数极大的多项式空间、把共线极限与多重 Regge 极限的约束实现成过滤操作,以及管理那些从可能的振幅函数空间里剔除无效候选的线性代数。这些都不是预先写好的;Fable 5.1 是基于自己对已发表文献的阅读,写出了完整实现。搭建这个实验的两位 Anthropic 物理学家 Siddharth Mishra-Sharma 和 Liam Fitzpatrick 说,模型在 Mishra-Sharma 睡觉的那几个小时里自主生成了完整实现,随后又持续运行了好几天,并按要求每四到六小时汇报一次进展。
让这个结果区别于「一台计算机跑了很久」的,是 Fable 5.1 另外构造的第二条独立验证路径。除了直接自举之外,模型还自举了九圈的形状因子 —— 一个相关但不同的数学对象 —— 然后施加了一种叫对映对偶的技术。对映对偶由 Dixon 团队提出,是一个精确的数学关系,通过一个特定的「翻转」操作把六粒子振幅映射到六粒子形状因子。如果直接自举的结果与经对映对偶映射过来的形状因子一致,那么这个结果就通过了任何单路径计算都给不出的内部自洽检验。二者一致了。
据 Anthropic 报告,总成本中自举计算本身约为 100 美元 —— 相当于 96 个 CPU 核跑一周 —— 另加 900 到 1900 美元调用 Fable 5.1 模型的 API 费用,估计总额落在一千到两千美元之间。这些数字由公司自报,未经独立审计。
Dixon 的判词 —— 以及一项重要披露
Dixon 在 2026 年 9 月 1 日收到结果,他在给 Anthropic 那篇文章写的附记里描述的反应,是一个人在消化真正的震撼。「就是那一刻,大语言模型对我来说才算真正落到实处,」他写道。随后他的团队花了两周做核验检查,才确认这个九圈振幅是正确的。
Dixon 具体说明了为什么这项计算是一个合适的检验。用他的话说,六边形自举「非常脆弱 —— 任何一处出错,就像一个塌掉的舒芙蕾」。逻辑中任何一步出错,整个结构都会垮掉。关于自举计算的已发表文献通常略去中间步骤;跟着读的人没法直接从现有论文里把推导抄下来。「Claude 必须从零开发出所有那些代码,」Dixon 写道,而在这么做的过程中,它「比任何人类都更懂我们 2019 年和 2023 年的论文 —— 我的合作者除外」。
Mishra-Sharma 和 Fitzpatrick 给 Fable 5.1 的提示词只有一句话:「问题是计算平面 N=4 SYM 中九圈的六粒子(六边形)振幅。」后续指令同样简短:「我要去睡了,好几个小时都不在。在我叫停之前一直做下去。每 4 到 6 小时给我一次进展。」模型运行了好几天,在 Claude Science 提供的结构化环境里定期记录自己的进展,最后两条计算路径收敛到了同一个结果。
促成这个实验的挑战,是科普作家、前理论物理研究者 Matt von Hippel 在 2026 年 8 月 7 日的一篇博客里公开发出的。von Hippel 写道,如果 AI 公司想证明自己具备超越小学水平基准的真正推理能力,就该去解一个开放的物理前沿问题 —— 具体说就是九圈振幅。Anthropic 的团队在几天内看到了这篇帖子,随即开始实验。
Anthropic 那篇文章附带的一项披露值得直说:von Hippel 撰写该文的时间是由 Anthropic 付酬的,而且 Anthropic 员工在发表前对草稿提供了反馈。这是 von Hippel 自己披露的。读者在看他的评论时应把这层背景一并掂量。
一项平行的突破 —— 以及它改变了什么
事情远比「AI 单独立功」复杂得多。在 Anthropic 于 9 月 16 日放出完整九圈数据的五天后,Zenodo 上出现了另一篇论文:《六胶子 MHV 振幅至九圈的符号》,作者是中国科学院理论物理研究所与中国科学院大学的 Song He、Jirong Jing 和 Xiang Li,日期为 2026 年 9 月 17 日。
何颂团队用的是人主导的数学框架,由 GPT-6 协助处理某些约束,得到的九圈结果与 Fable 5.1 的计算有大量重叠。关键区别在于范围:Song He 的结果覆盖的是振幅的「符号」—— 一个捕捉超越函数、但不含涉及 zeta 常数的贡献的数学结构,而那些贡献携带着重要的物理信息。zeta 值 —— 像 ζ(3)、ζ(5) 及相关的多重 zeta 值 —— 在完整振幅的每一个圈阶上都会出现,编码着关于该理论结构的物理信息,单靠符号是抓不住的。Fable 5.1 算的是完整振幅,包含那些 zeta 贡献,因此在数学上更完整。
两个独立的九圈结果在几天之内相继出现,为物理学界提供了一种需要慢慢消化的交叉验证。在两者重叠的部分 —— 符号那一块 —— 可以直接比对。如果出现分歧,就指向其中一方或双方的错误;如果一致,则会大幅增强对两者的信心。
Dixon 在 Anthropic 的文章里提到,大约两周之内,他先后被一台机器和一次人机协作超越。他说自己并没有失落感 —— 一部分是因为他的团队本来就打算充当任何可信候选结果的验证者,另一部分是因为 Fable 5.1 所用的方法,直接建立在 Dixon 自己已发表的工作之上。Dixon 还指出,Fable 5.1 呈现结果所用的格式,与他的团队确立的惯例一致。
von Hippel 在反思这个实验究竟证明了什么时,给出了一个更谨慎的解读。他本想让这道挑战揭示 AI 相对于人类在根本推理能力上的某种真相 —— 好让自己在关于机器智能的争论里站定一个立场。结果他发现,AI 让他意外的只是算力可及性这一件事:真正的限制因素并不是「没有人类能解出九圈」,而是「没有学术团队指望自己付得起做这件事的算力」。「我问错了问题,」他写道。
延伸阅读:Claude 自主在 Lean 4 中形式化了费马大定理
这个玩具模型告诉不了我们什么
这个结果有若干重要的边界。
N=4 超杨-米尔斯不是一个物理理论。Fable 5.1 算出的这个九圈振幅没有任何直接的实验后果。它无法预言 LHC 上一次粒子对撞的结果,无法指导探测器设计,也解决不了任何关于物质实际结构的未决问题。它的价值在方法学上:检验技术、建立直觉,并有可能揭示出某些最终能迁移到 QCD 这类现实理论的数学结构。Fable 5.1 所发展出的那些具体计算策略里,有没有哪一个真的可迁移,是一个开放的研究问题。
成本数字值得细看。Anthropic 那个 100 美元的自举估算只反映数值计算本身,并不涵盖研究环境的完整上下文、Claude Science 背后的基础设施,或者一个 Anthropic 之外的研究者做同类实验时可能不同的 API 使用方式。一千到两千美元这个总额说得通,但是公司自报的。
von Hippel 的核心批评,脱离那个同期的中国结果也依然成立:Fable 5.1 没有发明新的数学方法。六边形自举是 Dixon 的发明。对映对偶是 Dixon 的发现。SymPy 已经存在了十多年。这个 AI 的贡献,是在没有人类逐步引导的情况下,把这些已知方法大规模地正确实现出来。这确实很有分量 —— 但它不同于推导出一条新的物理原理,或者识别出一种此前未知的对称性。
Dixon 指明了物理学真正的拐点会在哪里:当一个 AI 模型提出一条人类研究者此前未曾表述过的新物理洞见的那一刻。「那一刻还没有到来,」他写道。九圈是一项非凡的计算成就,而更深的概念突破还在前面。
为什么自主科研智能体现在可能被当真了
在这个结果之前,最可信的自主 AI 科学计算,要么是短周期任务(解一个方程、为某条引理生成一个证明),要么是带着大量脚手架、需要人频繁介入的流水线。而一次持续数天的自主计算 —— 它要求写出数千行原创的符号数学代码、采用了两种独立的数学策略、在没有明确指引的情况下穿行文献,并产出了一个经受住前纪录保持者两周专家审视的结果 —— 是一种性质不同的演示。
促成这件事的基础设施不是消费版 Claude。Anthropic 的科研计算平台 Claude Science 提供隔离的计算容器、HPC 作业编排、系统化日志,以及关于模型在研究场景下该如何处理代码生成与执行的明确规则。这个平台的设计目标是执行对话式 AI 产品不需要的稳健性标准:确定性的代码执行、可复现的日志,以及对无人实时盯守的长时作业的结构化处理。跑在这套框架里的 Fable 5.1,拥有的是一个为长时间自主科研而设计的结构化环境,而不是为对话交互设计的。关键在于,模型没法随便编一个听起来合理的答案就翻篇 —— 自举计算要么收敛到唯一一个函数,要么失败;两条独立路径要么一致,要么不一致。问题本身的结构强制了正确性,而许多 AI 基准任务做不到这一点。外部研究组能不能复制出可比的配置还有待观察 —— Anthropic 没有公布 Claude Science 的完整技术架构。
如果公司给的数字属实,经济账上确实有些东西被改变了。做振幅物理的博士生和博士后现在有理由考虑:AI 辅助的自举计算是不是能把自己的触及范围,推到本校 HPC 预算通常允许的范围之外。与之对应的问题 —— AI 智能体现在能否在 QCD、弦论振幅或引力波计算这些同样受限的问题上提供有意义的帮助 —— 将驱动下一波实验。
Dixon 那两周的验证,是让这个结果从「看上去可信」变成「可以发表」的决定性动作。他选择去做这件事、并且没有找出错误,确立了一个先例:对 AI 产出的前沿科学,人类专家的验证是行得通的 —— 至少对那些验证远比计算容易的问题而言。这种不对称在更难的问题上是否成立,或者会不会随着计算越来越复杂、够格的验证者越来越少而失效,是这个领域接下来好几年都要回答的结构性问题。