MIT 研究:科学比较中,AI 每 4 次就有 1 次输给统计方法
一个涵盖 2507 组比较的数据集,揭示了 AI 十年未能缩小的失败区

麻省理工学院 FutureTech 实验室的研究人员,对人工智能与它声称要取代的科学方法之间的较量,做了迄今规模最大的系统性统计 —— 得到的是一幅既有真实进步、也有一个十年来毫无改善的顽固盲区的图景。
这篇预印本由博士生 Gabriel Manso、本科生研究员 Emma Fu 和 FutureTech 主任 Neil Thompson 于 2026 年 9 月 14 日发布在 arXiv 上,汇集了 2507 组 AI 技术与其他科学分析方法的正面比较,数据取自 2000 年至 2025 年初发表的论文,横跨 27 个科学学科。
核心发现应该让那些把 AI 在科学上的优越性视为定论的人停下来想一想:在与传统统计方法的比较中,大约每四次就有一次,AI 以更高的计算成本交出了更差的表现。过去十年里,这个失败率基本没有变化。
一个改变 AI 进步解读方式的双轴框架
大多数 AI 基准报告只问 AI 赢了还是输了。MIT 团队同时问了两个问题:它赢了吗?为了得出这个结果,付出了多少代价?
这项研究把每一组比较放进一个「性能—成本」空间进行分类。最理想的结果是 AI 以更低的计算成本胜过基线方法。最糟糕的结果 —— 约 24% 的那部分 —— 是 AI 表现不如对比技术,同时消耗更多算力。复现数据通过 MIT-FutureTech 的 GitHub 仓库以 CC BY 4.0 许可公开提供,包括完整的 2507 条记录数据集,以及用于生成论文图表的 Python 脚本。
这种框架之所以重要,是因为这个领域通常只报告总体胜率,而忽略成本这条轴。一个研究团队靠运行大型神经网络,在一个更简单的统计模型之上取得了些许准确率提升,并不一定就是做出了好的方法选择 —— 尤其是在计算时间有限的情况下。
AI 稳定获胜的地方:与统计方法的比较
当对手是传统统计方法 —— 回归模型、贝叶斯推断、假设检验 —— 时,在已发表的比较中,AI 技术多数情况下表现出真实的性能优势。这个直觉是合理的:为线性、独立等条件下的低维数据集设计的统计方法,一旦问题涉及高维输入或复杂的非线性关系,就会落于下风。在这些情形下,深度学习架构能提取出经典方法遗漏的模式。
但 MIT 的数据加上了一个关键的限定:这种性能优势通常伴随着显著更高的计算成本,而且在这类已发表的比较中,约有 24% 的情况下,AI 连性能这道门槛都没能跨过。这一失败比例在十年间保持稳定,是这项研究最具挑衅意味的发现。如果研究者在从失败的应用中吸取教训,随着领域的成熟,这个比例本应下降。它的稳定反而表明,存在一种结构性倾向:在更简单的工具就能做得同样好甚至更好的场合使用 AI 方法 —— 一些计算科学家称之为「拿着锤子找钉子」问题。
延伸阅读:StateSight:新基准显示前沿视觉语言模型在隐式空间推理上仍然失败
AI 仍在追赶的地方:与科学计算的比较
与科学计算相比,情况要微妙得多。科学计算方法 —— 数值求解器、有限元分析、计算流体力学、分子动力学 —— 实现的是已知的物理定律。对于适定问题,一个好的模拟从构造上就高度准确。这让科学计算在历史上一直是个难以超越的对手。
MIT 的数据集证实,大约在 2020 年之前,AI 在与科学计算的正面比较中输掉了一半以上。自 2020 年起,AI 已在一半以上的此类比较中胜出。变化的原因部分在于架构的成熟 —— 物理信息神经网络和神经算子方法已经在某些问题类别上成为传统数值方法的真正竞争者 —— 部分在于经济性。AI 天气模型已经证明,其预报质量可与成熟的数值天气预报流程相媲美,而推理成本要低几个数量级。
但在与科学计算的比较中「赢下一半以上」,并不等于取代了它。高风险的物理模拟 —— 核建模、精确的药物分子结合亲和力计算 —— 需要物理一致性上的保证,而不是统计近似。在应用需要的是精确而非速度的地方,科学计算仍然保持着权威地位。
方法论的内在局限
这批语料取自已发表的科学文献,因此带有发表偏倚。展示 AI 大幅胜出的论文,比显示 AI 勉强胜出或失败的论文更有可能被投稿和录用。因此,研究记录下的约 24% 的失败率,很可能只是 AI 被用于那些更简单方法就足以胜任的问题的频率下限,而不是上限。
独立复现可以立即开展。GitHub 仓库包含完整数据集、所有主要图表的源脚本,以及一个补充报告生成器 —— 对于这种规模的预印本来说,方法透明度之高并不多见。
背景:关于 AI 用于科学的报道遗漏了什么
Google DeepMind 首席执行官 Demis Hassabis 在 2026 年 2 月接受《财富》采访时,把他更长远的愿景描述为:在「10 年、15 年后」,AI 将迎来「一种新的发现黄金时代」—— 这说明完全由 AI 自主驱动的科学发现仍是未来的前景,而不是今天的现实。斯坦福 HAI《2026 年 AI 指数报告》发现,在使用 ReplicationBench 框架进行的天体物理学论文级复现任务上,前沿模型的得分低于 20%。据《科学》杂志报道,2025 年,在可疑的 AI 生成分析大量涌入之后,出版商 PLOS 和 Frontiers 更新了政策,要求依赖公共卫生数据集的论文进行额外的外部验证。
MIT 这项研究比这场争论中乐观或悲观的任何一极都更细致、更有分寸。它并不认为 AI 在科学上正在失败 —— 多数比较显示 AI 胜过传统统计方法。它认为的是,AI 存在一个这个领域尚未解决的、顽固的最坏情况问题,而「AI 是对既有科学方法的普遍升级」这种说法,仍然缺乏实证支持。
对研究实验室和资助机构的启示
对于一线科学家和实验室负责人来说,最具可操作性的信息就藏在那个稳定的失败区里。在拿出一个深度学习架构来分析实验数据之前,值得先问一问:一个设定得当的回归模型或成熟的数值方法,能否以更低的计算成本得到同样甚至更好的结果?这个问题并不总是有人问。
对于科研资助机构 —— 美国国家科学基金会(NSF)的「AI 用于科学」项目、美国国立卫生研究院(NIH)在机器学习上的投入、美国能源部(DOE)的计算计划 —— 这项研究的「成本—性能」框架与如何评审资助申请直接相关。一份只拿自己的 AI 方法与其他 AI 方法比较、而不与本领域既有方法比较的申请,无法证明其效率收益足以抵消额外的计算开销。
Thompson 的 FutureTech 团队此前研究过 AI 在什么经济门槛上能在成本上与传统方案竞争。这篇新论文中与科学计算的比较,正与这一框架相呼应:问题不只是 AI 是否准确,还在于相对于其成本,它是否准确到足以值得部署。
这项研究是预印本,尚未通过同行评审。对其结论最重要的后续检验,是随着推理成本延续其有据可查的快速下降,与传统统计方法比较时约 24% 的失败率最终是否会下降。Epoch AI 的研究追踪了各主要基准上可观的性价比提升 —— 这表明,按今天的推理价格计算,一些目前被归为「成本更高」的比较,最终可能会翻转到有利的象限。一项把语料扩展到 2026 年、并对推理成本做时间归一化的后续研究,将大大增强这些结论 —— 也会告诉研究者,这个领域的最坏情况性能问题是否终于开始收窄。