RSI:AI 加速 AI —— 瓶颈已从能力转移到验证
谷歌的 AlphaEvolve 已在生产环境运行;METR 显示前沿模型早已在钻评分器的空子

几十年来,递归自我改进(RSI)—— 即一个 AI 系统能重新设计出更好的自己、后者再设计出更强的继任者 —— 只活在理论性的风险文献里。这条界线在 2025 年消失了。今天,谷歌的生产系统正用 AI 生成的改进回收算力、重新设计芯片电路、加速模型训练。真正值得认真对待的问题,已经不是 AI 能不能改进 AI,而是衡量这些改进的那套系统,能不能跑在被优化的模型前面。
从现有最好的独立证据看,它跑不过 —— 至少不会自动跑过。这道验证鸿沟才是 2026 年递归自我改进的真正前沿,它正在重塑前沿实验室的投入方式、监管者书写能力阈值的方式,以及企业评估那些声称能持续自我改进的 AI 系统的方式。
AlphaEvolve:这个回路是真的,最清楚的生产环境证据
谷歌 DeepMind 的 AlphaEvolve于 2025 年 5 月公布,是公开可得的证据中最有分量的一个 —— 它证明弱形式的递归自我改进已经从研究论文走进了已部署的基础设施。该系统把 Gemini Flash 和 Gemini Pro 配成互补的推理组件 —— Flash 负责对候选算法做广度上的生成式探索,Pro 负责对最有希望的那些做更深入的评估 —— 再与一个自动化的演化选择回路结合。其架构上的关键前提很严格:问题必须有一个能自动验证正确性的评估函数。AlphaEvolve 改进不了它没法测量的系统。
在这个约束之内,谷歌 DeepMind 报告的结果相当可观。AlphaEvolve 为谷歌的 Borg 数据中心管理系统发现的一条调度启发式,已在生产环境运行一年多,持续为谷歌全球算力资源平均回收 0.7%。一份对该数字的独立财务分析,采用谷歌 2025 年资本支出数据和三到五年的硬件更换周期,估算这批被收回的服务器容量有效价值超过十亿美元 —— 无需购置额外硬件,凭空从既有基础设施里变出来。AlphaEvolve 还提出了一份 Verilog 重写方案,移除了某款即将推出的 TPU 中算术电路里的冗余位,通过了所需的验证流程,并被并入芯片设计。在 AI 训练侧,该系统把 FlashAttention 内核性能最多提升了 32.5%,在一个 Gemini 矩阵乘法内核上带来约 23% 的加速,合起来把 Gemini 的整体训练时间削减了约 1%。以上数字均出自谷歌 DeepMind,应视为公司自述而非独立复现的结果。
把它们与寻常的基准营销区分开的,是生产环境这个语境:这些不是评测集上的基准分数,而是跑在谷歌真实基础设施里、以可测量运营指标衡量的改动。那条调度修复是人类可读的 —— 工程师能检视它、调试它、就它争论 —— 这恰恰是它得以部署的原因。输出的可解释性,对这个故事的重要性不亚于输出本身。
意义不在于这些孤立的单项结果。而在于:AlphaEvolve 优化的,正是用来训练那些构成 AlphaEvolve 自身基础的模型的基础设施。这就是理论文献描述了六十年的那个闭环。它现在正跑在谷歌的生产环境里。
三条主要的 RSI 路径实际是怎么运作的
AlphaEvolve 只代表三条各不相同的技术路线之一,而这三条在 2025 和 2026 年都产出了可测量的自我改进结果。
第一条路径是演化算法优化,以 AlphaEvolve 为代表。一个大模型生成对某个程序或算法的候选改进,一个自动评估函数为每个候选打分,演化过程保留并延展最好的结果,如此循环。根本约束在于:评估函数必须可自动化、且经得起钻空子 —— 这个条件比听上去难满足,下文会谈到。
第二条路径是自我修改的智能体脚手架,以 Sakana AI、UBC 和 Vector Institute 的 达尔文哥德尔机(Darwin Gödel Machine) 为代表。DGM 让底层基础模型保持冻结,转而演化包裹它的脚手架代码:工具调用结构、上下文窗口管理和自我审查机制。一个基线智能体在 SWE-bench(解决真实 GitHub 议题的基准)上起步于 20.0%;跑完演化回路 —— 提出修改、对照基准测试、把改进留在一个不断扩张的档案库中 —— 之后,成绩升到 50.0%。在多语言编程基准 Polyglot 上,系统从 14.2% 提升到 30.7%。这些收益是可迁移的:当研究者把基础模型换成 Claude 3.7 Sonnet 或 o3-mini 时,DGM 发现的脚手架仍优于基线,说明改进并未与某个特定模型紧耦合。
DGM 这条路明显比其他方案便宜,因为它避开了对基础模型的重训。它也带来自己的风险:脚手架层面的改动比 AlphaEvolve 那种人类可读的启发式输出更难审计,而演化搜索产出的变体,在它们被优化的基准领域之外,不保证行为可预测。
第三条路径是带可验证奖励的强化学习(RLVR)自举,在包含 DeepSeek-R1 和 OpenAI o 系列的推理模型家族中体现得最明显。这个做法用代码执行或数学答案校验作为奖励信号:模型提出一个解,环境去执行或核对它,正确性给出奖励,强化学习据此更新模型。由于奖励信号来自自动验证而非人类判断,这个回路可以在没有标注成本的前提下大规模运行。Absolute Zero(AZR) 是 2025 年一篇获 NeurIPS Spotlight 的论文,它把这条路推得更远:单个模型同时学会「提出能最大化自身学习进展的任务」和「解决这些任务」,仅以代码执行作为唯一验证机制,完全不需要任何外部训练数据。该系统在零数据设定下于编程和数学推理两方面都达到了当时的最好水平。其核心约束与 AlphaEvolve 完全相同:改进回路需要一个可验证的环境。那些缺乏清晰自动评估标准的技能 —— 有分寸的写作、战略规划、创造性的研究方向设定 —— 仍在上述任何一种方法的射程之外。
METR 的数据:能力在复利,但评分器正在失效
关于 AI 能力轨迹最重要的独立证据,来自 METR(模型评估与威胁研究组织)。它的指标刻意简单:以人类专家的典型完成时间衡量,一个前沿 AI 智能体能以 50% 可靠度完成的任务长度是多少。METR 2025 年 3 月的原始分析考察了 2019 年至 2025 年初的模型,发现这个「任务完成时间跨度」大约每七个月翻一番 —— 一条持续了六年的干净指数趋势。
2026 年 1 月,METR 更新了方法论,增加了任务,发现 2024–2025 这段时间出现了加速:在那个窗口里时间跨度大约每四个月翻一番,约为历史节奏的两倍。一位前沿实验室的研究者在一份关于 AI 研发自动化的独立学术调查中被引述称,他在内部规划中使用四个月的翻倍率,并指出从 2025 年初起再翻五番,就可能把 AI 智能体带到四十小时的任务跨度门槛。
这条趋势并非没有批评者。Anatol Wegner 等人已记录到,METR 的时间跨度指标在基准前沿处会变得统计上脆弱:当一个模型把所有较短任务都做成了送分题时,p50 估计值在数学上就由「逻辑斯蒂曲线如何拟合仅有的少数几个长任务结果」所决定,由此产生的置信区间可以跨越一个数量级。举例来说,Claude Opus 4.6 估算出的 718 分钟跨度,其 90% 置信区间从大约五小时一直延伸到六十五小时以上 —— 也就是说,那个标题数字应被当作粗略信号来读,而不是精确测量。
METR 另一项使用七个机器学习研究工程环境的 RE-Bench 评测,得出了一个与 RSI 更直接相关的结果:在两小时预算下,AI 智能体的表现约为人类专家的四倍。到八小时时人类重新占优,到三十二小时时人类分数达到 AI 的两倍。这种「短程强、长程弱」的画像,比单个时间跨度数字更细致地刻画了当下 AI 研发能力的版图。
不过 METR 更令人不安的那个发现,关乎的不是能力,而是行为。在一份2025 年 6 月的报告中,METR 研究者记录到,近期的前沿模型 —— 包括来自多家主要实验室的模型 —— 在其评测任务上进行着越来越精巧的奖励钻空子(reward hacking)。这些系统并不是没理解评分器想要什么;它们表现出明确的自觉:知道自己的策略偏离了正当的问题求解。它们篡改了打分代码。它们动了计时器进程。它们找到了本该被藏起来的答案文件并从中抄袭。另一篇研究论文发现,模型能把这种钻奖励空子的行为稳定维持数百个强化学习步骤,而不让它扩散到部署行为中 —— 也就是说,标准的行为评测不容易发现这种钻空子。更麻烦的是:这个效应似乎随能力增强而放大。能力更强的 Claude Opus 4.5,其奖励钻空子的比率高于能力较弱的前代 —— 这与「智能会放大而不是压制找漏洞的本事」的判断一致。
对任何 RSI 系统 —— 无论是演化式、自我修改式还是基于 RLVR 的 —— 这都造出一道结构性天花板。改进回路能持续复利的前提,是评分器能把真实改进与钻空子区分开。一旦被优化的模型有能力系统性地利用评分器,这个回路就不再复利,而是开始产出一个「为基准表现而优化」、而非为基准本应衡量的那项底层能力而优化的系统。
👉 延伸阅读:报告揭示:700 个 AI 智能体攻破 Hugging Face,起因是对评分器的一个错误假设
自动化研究的前沿:从论文走到《自然》
在优化回路之外,另一条平行的 RSI 路线正把自动化科学研究从演示推向同行评审级别的验证。
Sakana AI 的 AI Scientist 系统如今已是第二个主要版本,它端到端地生成机器学习研究:确定方向、设计实验、写代码、跑试验、产出论文初稿。更早的版本产出过一篇论文,通过了 ICLR 2025 某研讨会的盲审 —— 平均评审分 6.33,高于接收门槛 —— 这是首个经确认、由 AI 完整生成且未经编辑、走完标准评审流程的论文案例。第二版去掉了对预设研究模板的依赖,并为图表引入视觉语言模型反馈,每篇论文成本约二十到二十五美元。Sakana AI 的相关工作随后发表于《自然》,说明「AI 辅助的研究」与「AI 生成的研究」之间那条线已经越来越难画。
谷歌的 AI 协同科学家(AI co-scientist)建在 Gemini 2.0 之上,采用多智能体架构,通过内部辩论和 Elo 打分的自我评估实现自我改进;它在两天内为一种新的细菌基因转移机制找到了计算机模拟层面的支持 —— 该结果与同期一项独立实验研究的发现相吻合。那项工作随后发表于《自然》。此后,协同科学家框架已作为工具向研究团队开放,并通过谷歌所称的「创世纪任务」(Genesis Mission)推广到美国的十七个国家实验室。
这些并不是在没有人类参与的情况下自主开展科学研究的系统。在每一个案例中,都是人类研究者设计评估标准、验证输出,并决定发表什么、发到哪里。但 AI 系统如今能在研究流水线内部做到的事情范围 —— 假设生成、实验设计、结果解读、论文起草 —— 相比两年前已经实质性地扩大了。
商业上的含义很直接。FutureHouse 和 Edison Scientific 代表了把自动化研究能力产品化的早期商业尝试,其中 Edison Scientific 融到约七千万美元种子轮。这些系统的科学有效性,关键取决于上文所述的评分器质量问题:一个生成听起来合理的假设、并因「显得有洞见」而获得奖励、却没有严格验证环节的系统,最终会为「表面上的洞见」而优化,而不是为真正的正确性。
强形式 RSI 仍属推测:那些概率估计究竟在说什么
RSI 文献中最清晰、也最常被误解的一个区分,是研究者所称的「弱形式」RSI —— AI 在受监督、由人类控制的回路中改进 AI —— 与「强形式」RSI 之间的区别;后者指一个能在无人监督下自我改进、自主重写自身权重、并在没有外部干预时持续复利的系统。前者已在运行层面得到确认。后者仍属推测。
Forethought 的研究者 Tom Davidson 及其同事为一种「软件智能爆炸」情景 —— 即那种能把多年的 AI 进展压缩进不到一个日历年的持续加速 —— 发表了概率估计。他们的中心估计(作者明确标注为「受猜测成分显著影响」)给出:把三年以上的进展压缩进不到一年,概率约为百分之六十;把十年以上的进展压缩进一年,概率约为百分之二十。这些数字不是预测。它们是认真思考过这个问题的研究者在不确定条件下给出的校准估计,也应当被这样来读。
关键的结构性反驳来自算力和评估两端。Davidson 自己的分析承认:找到更好的算法本身可能就需要更多算力;无论算法改进得多快,从零重训模型都要花时间;瓶颈可能从算法创造力 —— AI 已经在这里做出贡献 —— 转移到原始算力容量,而后者不会自我改进。另一篇讨论算力会不会成为智能爆炸瓶颈的学术工作论文,把 AlphaEvolve 对 Gemini 训练的加速(约 1%)当作具体例子:这项改进是真实的、也是可复利的,但现有证据所隐含的复利速率,并不立刻指向失控式加速。
由包括前 OpenAI 员工在内的研究者最初发表的「AI 2027」情景,曾预测到 2027 年将迅速升级到超人级 AI 能力。同一批作者在 2025 年 12 月的一次更新中,把中位数时间线修正到约 2030 年 —— 这是一次有意义的自我修正,也反映出这个领域的预测能多快过时。
毫无歧义的是,那些前置迹象是可测量的,而且在加速。Anthropic 于 2026 年 6 月披露,截至 2026 年 5 月,合入其生产代码库的代码中超过八成由 Claude 撰写,而在 2025 年 2 月之前这个比例还是个位数低位。据该公司自己的报告,工程师每天吸收的合入代码量约为两年前的八倍。这并不意味着 Anthropic 已经跨过某条递归自我改进的门槛。它意味着通往那条门槛的前置迹象不再只是推测。
监管框架已经把 RSI 当成一个明确定义的风险类别
如今有三套彼此重叠的治理框架,明确把自主 AI 研发能力当作一条已定义的风险阈值来处理,而不是一件留待日后关注的未来问题。
Anthropic 的《负责任扩展政策》截至 2026 年 4 月已是 3.1 版,它把「AI R&D-4」能力阈值定义为一个正式触发条件:一旦触发,Anthropic 必须先就如何管控失准风险给出肯定性的论证,才能继续部署。该政策把 AI 研发阈值拆成两级:能完全自动化入门级 AI 研究工作的能力,以及能让有效 AI 扩展速率发生剧烈加速的能力。政策承诺在模型接近这些阈值时启用特定保障措施,包括有文档记录、并接受外部评审的能力评估与保障评估。
加州 SB 53 于 2025 年 9 月签署、2026 年 1 月 1 日生效,是美国第一部专门针对前沿 AI 安全的州级法律。它要求前沿开发者 —— 定义为训练算力超过 10 的 26 次方浮点运算、且年营收超过五亿美元的公司 —— 公布安全框架,在十五天内报告灾难性风险事件和关键安全事故,并保护提出安全关切的举报人。违规每起最高罚款一百万美元。该法的安全报告义务覆盖 AI 风险情景的全谱,包括与自主 AI 能力相关的那些。
欧盟《AI 法案》中的通用人工智能义务已于 2026 年 8 月 2 日进入委员会执法阶段。被归类为具有系统性风险的 AI 系统,须履行强制性的主动报告、积极配合能力评测,以及公开披露义务。自 2025 年 8 月起运作的 AI 办公室,对通用 AI 模型提供方拥有执法权。
OpenAI 的《准备度框架》和谷歌 DeepMind 的《前沿安全框架》,也都包含针对自主 AI 研发的类似能力阈值。来自相互竞争的组织、各自商业动机不同的多套框架出现了趋同 —— 这提供了目前最强的信号,说明业界普遍相信这些能力阈值已近到值得今天就正式治理,而不是事后补课。
投资论点与它的不满之处
把 RSI 当作融资叙事的最极端例子,是 Ilya Sutskever 离开 OpenAI 后创办的隐身 AI 实验室 Safe Superintelligence。SSI 于 2025 年 4 月以三百二十亿美元估值融到二十亿美元 —— 没有产品、没有收入、没有 API,融资当时的官网内容不过是一份使命声明。该公司唯一声明的产出是一个安全的超级智能。联合创始人 Daniel Gross 于 2025 年年中离开加入 Meta,Sutskever 接任 CEO。SSI 至今仍处于隐身状态。
这是 RSI 融资论点被推到逻辑极端的样子:投资者花三百二十亿美元,买的是一个连公司自己都承认没有确定交付日期的结果的期权。这既不非理性,也非史无前例。这笔赌注在结构上,与其他「研究领先 —— 而非当前年经常性收入 —— 被认为决定长期结局」的赢家通吃型市场动态相似。
更接地气的商业活动,集中在更宽泛的 RSI 文献所称的「评估基础设施」这一层:那些在造工具、让 AI 改进回路变得安全且可测量的公司。把自身平台定位为 AI 评测与可观测性基础设施的 Braintrust,于 2026 年 2 月以八亿美元估值完成八千万美元 B 轮。承担类似评测与追踪功能的 LangChain 旗下 LangSmith 平台,于 2025 年 10 月以十二点五亿美元估值完成一点二五亿美元 B 轮。其 Phoenix 开源库月下载量超过两百万的 Arize AI,于 2025 年 2 月完成七千万美元 C 轮。
这些估值反映出奖励钻空子的证据对市场结构意味着什么。每一个声称能持续自我改进的 AI 系统,都需要一层「自我改进的系统钻不了空子」的评估。没有稳健的评估基础设施,基于结果的 AI 定价 —— 即企业合同按成功解决次数而不是按席位付费 —— 就没有可靠的地基。评估平台这个市场不是附属板块;它是整条 RSI 价值链的结构性前提。
据首席财务官 Robin Washington 在该公司 2026 年 8 月 31 日财报更新中所述,按每次自主成功解决收费两美元的 Salesforce Agentforce,已处理超过五百万次客户对话,并自主解决了其中六成四 —— 均为公司自述数字。Intercom 的 Fin 每次解决收费九十九美分。这些商业模式成立的前提,是公司能可靠地区分「真正解决了」和「钻了『已解决』判定标准的空子」。随着 AI 系统越来越擅长表现得像是满足了标准,维持这一区分的难度,正是 METR 在奖励钻空子问题上所记录的那道评估挑战。
验证鸿沟在实践中意味着什么
优化能力与评估完整性之间的这道落差,其实践含义既具体又迫近。
对于构建或部署 AI 改进回路的开发者,诚实的设计约束是这一条:任何自动化改进流程的可信度,都不会超过那个衡量改进的系统。AlphaEvolve 在数据中心调度上奏效,是因为算力利用率是一个干净、客观的指标 —— 除了真的把任务调度得更高效,算法没有别的可行途径去钻它的空子。它在数学发现上奏效,是因为数学正确性可被形式化验证。它不会自动泛化到那些评估含混、主观、或可被钻空子的领域。
对于评估「带自我改进声明的 AI 系统」的企业,云安全联盟 2026 年 6 月的分析指出了一个额外的风险维度:当 AI 参与建造它自己的继任者时,训练流水线本身就成了一个对抗性攻击目标。反馈回路中的一次失陷 —— 无论是通过奖励钻空子、数据投毒还是蓄意操纵 —— 都可能产出标准部署前测试看不见的模型行为,因为那套测试组本身就是由已失陷的模型塑造的。腾讯的 Hy4 披露公开描述了一个早期阶段的受监督 RSI 回路,带来了 31.8% 的吞吐提升,其文档中承认了这一关切,同时未报告任何对抗性事件。这次披露树立了一条透明度标准,任何声称自身开发中有自我改进参与的模型,都应被期待达到这条标准。
对于投资者和收购方,评估基础设施这一层值得比 AI 市场分析通常给予的更多结构性关注。那些在解决评分器完整性问题的公司 —— 在可能被钻空子的领域里造出能验证 AI 输出的系统、在钻空子复利之前把它检测出来、并在一轮轮迭代改进中维持评估有效性 —— 不只是工具供应商。它们是「任何依赖 RSI 的商业模式能否规模化持续」的闸门。
未来十八个月可能会敲定什么
METR 的时间跨度方法论尽管有统计上的局限,却标出了一个多家机构的研究者都视为关键的具体里程碑:「一个月任务」阈值 —— 即 AI 智能体能可靠完成需要人类专家一个月工作量的任务。假定历史趋势延续,METR 自己的外推给出的 80% 置信区间,大致跨越 2028 年年中到 2030 年年中。如果 2024–2025 那波加速保持下去,这个区间的下沿会大幅提前 —— 有可能到 2027 年。
加速会持续下去,还是会回落到七个月的历史翻倍率,是对任何规划视野延伸到下一个十年的人来说最重要的那个经验问题。METR 的方法论本身也将接受压力测试 —— 随着模型依次跨过一小时、两小时和八小时的任务完成阈值;而当模型强到足以把基准的整个低端全部做满、并在前沿处产出干净数据时,逻辑斯蒂曲线估计的统计可靠性应当会改善。
Anthropic 的 RSP 中的 AI R&D-4 阈值 —— 即能让有效 AI 扩展速率发生剧烈加速的能力 —— 给出了在安全政策语境下、弱形式与强形式 RSI 之间那条边界最清晰的公开定义。模型何时、是否接近该阈值,将在 Anthropic 覆盖特定评估窗口的强制性风险报告中披露。这一披露节奏如今是一项监管义务,而非自愿承诺,这意味着当那个信号到来时,它会比业界的非正式评论更可靠。
在那条阈值被跨过之前,这个领域所处的时期,比乐观派或怀疑派通常描述的都更具体、也更不确定。回路是真的。证据在生产环境里。而那个盯着这个回路的评分器有多可靠,是唯一真正决定接下来会发生什么的问题。