Dream-RSI:智能体自己改进搜索策略
零成本重放过往的发现树,Gemini 调用次数降 42%,程序还更快

来自谷歌 DeepMind、马里兰大学帕克分校和弗吉尼亚大学的研究者发表了一个名为 Dream-RSI 的框架,它让编程智能体能够递归地改进自己搜索解法的方式 —— 而无需改动底层的代码生成模型或它的评估器。这篇2026 年 9 月 14 日发布在 arXiv 上的论文针对的是长周期 AI 驱动发现里的一个核心瓶颈:探索策略本身历来是手工写死的,从不根据经验更新。
Dream-RSI 的核心想法是:一次已经跑完的发现任务,本身就包含了评估其他搜索策略所需的一切。每次运行都会产出一棵结构化的树,记录编程智能体从哪个工作区继续、生成了什么、评估器给了什么分数。Dream-RSI 不去从头重跑智能体和评估器来测试新策略,而是把候选策略在这棵已记录的树上重放,额外执行成本为零。随后一个策略开发智能体根据重放结果改写探索代码,改进后的策略被重新部署到下一轮真实搜索,而那一轮又会扩充树池、供进一步打磨使用。
团队在三个领域的八项任务上测试了 Dream-RSI —— 算法工程、数学优化和 GPU 内核工程 —— 用谷歌的 Gemini-3.1 Pro 和 Gemini-3.7-Flash 作为编程智能体。对照一个把探索策略固定住的受控基线,Dream-RSI 在「所需智能体调用次数」或「找到的程序质量」上都带来了一致的改进。
👉 延伸阅读:GPTS24 关于递归自我改进与 AI 系统验证瓶颈的报道
为什么搜索控制器从来没被改进过
当一个编程智能体在找更快的 Lasso 求解器或更高效的 GPU 内核时,它写出的每一个候选程序都要花掉一次真实的生成加评估周期。这笔开销躲不掉:不跑一遍,你没法知道一个程序是不是更快。但搜索控制器 —— 那个决定从哪个工作区继续、一次并行跑多少次尝试、什么时候该开新分支而不是打磨现有分支的层 —— 并不生成也不执行代码,它编排的是那个干这些事的智能体。
问题在于,改进控制器几乎和跑一遍发现循环一样贵。要知道一个新的搜索策略是不是更好,你得让它去引导许多次生成-评估周期,直到积累出一条有意义的轨迹。如果每次都更新策略、再从头重跑整个循环,策略开发会很快把本该用来找好程序的预算吃光。
Dream-RSI 的解法是把这两笔成本分开。真实的发现任务照常进行,构建出一棵棵尝试的树,每个节点都存着它的评估结果。树一旦存在,一个新的候选策略就可以通过以不同顺序遍历它的分支来测试 —— 优先选不同的节点、以不同方式批量并行、在不同的点停下。因为每个节点的结果都已经记录在案,这种重放是瞬时的。成千上万个候选策略可以在同一棵历史树上被评估,代价只相当于读一个文件,而不是跑一次智能体。
作者拿基于模型的强化学习作比:正如世界模型让强化学习智能体可以在不真正采取行动的情况下「做梦」推演后果,积累下来的发现树也让探索策略可以梦到不同策略本来会怎样展开 —— 然后在下一次真实部署之前据此更新自己。
重放机制是怎么运作的
一棵发现树以一个初始工作区为根。当探索策略选中某个节点继续时,编程智能体接过该节点保存的文件状态和先前的观察,生成一个新的候选程序,评估器给它打分。结果 —— 代码、诊断信息和分数 —— 作为被选中节点的子节点存下来。策略也可以在任何时候回到根节点开一条新分支,而不是延长现有的那条。
在离线重放里,同一套决策接口照样适用。一个候选策略起初只能看到根节点。每当它选中一个节点,历史树就揭示那里实际记录了什么 —— 真实智能体当时生成的那个子节点以及它拿到的评估。这个过程持续到策略选中一个空批次、达到轮数上限,或者整棵已记录的树被完全揭开为止。关键在于,策略绝不会看到历史上没有按那个顺序被观察到的任何东西;不存在拿未来信息作弊。
重放目标同时权衡三个因素:已揭示节点中最好的程序分数、该轨迹用掉的生成-评估请求数(对浪费施加惩罚),以及一项对有效并行的奖励 —— 鼓励那些把互不依赖的续写批量并行、而不是串行执行的策略。一个固定的策略开发智能体检视各版本的重放轨迹和分数,然后改写探索策略的代码。被选中的版本在累积的历史上必须至少与当前策略打平,从而在重放层面提供一个不会更差的保证。
每一个离线阶段结束后,更新过的策略回到线上。它产出的真实运行会扩充历史树池,让下一个离线阶段有更多可以做梦的世界 —— 也让策略能遇到更早的任何策略都到不了的搜索条件。
延伸阅读:研究发现:让编程智能体失败的是上下文溢出,而不是压缩质量
Lasso 上的结果:调用更少,求解器更好
论文里最详细的结果关乎 Lasso 正则化路径问题:给定一个特征矩阵和一串正则化强度,找出一个实现,让它比标准库更快地算完整条解路径,同时保持数值正确。这个基准被 SimpleTES 系统使用,要求发现的是一个编译型程序而不是 Python 包装层,并且在测量墙钟运行时间之前会在独立实例上验证正确性。
两种方法在第一轮都从同一个手写的并行探索策略出发。此后的轮次里,固定探索的基线保持该策略不变;Dream-RSI 则在每轮之后修改并重新部署它。
用 Gemini-3.1 Pro,固定基线在五轮里累计用掉 550 次智能体调用,产出的求解器在六个留出的下游数据集上平均耗时 3587.1 毫秒。Dream-RSI 用了 317 次调用,平均 2931.0 毫秒 —— 快 18%,而发现成本低 42%。用 Gemini-3.7-Flash,固定基线用 3200 次调用换来平均 2516.7 毫秒;Dream-RSI 用 1879 次换来 2350.6 毫秒。
两个 Gemini 变体找到的程序在性质上并不相同。Pro 模型产出的求解器在基准里最大的数据集 RCV1 上格外强,把它的运行时间从 19550.1 毫秒压到 14616.0 毫秒 —— 仅这一个数据集上就减少了超过 25%,不过它在另外五个较小的数据集上比固定探索的求解器慢。Flash 模型产出的则是一个更通用的求解器,在六个数据集里有五个变好、一个变慢。
论文也与 SimpleTES 做了对比,后者使用 GPT-OSS-120B 模型、报告了 51200 次生成。Dream-RSI 的 Pro 配置所用的发现智能体调用次数约为其 1/162,而在同样六个留出数据集上的平均下游运行时间更低 —— 不过这两个系统用的模型和搜索实现都不同,所以这个对比反映的是量级上的相对关系,而不是一次受控的正面较量。
数学优化:成本只有零头,成绩仍有竞争力
论文用 Gemini-3.1 Pro 在十轮里测试了三项数学优化任务:和差问题(找一个整数集合,使其和集比差集增长更快)、圆填充(在单位正方形里塞进尽可能多的圆,以最大化半径总和),以及自相关不等式(最小化一个函数自卷积的峰值)。
Dream-RSI 在和差问题上拿到 1.145427,领先于 SimpleTES 的 1.143975 和固定探索基线的 1.144047。在圆填充上,它以 2.635983 追平了所有对比方法中报告过的最好结果。在自相关任务上,它得到 1.456375,略逊于固定探索基线的 1.456001,也落后于 SimpleTES 领先的 1.453675 —— 不过 SimpleTES 需要 51200 次生成,而 Dream-RSI 这套做法不到 1000 次。
这些结果表明,探索控制器可以跨问题类型泛化,但并不保证在每个目标上都有改进。自相关这个结果说明:当搜索地形不奖励策略所学会的那类分支与并行决策时,基于重放的策略可能找不到更好的探索方式。
GPU 内核工程:效率 vs. 峰值性能
取自 KernelBench 基准的四项内核工程任务 —— VGG16、LayerNorm、ConvDiv 和 ConvMax —— 检验的是 Dream-RSI 不同维度的表现。
在 VGG16 和 LayerNorm 上,两种方法最终达到的程序性能相当,但 Dream-RSI 分别少生成了 2.43 倍和 1.79 倍的候选。在 ConvDiv 和 ConvMax 上,两种方法被给予相近的生成预算,而 Dream-RSI 产出的程序在执行速度(以每次操作毫秒数的倒数衡量)上分别高出 2.09 倍和 1.44 倍。
论文指出,内核工程要求智能体同时就算法结构、内存访问模式、并行化和硬件特定约束进行推理 —— 这与 Lasso 路径或离散数学优化是相当不同的问题。Dream-RSI 的探索改进能跨这三个领域迁移,说明这个重放机制并不是针对某一类搜索空间狭隘调优出来的。
提示词层面的引导一律起反效果
论文里的一项消融针对一个自然的替代方案:不把历史树当作结构化的重放模拟器,而是把先前的搜索轨迹总结成高层的方向性洞见,注入下一轮的提示词。作者在 ConvDiv 这个内核任务上测试了它,对固定探索基线和 Dream-RSI 都施加了这种提示词层面的引导。
每一种情况下,加了引导都让表现变差。作者把这解读为一个证据:在有许多并行线程的长周期发现里,关于「该往哪儿搜」的强语义偏置往往会过度收紧空间,压制掉让并行探索变得有价值的那份多样性。把历史当作重放模拟器来用 —— 用它去改进控制器如何分配尝试 —— 产出的改进与「告诉智能体该偏好哪些方向」是不同的,而且更持久。
一份会自适应的搜索预算
在对 ConvDiv 任务的额外分析中,论文记录了探索策略的行为在九轮里如何变化。每轮评估的尝试次数从第一轮的 110 次降到 50 次左右,与此同时性能快速提升 —— 策略学会了集中火力。当进展进入平台期,尝试次数又升了回来、达到每轮约 90 次,随后性能再度提升。这种自适应是从策略改进循环里涌现出来的,而不是事先规定好的。
Dream-RSI 的项目页和代码仓库都已公开。论文称该框架可直接用于任何结果能被自动评估的智能体驱动发现场景,而评估器的质量,仍然是这个自我改进循环所能达到之上限的约束条件。