英伟达开源 SoL-Pi:AI 自己优化智能体框架,API 开销降三分之一
四项由 AI 自己找出的机制,把智能体 API 开销砍掉约三分之一,任务表现保住 93–94%

英伟达、NTU 与 MIT 的研究团队于 2026 年 9 月 17 日发表了一篇论文并开源了相应实现。论文描述的系统让 AI 智能体自动改进自己周围的基础设施 —— 不是模型权重,不是训练流程,而是那一层框架(harness):它决定模型如何与工具对话、如何管理上下文、如何解读环境反馈。成果 SoL-Pi 是 Pi 智能体框架的一个扩展,用四项由递归自我改进循环自主发现的机制消除 token 浪费。在一个 51 个任务的留出基准上,它相比 Pi 基线最多减少 49% 的 token 流量、约三分之一的 API 花费,同时保住 Pi 任务表现的 93% 到 94%。
这件事现在重要,是因为 API 成本正日益成为智能体编程部署的硬约束。当智能体从一次性补全转向长时间无人值守的运行轨迹 —— 读工具输出、改代码、跑测试、协调子智能体 —— 冗余的工作会在看不见的地方不断累积:上下文膨胀,大段工具结果在后续每一次请求里重放,一次编辑会触发可预料的后续命令,而每条命令都要消耗一次单独的模型往返。SoL-Pi 的关键发现是,这些低效是可以被自动化找出来的,而且自我改进循环找到的修法,能可靠地迁移到没见过的任务,甚至没见过的模型后端。
延伸阅读:RSI:AI 加速 AI —— 瓶颈已从能力转移到验证
这个自动研究循环究竟做了什么
SoL-Pi 的方法论始于一个随着编程智能体成熟而愈发紧迫的问题:在把递归自我改进推向更大规模之前,AI 系统能不能先让自我改进所需的基础设施本身变得更便宜?
研究者搭建了他们所称的「扩展式自动研究循环」(Scaling Auto-Research Loop)。一个研究智能体观察另一个跑在基础 Pi 框架上的编程智能体的执行轨迹,找出反复出现的开销来源,并提出候选的框架改动。这些候选随后在一个可执行环境池中接受测试 —— 那不是基准测试集,而是研究团队用 GitHub 的 issue–pull request 配对和合成任务构建的、由 535 个环境组成的训练集。凡是能守住能力下限(任务质量保持在预先声明的容差内)并且至少改善一项效率指标的候选,就会被保留并加固。留出集的结果绝不回流到搜索中;候选只要在预留的 EdgeBench 任务上评测失败,就直接被淘汰。
搜索从 152 个提出的方向开始,归入六个假设族:上下文、进度、工具、委派、提示与策略、改进与评估。最终只有四个方向走完了整个筛选流程 —— 大约四十取一的通过率。这四个就成了 SoL-Pi。
编排架构经历了三次设计迭代,才走到论文所称的「一次性技能循环」(disposable skill loops):每一次研究实验都实例化一份最小模板的全新副本,跑到结束,然后把自己改过的编排代码丢掉。这种设计让数百条并行的搜索谱系成为可能,而不会背上早期编译式工作流和代码编排方案中累积起来的协调开销。
SoL-Pi 发现的四项机制
四项幸存下来的机制,各自针对智能体与环境交互循环中一种不同而互补的浪费来源。
Action Fusion 针对的是基础 Pi 轨迹中反复出现的一个序列:改完一个文件之后,智能体通常会再发一条单独的命令去测试、构建或运行改过的代码。这个序列需要一次中间的模型往返 —— 模型要等编辑返回,才能决定发出后续命令。Action Fusion 扩展了 Pi 的工具模式,提供一个融合动作,把编辑和一条可选的后续命令合在一起,在一次观察里同时返回两者的结果。研究智能体发现,训练轨迹中 12.3% 的跨轮次转移都是这个模式。在完全触发的情况下,Oracle 分析预计,对被评估的轨迹集合而言,总 token 会减少 11.5%,模型轮次会减少 10.8%。
Online Context Compact 改变的是框架决定压缩智能体已积累上下文的时机。Pi 原生的做法是按全局 token 上限来推迟压缩。Online Context Compact 改用计划步骤的完成作为触发点:在智能体每完成一个子任务时,框架会估算压缩带来的预期节省,与重写提示缓存前缀的代价相比较,只有当这笔账过了预先声明的门槛才执行压缩。这既避免了过早压缩(白白付出缓存重写的代价),也避免了过晚压缩(让上下文无节制地膨胀)。在 GPT-5.6 Sol 上跑完整的 SoL-Pi 组合时,Online Context Compact 是缓存读取 token 减少的最大单一贡献者。
ObservationPack 解决的是大段工具输出的重放问题。在基础 Pi 里,一次文件读取或一条大命令的结果,会在后续每一次模型请求中完整重现 —— 即便当前步骤只需要其中几行,它仍然同时占着上下文和提示缓存。ObservationPack 会把超过 10 KiB 的结果在本地归档,并在头两次发往提供方的请求中完整发送;从第三次请求起,它把内容替换成一个稳定的句柄、原始大小,以及首尾若干行的简短摘录。智能体需要时可以通过句柄取回确切的分页内容。较小的结果不受影响。这项机制的研究谱系可以追溯到上下文假设族 C23 和 C24 —— 也就是「在为完整内容付费之前先构建观察包」的设想 —— 但它最终的实现改的是观察边界,而不是上下文层,这说明搜索从假设走到机制,可能走出意料之外的路线。
Evidence-Preserving Reducer 针对的是阅读长诊断日志的成本。构建输出和测试日志动辄数千行,但通常只有寥寥几行决定智能体下一步做什么。这个精简器会把符合条件的日志(至少 4 KiB 的构建和测试结果)发给一个成本更低的次级模型 —— 研究者用的是 GPT-5.6 Luna —— 由它提取一份紧凑的「回执」,列出关键证据:退出状态、逐字引用的行、源文件哈希和大小。随后由一个确定性的校验器,对照归档的原件逐字段核对这份回执。如果校验不通过、怀疑输出中含有凭据,或者回执根本没能把体积降下来,框架就回退到完整的原始日志。前沿智能体在上下文里只看到通过校验的回执;诊断和动作选择的责任仍完全在它身上。文件读取和搜索结果完全绕过这个精简器,以免它丢掉智能体主动去找的信息。
这四项机制被设计成互补的。当 Evidence-Preserving Reducer 也开启时,ObservationPack 会变得更挑剔,因为精简器产出的校验回执本来就更小、而且已经带了标记,ObservationPack 认得出来并跳过它们。在各机制各自触发的任务上,完整组合取得的 token 效率提升大于单项机制之和 —— 作者形容这一模式与互补性相符,同时指出这些比较是描述性的,并没有做隔离对照。
为什么框架优化不同于模型优化
有必要说清楚 SoL-Pi 做了什么、没做什么,因为「自我改进」这个说法承载了太多联想。
SoL-Pi 不修改模型权重。它不调整训练数据,不改变后训练流程,也不改变基础模型的推理方式。它改的是框架:那一层软件告诉模型该调用哪些工具、如何管理不断增长的上下文、如何打包和解读环境观察、什么时候把子任务委派给更便宜的次级模型。框架位于模型与环境之间;它塑造模型看到什么信息、以什么形式看到,但不改变模型内部的计算。
此前在智能体效率上的工作大多集中在其他层面 —— 用更快的注意力内核降低每 token 的推理成本,用 KV 缓存压缩减小显存占用,以及像混合专家架构中的稀疏激活这类模型层面的改动。SoL-Pi 的贡献是正交的:它在框架层减少生成和处理的 token 数量,而不需要上述任何模型层面的改动。一个在 Pi 框架后面跑 GPT-5.6 Sol 或 Opus 5 的团队,完全不碰模型服务栈就能装上 SoL-Pi 并拿到效率收益。
这种正交性很重要:它意味着框架层和模型层的效率改进可以叠加。一个团队既换上推理效率更好的硬件,又用上能减少请求数量和请求体积的框架,就能同时吃到两份收益。SoL-Pi 团队在追问的研究问题 —— 递归自我改进能否系统性地、大规模地找出这些框架层的收益 —— 与更快的推理硬件或更便宜的模型权重之争,是两码事。
EdgeBench 衡量什么,SoL-Pi 表现如何
EdgeBench 是字节跳动 Seed 团队的一个基准,包含 134 个真实世界的、以天为量级的任务,覆盖科学与机器学习研究、系统与软件工程、优化、形式化验证和博弈等领域。这个基准是专门为衡量长程智能体表现而设计的 —— 任务可以连续交互长达 12 小时 —— 这让它成为少数几个能真正让框架层效率差异累积并被测出来的公开评测之一。SoL-Pi 只用了其中 51 个公开任务,把 40 个留作最终评测,另外 11 个用于对冻结候选做单向验收。
下文所有结果都来自论文本身;截至 2026 年 9 月 19 日,还没有第三方独立复现 SoL-Pi 的 EdgeBench 数字。
论文给出了 SoL-Pi 的两个工作点。效率点(Efficiency)开启全部四项机制。在 GPT-5.6 Sol 上,它记录到的总 token 为 11.0 亿,而 Pi 是 21.5 亿 —— 减少 49.0%;API 成本为 894 美元,Pi 为 1,339 美元 —— 降低 33.2%。平均任务得分为 42.003,Pi 为 44.833,保住了 Pi 表现的 93.7%。对比 Codex 原生框架(得分 34.738,成本 1,787 美元),SoL-Pi[效率点]既便宜一半,得分也高出一截。对比跑 Opus 5 的 Claude Code 原生框架(2,535 美元,得分 43.689),Opus 5 上的 SoL-Pi[效率点]成本为 1,158 美元 —— 低 54.3% —— 得分 42.224,略低于 Claude Code 的原生得分。
表现点(Performance)为每个后端挑出平均分最高的那一项机制(GPT-5.6 Sol 选 ObservationPack,Opus 5 选 Action Fusion)。在 Sol 上,这把平均分从 Pi 的 44.833 提到 47.208 —— 提升 5.3% —— 同时 token 流量减少 6.1%,token 效率提高 9.8%。在 Opus 5 上,单靠 Action Fusion 就把平均分从 44.756 提到 50.482,是所有被评测配置中的最高分。
迁移结果值得注意。SoL-Pi 完全是在 GPT-5.6 Sol 的轨迹上发现和调优的。原封不动地用到 Opus 5 上时,它在该后端保住了 Pi 平均分的 94.3%,同时把 token 流量减少 44.7%,API 成本降低 33.5%。各机制在 Opus 5 上的触发率低于在 Sol 上 —— 模型的行为模式不同,框架因此更少被触发 —— 但在每一项机制确实触发的任务上,它们仍然都提升了 token 效率。这种跨模型的泛化能力,把 SoL-Pi 与此前那些「在训练模型上有效、换个模型就失灵」的框架优化工作区别开来。
除了 EdgeBench,论文还报告了 Terminal-Bench 4 上 63 个纯 CPU 任务的结果。SoL-Pi 解出 15 个,而 Pi 和 Codex 各解出 18 个 —— 少完成三个。不过,SoL-Pi 在这些任务上的模型总成本是 211.12 美元,Pi 是 286.45 美元,Codex 是 272.35 美元,相比 Pi 降低 26.3%。在 IMO 2026 形式化数学评测(六道题,需要 Lean 4 验证)上,SoL-Pi 通过三道题,总成本 62.69 美元,按每通过一题计算的成本最低,为 20.90 美元,Pi 是 25.32 美元,Codex 是 22.89 美元。
Terminal-Bench 4 上的任务完成差距值得点出来。少解三个任务,对那些完成率比成本更重要的工作流来说,是实打实的能力代价。论文承认了这个取舍,但没有解决它 —— SoL-Pi 的效率组合拿一部分完成概率换来了可观的成本下降,而表现组合因为只用一项机制、而不是四项全上,避开了这个取舍的大部分。
SoL-Pi 在此前的框架优化工作中处于什么位置
在模型能力提升之外,框架优化已经成为一个活跃的研究方向。SoL-Pi 之前有几个系统,也影响了它的设计,包括 Meta-Harness(利用已有代码、分数和轨迹,在可执行的框架程序空间里搜索,并在任务表现与上下文成本之间维护一条帕累托前沿)、递归框架自我改进(Recursive Harness Self-Improvement,逐任务打磨提示层面的规格说明),以及智能体框架工程(Agentic Harness Engineering,从轨迹证据出发演化模块化的框架组件)。这三种路径在这篇论文中都有讨论,论文也据此说明了 SoL-Pi 相对于它们各自的贡献。
Wang 等人 2026 年的一项研究是特别相关的背景:那项工作发现,演化出来的框架往往对搜索任务过拟合,当搜索数据与评测数据有重叠时,它们在留出评测上只能带来微弱的提升。SoL-Pi 的设计正是对此的直接回应。由宽到深的搜索漏斗,让最终评测与全部开发工作完全隔离;留出轨迹绝不进入后续分析;候选一旦在留出验证上失败就被淘汰,不会重开搜索。535 个训练环境的多样性 —— 覆盖许多代码库里真实的 GitHub issue–PR 配对,外加合成生成的、由校验器驱动的任务 —— 正是为减少任务特定的过拟合而选定的。
效率这个优化目标本身,也决定了什么能活下来。只优化任务质量,会留出一条明显的刷榜路径:框架可以把训练任务特有的模式编码进去。而在质量受约束的前提下优化 token 效率,瞄准的是跨任务反复出现的那部分工作。去掉重复的上下文、把不需要中间决策的动作合并、避免重传大段结果 —— 这些都是交互循环本身的性质,而不是某个具体任务的性质,因此更有机会泛化。这是论文给出的论证,跨模型的迁移结果也为它提供了初步支持。
延伸阅读:Anthropic 重新设计 Claude Code Projects:协调智能体、并行线程、共享记忆
智能体集群与基础设施论证
论文还包含一项智能体集群(agent swarm)实验,把单智能体的结果延伸到群体场景。一个跑 GPT-5.6 Sol(通过 Codex)的协调者,指挥 20 个 GPT-5.6 Luna 工作智能体,分成五组、每组四个,执行一项两小时的内核优化任务,以模拟机器周期计分。从同一个冻结的起点出发,比较了三种配置:单个协调者智能体、协调者加 20 个 Pi 基线工作者、协调者加 20 个 SoL-Pi 工作者。
SoL-Pi 集群以 60.11 美元的成本达到 1,127 个周期 —— 比 Pi 基线集群(1,366 个周期,82.12 美元)少 17.5% 的周期,API 成本低 26.8%。两者都通过了全部八个速度门槛,而 Pi 基线集群没能通过最后一个。单个协调者智能体总体最便宜(39.20 美元),但停在 1,333 个周期,处在两种集群结果之间。
集群结果之所以重要,有一个具体原因:多智能体编程工作流在生产中越来越常见,而 API 成本随智能体数量增长。一个能把单个智能体 token 用量减少约 45% 的框架,可能让目前成本上吃不消的集群部署变得可行。论文把这看作一种集体搜索模式的演示:独立的智能体轨迹、有选择的证据共享,以及以验证为门槛的最优结果采纳。
局限,以及独立评测需要回答的问题
有几条重要的但书,应该和这些数字放在一起看。
所有基准数字都来自论文作者。截至 arXiv 上线之日,尚未出现对 EdgeBench 上 44.7%–49.0% token 降幅的独立复现。EdgeBench 本身也没有发布逐机制的成本分析;论文报告的 token 计数基于评测运行期间记录到的 API 流量,论文明确把它与完整的 API 等价量区分开来。
成本数字使用的是 2026 年 8 月 17 日的 API 标价。API 定价会变,每小时节省的估算(相对 Codex 和 Claude Code 原生框架为 8.75–13.50 美元)不会随着底层模型价格的变化而保持准确。
Terminal-Bench 4 上的完成度缺口 —— 解出 15 个任务,而 Pi 和 Codex 各为 18 个 —— 是论文没有充分解释的具体表现代价。作者指出,受基础设施限制,依赖 GPU 的任务被排除在评测之外,这可能以难以与框架效应区分开的方式影响了任务集合。
机制迁移到 Opus 5 后,触发率相比训练后端有所下降。论文把这归因于框架是在 Sol 的轨迹上优化的 —— 模型的行为模式不同,触发因此更少。作者把多后端训练列为未来方向。这个差距对使用 Claude Code 或其他基于 Opus 的配置的团队有实际影响:效率收益真实存在,但更小,而且在某些任务类型上,机制可能根本不触发。
论文作者还指出了一个更深的局限:跑完整的自动研究循环在计算上很昂贵,而在固定预算下对搜索的广度与深度做受控比较,仍是未解问题。150 多个提出的方向和 500 多个环境已经是一个很大的实验;在没有确立搜索规律之前继续扩大规模,仍是一个研究难题。
「递归式效率改进」这个概念指向什么
论文中最有分量的含义不是那四项具体机制,而是团队所称的「递归式效率改进」(recursive efficient improvement)这个研究方向。他们的计划是把 SoL-Pi 当作下一轮自动研究循环的起始框架。更高效的框架会降低每一次搜索迭代的运行成本,这意味着同样一笔算力预算,可以覆盖比原来那轮搜索更多的候选方向、更多的可执行环境和更多轮打磨。在这个视角下,SoL-Pi 带来的效率提升不只是一个结果 —— 它还是为搜索下一代框架所准备的资源。
作者把这表述为长期的研究愿景,而不是当前工作已经证明的复利效应。但它针对的是 RSI 研究的一个结构性约束:自动研究过程本身很贵,这限制了它能被推到多大规模。如果每一代框架都能降低下一代搜索的运行成本,这个约束就会一点点松开。这和那些由更快的注意力内核、更好的量化或更便宜的推理硬件主导的 AI 效率故事不是一回事 —— 而且它所处的那一层,任何使用兼容的编程智能体框架的团队今天就能用上。
SoL-Pi 可以用一条命令装在未经修改的 Pi 发行版之上(pi install git:github.com/NVlabs/SoL-Pi),要求 Node.js 22.19 或更高版本,以及 @earendil-works/pi-coding-agent 的 0.85.1 版,采用 MIT 许可证。四项机制全部是可选开启、默认关闭。代码公开在 github.com/NVlabs/SoL-Pi,版权归 2026 年的英伟达所有;而产出它的那套搜索方法论,其贡献不亚于这四项机制本身:它给出了一个可用的模板,说明如何在框架层大规模地跑 RSI。