卡住智能体 AI 的瓶颈不是能力,而是验证
LLM-as-a-Verifier 框架无需重训任何模型,就在四个领域的智能体基准上刷出了新高。

来自斯坦福大学和加州大学伯克利分校的一个研究团队发表了证据,表明制约智能体 AI 表现的首要因素并不是底层模型的能力,而是用来在候选输出之间做选择的那套机制的质量。这篇论文于 2026 年 7 月发布在 arXiv 上,近期登上了 GitHub Trending。它提出了 LLM-as-a-Verifier:一个无需训练的框架,用模型内部评分 token 的完整概率分布来给智能体轨迹打分,而不是把这个分布坍缩成单一的等级。把它套用到现成模型上、不做任何重训,就在 Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench 和 MedAgentBench 上刷出了新的最优结果 —— 这四个基准分别覆盖软件工程、编程、机器人和医疗决策。
余量问题:模型在规模化时其实已经知道答案
论文中最一针见血的观察,来自对 Terminal-Bench V2 的天花板分析。若使用一个总能挑中正确轨迹的先知验证器,Pass@100 接近 98.9% —— 相当于把整个基准解完了。而同一个模型的 Pass@1 只有 83.1%。
这个差距是结构性的,不是能力不足。对该基准上几乎每一项任务,模型在 100 次尝试中至少产出过一次正确解。缺了可靠的验证,就没有办法把它找出来。该框架的主实验 —— 用 GPT-5.5 生成轨迹、Gemini 2.5 Flash 做验证器,候选数 N=5 —— 把 Terminal-Bench V2 的准确率从 83.1% 提到了 86.5%,走完了从 Pass@1 到先知 Pass@5 上限(92.1%)之间一半以上的路,而底层模型完全没有改动。这意味着:原则上,提升验证质量能挖出的潜在性能,要显著多于增大模型规模或增加训练成本。
标准的 LLM 评委为什么会失效
标准的 LLM-as-a-Judge 做法,是提示模型输出一个离散分数,然后取概率最高的那个 token。这把模型内部的不确定性坍缩成了一个粗糙的整数。在Terminal-Bench V2上,这种坍缩使 27% 的两两比较出现平局 —— 评委给两条任务结果明显不同的轨迹打了同样的分。
LLM-as-a-Verifier 的解法,是提取所有评分 token 上的完整 logit 概率分布 —— 20 分制就是 20 个概率值 —— 并计算它们的加权期望。一条被模型稳定评为 20 分制下 14 到 15 分的轨迹,与另一条随提示措辞在 13 分和 17 分之间摇摆的轨迹,即便二者的离散众数输出相同,也会得到不同的连续分数。论文表明,单次评估就能彻底消除平局,而离散基线的平局率是 26.7%。
加大离散评委的集成规模确实能减少平局 —— 从 K=1 时的 26.7% 降到 K=16 时的 5.5% —— 但每一次单独的评估仍然太粗。K=1 的单次验证器已经能追平 K=16 的重度集成评委,论文据此论证:分数粒度比暴力平均是更根本的杠杆。
扩展验证质量的三条独立轴线
验证准确率沿三条彼此独立的轴线提升,并且组合时会叠加。
分数粒度:使用更多不同的评分 token —— 20 分制而非 5 分制 —— 提供更细的分辨率。Terminal-Bench V2 上的两两比较准确率,从 G=1 时的 73.1% 升到 G=20 时的 77.5%。其机制是信噪比的改善:更细的刻度把模型的内部信念投射到分辨率更高的输出空间,从而把那些本来会被四舍五入到同一个整数的信念区分开。
重复评估:运行 K 次独立验证并对连续分数取平均,通过蒙特卡洛估计降低单次评估的方差。准确率从 K=1 时的 74.7% 提升到 K=16 时的 77.5%,且随 K 增大收益递减,因为相关性偏差开始占主导。
标准拆解:把一个笼统的「是否正确」问题拆成更简单的子标准,能防止验证器死盯着某一个显著特征。对编程类轨迹,该框架把规范符合度、输出正确性和无差错执行拆成各自独立的评分环节。单项标准的两两比较准确率在 75.2% 到 76.4% 之间;它们的集成达到 78.3%。
论文的主实验使用 G=20、K=8 以及三标准的编程拆解,在全部四个基准上保持一致,未做任何领域专门的重训。
基准结果,以及它们说明了什么
在 Terminal-Bench V2 上,该框架达到 86.5%,超过了搭配 Terminus-2 智能体脚手架的 Claude Mythos(82.0%)、搭配 NexAU-AHE 框架的 GPT-5.5(84.7%)、搭配 WOZCODE 的 Claude Opus 4.7(80.2%)以及搭配 TongAgents 的 Gemini 3.1 Pro(80.2%)。这些是论文 2026 年 7 月投稿时官方排行榜上的领先数字;此后智能体基准的格局仍在演变,到 8 月,多家实验室的新模型已在 Terminal-Bench 2.1 上刷出更高分数。论文中的这个最优结果,反映的是叠加在 GPT-5.5 之上的一套验证方法,而不是一个新的底层模型。
在SWE-Bench Verified上 —— 500 个真实的 GitHub issue,要求智能体产出能通过维护者隐藏测试套件的补丁 —— LLM-as-a-Verifier 使用一个异构候选池达到了 78.2%:Claude Opus 4.5、Gemini 3 Flash 和 MiniMax M2.5 各出一条轨迹。这个结果表明该框架能作为跨模型家族的元选择器发挥作用,而不只是在单一生成器产出的轨迹之间做挑选。
RoboRewardBench 用机器人操作视频来评估奖励模型,难度更高,因为验证器必须从多帧视频中推理出物理进展。使用 Qwen 3.6 35B,该框架达到 87.4% 的轨迹偏好准确率 —— 高于在约 4.5 万条机器人回合上训练的 RoboReward-8B(81.4%),也高于在约一百万组比较上训练的 Robometer-4B(78.8%)。在完全没有机器人训练数据的情况下取得这样的零样本跨域表现,是一个值得注意的性质。
在MedAgentBench上 —— 这个基准测试智能体在模拟电子病历系统中的操作能力 —— LLM-as-a-Verifier 用 Claude Opus 4.8 作为生成器达到 73.3%,超过了比较池中的每一个前沿模型。
压低验证成本:概率化枢轴锦标赛
两两验证的开销随候选数量呈平方增长:20 个候选需要 190 次比较。论文提出的概率化枢轴锦标赛(PPT)把它降到 O(Nk),其中 k 是一个很小的枢轴候选数。
这个流程分三个阶段。先跑一个随机哈密顿回路 —— 让每个候选在每个位置上恰好被访问一次 —— 得到的初始分数可以抵消验证器的位置偏差。按环路得分排名靠前的 k 个候选构成枢轴集。剩余每个候选只与枢轴比较,把验证预算集中到最不确定的顶层比较上。k=5 的 PPT 在大约一半的比较次数下,达到了与完整循环赛相当的准确率,并在同等预算下稳定优于 V1 基线。
进度追踪与强化学习
连续的验证器分数还与任务的逐步进展相关。成功的 Terminal-Bench 轨迹中,步骤序号与验证器分数之间的斯皮尔曼秩相关(VOC)为 0.848;失败轨迹为 0.769。这 0.079 的差距意味着,实时的验证器分数可以充当长时间运行的智能体任务的早期预警信号 —— 如果分数在任务完成前就停滞,智能体可能已经跑偏了。对机器人操作轨迹,VOC 达到 0.966。
在强化学习中,把验证器分数当作稠密奖励,在离策略的机器人任务(DSRL-SAC,LIBERO 基准,样本效率约提升 1.8 倍,最终成功率更高)和同策略的数学推理任务(Qwen3-8B 上的 GRPO,MATH 基准,约提升 1.1 倍)中都改善了样本效率。数学场景下的增益较小,但在训练早期尤其重要 —— 那时所有采样出的回答都给出同一个错误的最终答案,稀疏奖励无法为策略提供任何可学习的梯度。
部署约束与实务考量
该框架以开源 Python 包和 TurboAgent 代理的形式提供,它拦截 API 调用,并发派出 N 条候选轨迹,运行 PPT 选择,再把最优结果返回给调用方应用。现有的智能体框架无需任何改动。
真正制约实务落地的是 logprob 的可获得性。连续评分方法要求验证器模型暴露 token 级别的概率分布 —— Gemini 2.5 Flash 和 Qwen 3.6 提供这个能力,而 GPT-5.5 和 Claude Opus 4.7 目前的公开 API 并不提供。论文描述了一种两阶段的变通做法 —— 由闭源模型提供推理轨迹,由开源模型提供 logprob —— 它能收回大部分准确率增益,并在 K=1 时消除平局。前沿模型的 API 提供方是否愿意更广泛地开放 logprob,将实质性地影响这项技术能在多大范围内免于变通地部署。
论文还指出,多轮 RL —— 即由验证器在长时程的智能体推演中提供逐步奖励 —— 在当前实验中尚未得到验证。单轮 RL 的结果虽然可期,但该框架在更复杂的序贯场景中的价值仍未被刻画。
延伸阅读:DeepSeek 给 V4 Flash 加上视觉能力,多模态智能体分数逼近 Opus 4.8
验证扩展之后是什么
论文明确把验证与预训练、后训练和测试时算力并列,视为提升大模型与智能体表现的第四条独立轴线。其形式化论证是:论文识别出的三个扩展维度 —— 粒度、重复、标准拆解 —— 各自针对一种不同来源的评估误差,因此它们是叠加关系而非替代关系。
延伸阅读:新研究给出一套原则性公式,让 AI 智能体判断何时该去获取上下文
随着 Terminal-Bench 2.1 的分数继续攀升 —— 截至 2026 年 8 月下旬,GLM 5.3、Grok 4.6 和 DeepSeek V4 Pro 0813 在公开排行榜上都已突破 87% —— 前沿模型的实际能力与标准评估所能分辨的东西之间,差距很可能会收窄。验证质量最有价值的时刻,不是模型弱的时候,而是模型强到「正确轨迹」与「接近正确的轨迹」之间的差别已经很微妙的时候。而这恰恰是当前这一代智能体基准正在进入的状态,也正是 LLM-as-a-Verifier 所针对的那个状态。