动手之前先预演:World Action Agent
该框架在 LIBERO-Pro 上拿到 75.6%,并把一个 90 亿参数开源模型的域外成绩从 1.7% 拉到 43.3%

一套名为 World Action Agent 的新机器人操作框架本周作为预印本发表在 arXiv 上,它为具身 AI 一个长期难题给出了不同的答案:一个从没被训练过控制机械臂的通用视觉语言模型,怎样才能可靠地控制它?World Action Agent 的做法既不是用机器人演示数据去训一个专用的端到端模型,也不是生成符号化代码交给机器人执行,而是在任何物理动作发生之前,先把机器人即将要做的事演示给它看 —— 并让它修改和确认。在 LIBERO-Pro(LIBERO 桌面操作基准的一个更难的鲁棒性变体)上评测,该框架达到 75.6% 的任务成功率。而当这个框架的交互日志被拿去微调一个 90 亿参数的开源权重模型时,该模型的域外成功率从 1.7% 升到 43.3%,指向一条无需在推理时依赖大型云 API 的本地部署路径。
该预印本于 2026 年 9 月 24 日提交到 arXiv,次日出现在 HuggingFace Daily Papers 上。这篇论文被它 16 人的作者团队标注为「进行中的工作」,作者单位包括香港科技大学(广州)和香港中文大学:结果尚未被独立复现,框架也是在仿真而非实体硬件上评测的。这种早期发布符合当前 AI 研究快速在社群中流通的惯例,但也意味着这些结果到来时,还缺少同行评审通常会要求的额外基线和消融实验。
一个把机器人所见与所改都结构化的视觉工作区
该框架的核心构件是作者称为「视觉动作工作区」的东西 —— 三项设计选择共同改变了视觉语言模型与操作任务打交道的方式。
第一项是接触视角:从场景三维几何中自动挑选视点,把视觉语言模型放在遮挡最小、能清楚看到夹爪与物体接触区域的角度上。这针对的是基于视觉语言模型的机器人技术里一个常被低估的失效模式 —— 模型因为相机相对于动作的位置不佳而误判物体位置。
第二项是动作预演,也是这个框架最有特色的贡献。在发出任何运动指令之前,一个叫「想象智能体」的内部子智能体会生成候选动作轨迹,并在工作区里渲染成视觉叠加层 —— 也就是机器人打算做什么的三维预览。视觉语言模型审阅这个表示,可以在执行前修改或否决这个方案。这个机制很像一个人在伸手去拿东西之前先用手指比划一下路径:这种可视化建立了一个自检回路,让模型能抓住那些仅凭文字指令会漏掉的空间或时序错误。作者把这种能力称为「世界动作预演」,并将其归入一类新兴系统 —— 它们在投入行动之前显式地对未来世界状态建模。
第三项是视内校正:动作执行之后,校正在同一个视觉工作区内施加,而不是经由一条独立的反馈通道,从而让「观察-规划-行动-校正」这个循环的感知回路保持连贯。
技能由演示演化而来 —— 不是零样本学习
此前有一则新闻简讯把 WAA 描述为实现了「零样本」机器人控制 —— 而其真实架构并不支持这个说法。该框架的第二个子智能体,技能智能体,会查阅一个多模态技能库,这些技能是从LIBERO-90 数据集中的专家视频演示演化而来的:那是一组包含人类演示的 90 项桌面操作任务。这些技能是经过一个「基于证据的复核」过程提炼的,而不是被直接回放,但它们源自演示这一点意味着,WAA 并不是经典意义上那种「不需要任何范例」的零样本。
该框架真正做到的是跨任务泛化:在 LIBERO-90 上演化出的技能,无需针对目标重新训练就能迁移到 LIBERO-Pro 和 LIBERO-Plus —— 前者是一个更难的鲁棒性基准,后者包含 10030 种任务变体。标准的端到端 VLA 训练在任务分布改变时常常明显退化;WAA 通过把推理路由给一个带结构化工作区的通用视觉语言模型,看起来降低了这种敏感性。这个区别在实践上很重要:评估机器人学习系统的团队需要知道,自己对比的是一个零样本基线,还是一个在任务类层面需要演示的系统 —— 而后者才是 WAA 的真实要求。
延伸阅读:前沿视觉语言模型借一套精简的语义动作接口,零样本控制机器人
LIBERO-Pro 的成绩说明了什么,又没说明什么
LIBERO-Pro 检验的是在干扰物体、背景变化和目标描述被改动等条件下的鲁棒性 —— 这些条件比更干净的 LIBERO 基础套件更能代表真实的任务变化。WAA 的 75.6% 被报告为优于两类基线:一类是让视觉语言模型为预定义机器人原语生成 Python 程序的 Code-as-Policy 系统,另一类是在机器人演示数据上训练的端到端 VLA 模型。
与 Code-as-Policy 路线的对比很有信息量,因为它部分地隔离出了视觉预演这一步的贡献。Code-as-Policy 系统同样把通用大语言模型或视觉语言模型当作推理层,但它们把操作分解成针对固定运动原语执行的离散符号程序 —— 比如一个像 grasp(object="cup") 这样的函数调用,配一段写死的夹爪动作。WAA 的视觉工作区作用在三维渲染出的连续运动轨迹上,这可能在方案验证阶段给视觉语言模型提供了更具几何意义的信息:模型审阅的不是一个抽象的函数名,而是一条渲染出来的轨迹,从而能在执行前抓出空间错误。这个说法表面上说得通,但要隔离出视觉预演对基准成绩的具体贡献,还需要一个把这一步拿掉的消融实验。
与Physical Intelligence 的 π0/π0.5以及英伟达 GR00T N1 的对比,则属于另一个维度:那些端到端 VLA 是在大量机器人演示语料上训练、并针对特定本体优化的。它们并没有被 WAA 的仿真结果直接取代;对部署团队而言,真正相关的问题是仿真中的跨任务泛化能否预测真实世界的跨任务泛化 —— 这一点仍然没有答案。
蒸馏这一发现:从框架到可部署的小模型
实践含义最清晰的结果,是基于轨迹的蒸馏实验。WAA 框架会生成自身运行的日志 —— 构成每次交互的视觉观察、动作预演步骤、校正和技能查阅 —— 研究团队用这些日志微调了Qwen3.5-9B,一个来自阿里通义团队、90 亿参数的开源权重视觉语言模型。选 Qwen3.5-9B 很有意味:它是一个相对小、开源权重、能在消费级 GPU 硬件上本地运行的模型,而不是一个专有的前沿模型。域外任务成功率从 1.7% 升到了 43.3%。
1.7% 这个基线说明,一个未经改造的通用视觉语言模型在操作任务上有多不行。终点 43.3% 仍低于可投产的门槛,但这超过 25 倍的提升表明,框架的交互轨迹里带有相当可观的训练信号。这暗示的实际架构是两段式:先在仿真里跑完整的 WAA 框架来生成高质量交互数据,再把这些数据蒸馏进一个更小的、可在执行时本地运行而不必走云端推理的可部署模型。在仓库或网络受限环境里作业的实体机器人,面临着真实的单次推理延迟与成本约束,这让这条蒸馏路径很有意义。43.3% 能否迁移到实体硬件是论文没有回答的另一个问题,但仅凭轨迹就能取得这个量级的提升,已经足以让这条路值得走下去。
视觉语言模型框架 vs. 端到端 VLA:两种相争的哲学
World Action Agent 进入的是一个有两种策略在争夺势头的领域。端到端 VLA 模型 —— π0、GR00T N1 —— 通过机器人专属的训练数据把操作物理内化进模型,在它们所训练的任务上表现强劲。视觉语言模型框架路线 —— WAA、Show-Harness、Code-as-Policy —— 则主张通用视觉语言模型本身已经携带足够的推理与视觉理解能力,可以通过结构化接口被调用出来,从而减少对大规模机器人专属数据集的依赖。
在框架这一派内部,WAA 的立场与 Show-Harness 不同 —— 后者由新加坡国立大学 Show Lab 于 2026 年 9 月早些时候在一篇独立的预印本中发表,本刊曾另文报道。Show-Harness 把操作分解成 12 个离散的语义动作单元(伸手、抓取、放置等类别),把视觉语言模型的推理路由进这套固定词汇表,在其评测任务上报告 86–96% 的零样本成功率。两个系统不能直接比较:它们跑在不同的基准上、任务分布不同,押的结构性赌注也不同。Show-Harness 按动作语义来分解,把操作的词汇表显式化;WAA 则按视觉渲染与复核来分解,让动作轨迹保持连续、但在执行前让它在空间上可见。两种路线都在给底层视觉语言模型本身不具备的东西加结构;区别在于它们施加的是哪个维度的结构。两者同出现在 2026 年 9 月这一个月里,说明框架的设计空间正在被从多个方向同时探索。
WAA 的预演回路还接上了 AI 领域一个更大的趋势:结构化自我验证 —— 当模型在投入之前先评估一遍生成的方案时,输出会变好。语言推理里的思维链提示、测试驱动的代码生成、迭代式的数学证明验证,反映的都是同一个原理。WAA 把它用在了空间动作规划上,而验证以一种与任务领域匹配的视觉形式被渲染出来。
延伸阅读:以色列理工学院为机器人视觉接地引入概率,修补规划中的一个核心缺陷
把这些结果当作部署基准之前,要紧的几条限制
仿真到现实的差距,是 WAA 结果上最重要的一条限定。LIBERO-Pro 完全基于仿真,跑在一个物理引擎里,而这个引擎并不能完整刻画真实机械臂与实体物体交互时出现的接触动力学、传感器噪声、摩擦变化或物体形变。在 LIBERO 类环境里表现良好的系统,有时在硬件试验中会大幅失手,因为仿真施加了一些隐含的简化 —— 完美的夹爪柔顺性、理想化的物体几何、可预测的质量分布 —— 而这些在实际中并不成立。在该框架于实体硬件上被评测、并被一个独立研究组复现之前,75.6% 这个数字应当被读作一个有希望的仿真结果,而不是部署基准。
蒸馏得到的 Qwen3.5-9B 在 43.3% 这个水平,远低于生产部署所需,而要达到可部署级别的表现需要多少、多好的轨迹,也还不清楚。技能库对 LIBERO-90 演示的依赖,同样把当前实现绑在了那些任务的物体类别和操作风格上;技能演化机制在差异很大的领域 —— 外科机器人、建筑装配、处理非标物体的仓储物流 —— 能泛化到什么程度,尚未验证。
预印本上「进行中的工作」这个标注是一个真实的提示:机器人 AI 论文在早期发布与同行评审之间可能发生实质变化,因为额外的基线、消融实验或真机实验会暴露原有评测范围里的缺口。
从这份预印本的早期发布能看出接下来会做什么
选择带着「进行中的工作」标注早早放出来,说明团队把当前框架视为一个可扩展的基座、而不是一个完成品。实体硬件评测是最重要的一块缺失验证。把技能库从 LIBERO-90 扩展到 Open X-Embodiment 这类数据集,可以检验技能演化究竟是仿真特有的,还是更具一般性。用更多轨迹和更大的目标模型来扩大蒸馏实验,则能确定蒸馏曲线在哪里走平。
这个框架抛出的更深的问题是:随着底层视觉语言模型的空间推理能力提升,动作预演会变得更重要还是更不重要?如果未来的模型携带更丰富的三维物理动态内部表示,那个显式的视觉工作区可能就没那么要紧;如果空间推理即便在更大规模下仍是相对短板,这层外部脚手架就会继续承重。两种答案都有用,而找到答案的办法,是把预演回路放到越来越强的骨干模型上去跑 —— 这对该团队、以及对将来复现或扩展这项工作的其他人来说,都是一条自然的实验路线。