前沿视觉语言模型借一套精简的语义动作接口,零样本控制机器人
五个前沿 AI 模型零样本驱动真实机器人,最强的三个成功率 86–96%,无需任何机器人专用训练

新加坡国立大学 Show Lab 的研究团队本周发表论文,主张在实体机器人上部署 AI 的主要瓶颈不在模型智能,也不在训练数据量 —— 而在接口设计。他们的系统 Show-Harness 用一套由十二个离散符号动作组成的词表,把冻结的前沿视觉语言模型接到真实的机器人硬件上,实现了无需任何特定本体微调的零样本操作。在作者进行的正面对比实验中,这一方法在十项操作任务、四种环境变化和两个机器人平台上,都胜过了专用的视觉-语言-动作模型,包括 Physical Intelligence 的 π0.5 和 NVIDIA 的 GR00T N1。这篇论文 arXiv:2609.10522 于 2026 年 9 月 9 日提交,代码和模型在次日公开发布。
论文发布的同时,还有一个公开代码仓库、六个 LoRA 模型适配器和一个放在 HuggingFace 上的演示数据集。此时,机器人行业正为专用机器人 AI 系统所需的带标注物理交互数据的生产成本而头疼。标准的视觉-语言-动作流水线,通常需要成百上千次遥操作演示 —— 由人类操作员亲手引导机械臂,同时由传感器记录每一个关节角、夹爪力和相机画面 —— 模型才能泛化到目标任务上。Show-Harness 的零样本模式完全绕过了这一要求:一个闭源的前沿视觉语言模型接收相机画面和任务指令,每次输出一个十二符号中的动作,再由一个独立的解释器把每个符号转换成真实的机器人运动。
语义动作空间如何运作
Show-Harness 的核心是一套固定的十二个离散动作单元词表:MV_FWD、MV_BACK、MV_LEFT、MV_RIGHT、MV_UP、MV_DOWN、ROTATE_CW、ROTATE_CCW、GRASP、RELEASE、STILL 和 DONE。它们不是坐标、轨迹或 Python 函数 —— 而是模型每个推理步骤输出一个的具名符号。特定本体的解释器是研究人员为每个机器人平台单独编写的确定性模块,负责把每个符号翻译成度量意义上的运动。从 Franka 7 自由度机械臂切换到 AgileX Piper,只需更换解释器及其配置文件;模型、提示词和那十二个符号的词表都保持不变。
把动作单元设计成有语义的具名符号 —— 而不是 A 到 F 这样的任意标签 —— 这个决定是承重的,不是装饰。论文报告的一项消融发现:使用任意符号但方向约定正确,任务成功率仍能达到 95%;使用语义名称但不固定方向约定,成功率降到 90%。两者都去掉 —— 让模型通过自己的试错去推断映射 —— 成功率就崩塌到 5%,20 次推演中有 19 次超时。这个接口不是动作空间外面的装饰;它本身就构成了动作空间。论文作者写道,模型本来就已编码了机器人操作所需的大部分东西 —— 空间推理、物体识别、目标分解 —— 而语义接口提供的是把这些能力表达为机器人运动所需的最后一公里落地。
每个控制步骤都闭合一个「感知—推理—动作」回路。一个插件系统负责组装视觉语言模型的输入上下文:来自一个或多个视角的相机图像、可选的腕部相机数据、本体感知(关节状态与末端执行器位姿)、在回合开始时生成的子任务计划,以及滚动的动作历史。视觉语言模型随后输出一个符号,解释器执行它。循环往复,直到输出 DONE 或达到时间上限。这些插件组件是模块化、可开关的:在消融研究中,多视角引导贡献了 38 个百分点,子任务规划 36 个点,本体感知 28 个点。一个动作分块插件可以在下一次调用视觉语言模型之前批量执行多个步骤,在成功率不变的情况下把 API 调用减少 19%。
测试了五个前沿视觉语言模型 —— 差距在空间落地,不在规划
论文评测了五个以零样本方式运行的前沿视觉语言模型:Gemini-3.1 Pro、GPT-5.6-sol、Opus 5、GPT-5.6-luna 和 Gemini-3.6 Flash —— 模型名称以论文作者的报告为准。团队报告,这些模型分成两个表现梯队:Gemini-3.1 Pro、GPT-5.6-sol 和 Opus 5 在整套基准上的成功率达到 86–96%,而 GPT-5.6-luna 和 Gemini-3.6 Flash 集中在 72–78%。
在一项「象棋炮」操作任务 —— 一个精确放置问题 —— 上做的能力分解实验,找出了表现差距的来源。指令遵循和子任务规划在五个模型上都接近饱和,准确率达到 97–98%。区分高下的是细粒度的空间落地能力:第一梯队模型的空抓率(夹爪落空或错位)为 6–15%,而较低梯队的模型升到 26%。这意味着,与机器人控制相关的前沿视觉语言模型进展,目前受限的不是语言理解或目标推理,而是模型在三维空间中精确定位物体的能力。
加大思考预算能提升表现,但有代价。思考强度更高的 GPT-5.6-sol 平均每回合 30 步,而较低强度时是 37 步 —— 回合更短意味着动作选择更高效 —— 但由于额外的推理计算,每回合耗费的实际时间是原来的 3.4 倍。对于实时部署场景,这种取舍可能不切实际。
当微调在延迟上胜过前沿模型
零样本模式依赖通过 API 访问的前沿视觉语言模型,这会带来可能超出快速任务所能承受的延迟。为此,Show-Harness 包含一个微调模式:一个小型开放权重视觉语言模型,用 GUMI 采集的演示数据、通过 LLaMA-Factory 以 LoRA 适配器训练,并用 vLLM 在本地提供服务,每步输出一个动作 token,而不跑完整的规划回路。默认的微调配置使用 Qwen3.5-2B,在真实硬件上达到 33 Hz;9B 版本约为 12 Hz。
规模扩展的表现是非线性的,而这对部署选择很重要。在标准操作任务上,成功率从 2B 到 9B 基本持平 —— Qwen3.5 的 2B、4B 和 9B 彼此相差不到四个百分点(88–92%)。最小的骨干(0.8B)在技术上能输出有效的动作单元,但会犹豫,把回合从 37 步拉长到 58 步,成功率 72–74% —— 长到足以增加碰撞风险,并在有时间限制的任务上失败。9B 模型输在动态目标上:在一个滚动网球任务中,2B 为 80%,0.8B 为 70%,9B 为 60%。每次决策耗时 79 毫秒的更大模型追不上移动的物体,而 2B 模型 39 毫秒的响应跟得上。对于需要几何精度的静态操作任务 —— 叠积木、插销入孔 —— 9B 模型在空间落地上的优势把成功率从 50% 提高到 75%;对于任何时间敏感的任务,2B 是更好的选择。
团队还在 HuggingFace 上发布了六个 LoRA 适配器(Qwen3.5 的 0.8B、2B、4B 和 9B,外加 Gemma 4 e4b 和一个只用仿真数据训练的 Qwen3.5-2B 策略),以及覆盖 Franka 和 AgileX Piper 推演、并附带 ManiSkill 仿真数据的真实机器人演示语料。
GUMI 用一个浏览器和一副键盘取代遥操作硬件
微调所需的数据采集问题,由 GUMI(GUI Manipulation Interface,图形界面操作接口)解决:它把十二个动作单元映射到浏览器界面中的键盘按键上。演示任务的人按 WASD 或方向键;每一次按键都被记录为一个(观察,动作)训练对,可直接用于 LoRA 微调。由于每个动作单元都是带标签的符号而非连续的运动指令,同一个浏览器界面还可以让一个 GUI 智能体 —— 一个会点击和打字的软件系统 —— 驱动同样的机器人控制任务,自主采集数据。
实际的后果是,负担不起遥操作硬件 —— 六轴动作捕捉系统、力反馈外骨骼或 VR 设备 —— 的机构,也能产出训练数据。据行业估计,遥操作设施每套成本在 5 万到 15 万美元之间,每名操作员每天产出不到 200 次演示。GUMI 只需要一副键盘。微调结果还表明,仿真演示可以迁移到真实硬件:只用仿真数据训练的 Qwen3.5-2B 微调适配器,在一个两个 VLA 基线(π0.5 和 GR00T N1)都是 0/20 的任务上,在真实机器人上取得了 20 次中 13 次成功。
延伸阅读:TwinDEX 把机器人操作的数据难题挪到硬件设计阶段解决
Show-Harness 与 VLA 和「代码即策略」路线相比如何
专用的视觉-语言-动作模型代表了当前通用机器人控制的主流路线。Physical Intelligence 的 π0.5在最初的 π0 流匹配策略基础上增加了开放世界泛化能力;NVIDIA 的 GR00T N1把一个 13.4 亿参数的视觉语言模型骨干与一个扩散 transformer 动作头配在一起,在一块 L40 GPU 上每次调用 63.9 毫秒推断出 16 个动作步。两者都需要大量特定本体的预训练数据。论文作者报告,Show-Harness 零样本模式在跨任务基准上达到 89%,而最好的基线是 57%;在跨本体测试中是 93% 对 52%。这些都是作者自己的评测,尚未有独立复现发表。
「代码即策略」范式让大语言模型生成编排运动原语的 Python 程序,自谷歌 2023 年最初的 Code as Policies 工作以来一直有人探索。它与 Show-Harness 一样依赖视觉语言模型的推理,但在执行上有根本不同:语言模型产出的代码随后在另一个执行环境里运行,这引入了第二个失败点(代码是否正确),也把机器人的完整 API 暴露给了模型。Show-Harness 通过让模型每一步只负责十二个符号中选一个,并把物理执行完全交给确定性解释器,避开了这两个问题。
对 Show-Harness 的主张构成最直接挑战的,是真实机器人上的泛化差距。零样本结果在论文自己的基准上很强,但这个系统还没有在新加坡国立大学实验室之外、在研究团队没有设计过的任务和环境中接受独立测试。只要开发系统的团队同时也构建评测,就存在基准污染的风险 —— 论文没有明确讨论这一局限。
剩余的局限揭示了什么
论文自己的消融实验对系统在哪里失败异常坦诚。单单去掉多视角引导 —— 来自多个角度的相机视角 —— 成功率就下降 38 个点。这说明当前的语义动作词表对单视角下的局部遮挡不够鲁棒,而这在真实部署中是常见情况。自适应步长插件允许解释器改变每个动作单元让机械臂移动的距离,在部分任务上要达到 96% 离不开它;没有它,粗步长配置的成功率降到 70%,细步长配置降到 82% —— 这表明解释器中的度量映射必须能根据任务需求调整。
动作词表同时需要语义命名和方向约定,这是一个部署风险:如果提示词对「左」的描述与机器人坐标系不符,或者对哪个相机轴对应哪个方向的定义前后不一,很可能导致系统性的操作失败,重现论文为未映射情形记录的那 5% 场景。提示词工程的严谨性,于是成了一项承重要求。
在推理层面,零样本模式对 API 的依赖带来了成本和延迟上的风险敞口;微调模式在本地解决了这一点,但要以模型能力为代价。前沿视觉语言模型在空间落地 —— 已被认定的主要瓶颈 —— 上仍在持续进步,这意味着随着 GPT、Gemini 和 Claude 模型在三维物体定位上变得更好,这个接口的零样本表现上限会随之抬高,而 Show-Harness 本身不需要任何改动。
一个超出这篇论文的接口问题
Show-Harness 更深层的研究主张是:把前沿 AI 部署到机器人上,并不需要让 AI 模型「物理化」—— 而是需要通过恰当的接口,让物理系统变得能被 AI 模型读懂。团队的消融证据支持这一点:五个受测前沿视觉语言模型之间的表现差异,与空间落地能力的相关性,比与模型规模或推理深度的相关性更强;而决定物理控制究竟是否可能的,是符号接口本身,而不是它背后的模型。
这一发现如果能经受外部复现,其意义将超出操作基准。GUMI 把同样的十二符号空间延伸到 GUI 智能体上,这表明语义接口可以把前沿视觉语言模型接到任何离散、带标签的动作有意义的系统上 —— 无论是物理的还是虚拟的。当同一套动作词表同时驱动两者时,机器人控制与电脑操作智能体之间的边界开始变得模糊。这一方法能否推广到非结构化操作、动态环境,或者涉及几十次子任务切换的长时程任务,是后续研究需要回答的问题。代码和模型已在 Show-Harness GitHub 仓库 公开;可复现性的检验已经开始。