机器人 AI 自己修正硬件磨损,无需重训
POSTECH 领衔:部署时 LoRA 自适应,磨损机械臂找回 30 多个点

主要来自韩国浦项科技大学(POSTECH)的研究人员开发出一种技术,让机器人的视觉-语言-动作(VLA)模型无需重新训练核心策略,就能补偿磨损的硬件。该方法于 2026 年 9 月 29 日提交到 arXiv,它测量机器人控制器下达的指令与关节实际执行之间的差距,然后用这个信号更新一小组参数,为下一条指令预先补偿同样的误差。在两台 AgileX Piper 机械臂上 —— 一台全新,一台已运行一年 —— 据作者称,这种方法让每台臂的平均任务成功率都提高了 30 多个百分点。这些结果由作者自报,尚未经独立复现。
论文有两项不同的贡献:自补偿 VLA 框架本身,以及 RoboStress,一个把四种关节退化物理模型编码为七个命名部署场景、并在 40 个任务的 LIBERO 套件上评估它们的仿真基准。
延伸阅读:动手之前先预演:World Action Agent
为什么机械磨损能击败 VLA 策略 —— 以及为什么重训是错误的修法
像 Physical Intelligence 开源的 π₀ 和 π₀.₅ 这样的机器人基础模型,用一个冻结的大型视觉-语言主干搭配一个扩散 transformer 动作专家,把摄像头图像和语言指令映射为末端执行器的增量位姿指令。这些模型能跨物体类别和任务泛化,但它们隐含地假定机器人会忠实地执行其指令。
真实的机器人做不到。运行一年之后,齿轮间隙会在关节换向时造成死区。热漂移会改变重力补偿模型,导致关节下垂或过冲。高负载会引入系统性的力矩偏移。两台同一天投入使用的名义上相同的机械臂,会随时间在机械上分化。
常规的应对是域随机化(DR)—— 在训练期间注入高斯噪声,让策略容忍执行上的变化 —— 或对抗训练。RobustVLA(Guo 等,ICLR 2026)在训练期间于一个有界扰动集合内对每个基础策略做对抗训练,以抵御最坏情况的误差。两种方法都需要访问训练基础设施,必须在部署前运行,并且无法考虑现场某台特定机械臂的具体机械历史。
把指令与执行的残差当作无需奖励的训练信号
自补偿 VLA 框架只在动作专家上附加低秩适配(LoRA)模块,视觉-语言主干保持冻结。LoRA 适配器以秩 4 运行,产生 276 万个可训练参数 —— 占 32.4 亿总模型参数的 0.085%。
在每个部署回合中,机器人记录策略下达的增量位姿指令和关节实际达到的位移。指令-执行残差是两者的归一化差值:如果策略指令是 5 毫米而关节交付了 3 毫米,残差就是 −2 毫米。随后,把这个残差从原指令中减去,构造出一个伪目标,形成一个预先补偿已观测误差的偏移目标。LoRA 权重通过在这些伪目标上的流匹配目标来更新,并带有一项锚定正则化,防止适配器漂移到损害基础策略泛化能力的程度。
不需要奖励信号。该方法不知道机器人是否成功;它只测量机械上的差异,并调整策略来抵消它。这绕开了机器人部署中强化学习的核心瓶颈 —— 在非结构化环境中定义和计算奖励的困难。
RoboStress:四种失效物理,七个场景
在 RoboStress 之前,鲁棒性论文使用的是临时拼凑的噪声注入方案,结果难以比较。这个基准编码了四种有物理依据的退化模型:Stribeck 摩擦(接近零速时与速度相关的粘滑)、重力补偿误差(负载下的系统性力矩偏移)、通过 Tao-Kokotović 死区模型刻画的齿隙(齿轮磨损造成的换向死区),以及通过弹簧-质量-阻尼模型刻画的动态柔度(快速运动下的振荡位置误差)。
这些组合成七个场景 —— 重负载、热漂移-Stribeck、热漂移-齿隙、老化传动、关节老化-均匀、关节老化-肩部、关节老化-肘部 —— 每个都应用于 LIBERO 基准的 四个任务套件、40 个任务。作者报告称,在全部七个场景上,自补偿 VLA 对 π₀ 和 π₀.₅ 都优于域随机化和 RobustVLA。这些结果由作者自报;截至撰稿时尚无独立复现发表。
真实硬件,以及按机器人逐台自适应的理由
在物理硬件上,即便是新臂也表现出指令与执行的不匹配,作者报告新臂的平均归一化残差为 32.9%,用了一年的臂为 35.0%。与未修改的基础策略相比,自补偿 VLA 让两台臂的平均任务成功率都提高了 30 多个百分点,在 π₀ 和 π₀.₅ 的每个任务上都优于基础策略和 RobustVLA。增益也延伸到了微调演示中未见过的物体。
适配器的参数量很小 —— 32.4 亿中的 276 万 —— 表明这种架构适合机器人侧的边缘部署,而不是集中式的训练集群。在一个商业机群中,各臂投入使用的时间不同、累积的机械历史也不同,在任务之间更新的逐机器人 LoRA 层,可以让单一的基础策略服务异构硬件,而不需要任何重训流水线。基础策略保持冻结;每台设备只改变那一层薄薄的补偿层。
该方法尚未证明的
目前的证据覆盖 LIBERO 套件中的抓取放置操作 —— 这类任务容许毫米级的定位偏差。该方法在亚毫米精度要求、持续接触力或装配任务下的表现没有报告。伪目标方法假定执行误差是系统性的而不是纯随机的;如果残差不能平均掉,随机噪声可能引入偏差而不是补偿。锚定正则化约束着适配器,对严重的退化可能不够。
真实世界实验使用的是同一产品系列的两台臂。向不同的机器人形态、控制频率,或轴承失效等非典型失效模式的迁移尚未测试。RoboStress 本身只在仿真中,而四种噪声模型是对实践中常常耦合的退化模式的相互独立的近似。
RoboStress 是否被采纳为社区基准,将决定这个领域能多快在同等条件下比较鲁棒性方法。该基准对 LIBERO 套件的依赖,也意味着它的任务覆盖继承了 LIBERO 的局限 —— 全是抓取放置,没有富接触或力敏感的任务。把 RoboStress 扩展到覆盖高力和灵巧操作,并在 π₀ 家族之外的关节空间和力控机器人上验证自补偿框架,是这个研究方向接下来自然的里程碑。