大语言模型以零样本融合控制,把工业机器人集群的无线通信量削减 38%
Orange Innovation 与 L2S/巴黎萨克雷大学在 ACSOS 2026 上展示了无需训练的大语言模型控制

来自 Orange Innovation 与法国信号与系统实验室(L2S,由法国国家科学研究中心 CNRS、CentraleSupélec 和巴黎萨克雷大学共建)的联合团队证明,大语言模型可以充当工业机器人集群的实时协调控制器:用逐周期的推理取代静态规则,判断哪些机器人应当为共享感知贡献数据,以及它们的传感器数据应当如何融合。这套系统名为 CoAdapt,在 OPV2V 自动驾驶基准上的测试中,它把机器人之间的无线通信开销降低了 38%,同时 3D 目标检测精度与全员参与的基线持平 —— 而且做到这一点不需要任何针对具体任务的训练。论文于 9 月在意大利切塞纳举行的 IEEE ACSOS 2026 会议上发表,随后发布到了 arXiv。
多机器人工业感知中的带宽问题
工厂和仓库越来越多地部署自主移动机器人(AMR)车队,这些机器人共享各自的激光雷达观测,拼出对环境的集体认知 —— 这种技术叫作协同感知。实际中的瓶颈在于无线通信:如果每台机器人在每个感知周期都把完整的点云数据发给其他每一台机器人,由此产生的数据量足以让专用 5G 网络饱和。工业 5G V2X 部署在严格的带宽约束下运行,因此在规模上让整个车队共享原始传感器数据并不现实。
标准的工程应对是训练专门的神经网络,让它学会该传输哪些数据。Where2comm 利用空间置信度图来选择通信对象。HydraCollab(已被 IROS 2026 录用)利用空间置信度图来选择要传输哪些特征,并在中期融合与后期融合策略之间动态切换。两者都实现了可观的带宽削减,也都需要标注数据,以及一次针对具体部署环境调校的训练。当工厂的机器人车队配置发生变化时 —— 生产布局更新、某台机器人下线维护 —— 学到的参与策略可能需要重新训练,才能在新的拓扑上被信任。
CoAdapt 如何把大语言模型放进控制回路
CoAdapt 走的是相反的路子:它不训练参与策略,而是把每台机器人的激光雷达数据转换成对场景的结构化自然语言描述 —— 编码位置、视场重叠、观测质量和网络状态 —— 再把这段描述交给大语言模型。模型随后在每个感知周期做出两项相互配合的决策:哪一部分机器人应当贡献数据,以及用哪种融合算法(早期、中期或后期融合)来处理这些数据。
从激光雷达到语言的这一步是关键。通过把原始点云转换成结构化文本,系统把物理传感器的几何信息落到一种大语言模型无需针对任务微调就能推理的表示上。模型对这段描述运用通用的空间推理能力,输出配置决策。由于策略存在于大语言模型的权重之中,而不是某个针对特定数据集训练的网络里,它可以泛化到从未见过的集群配置。
研究人员在 OPV2V 上的 25 种场景配置中评估了 CoAdapt。OPV2V 是一个模拟基准,包含 11464 帧,每帧最多有七个协作智能体。检测精度与始终让全部机器人参与的静态基线相当,而通信量下降了 38%。这个 38% 是作者在模拟中报告的数字;由于论文刚在会议上发表,目前还没有公开的独立复现。
延伸阅读:前沿视觉语言模型借一套精简的语义动作接口,零样本控制机器人
无需训练的泛化能力,以及它带来了什么
不需要训练这一点,比乍看起来更重要。工业 AMR 车队的拓扑并不是静态的 —— 产品换线、维护轮换和季节性的业务量波动,都在不断改变哪些机器人在场、位于何处。在一种配置上训练出来的参与控制器,换到下一种配置时必须重新验证。CoAdapt 基于大语言模型的设计从根本上绕开了这个重新验证的循环:控制器以文本形式读取当前状态并重新推理,不依赖与新拓扑相匹配的历史训练数据。
这一特性还意味着,具体的融合算法仍然可以互换。每个周期用哪种算法由大语言模型来选,因此可以引入新的或更高效的融合方法,而无需重新训练协调层 —— 只需更新对每个选项作用的自然语言描述。
模拟的边界与悬而未决的问题
在拿这些结果对照真实部署的需求之前,有几项限制需要先说清楚。所有测试都是在模拟中进行的。OPV2V 由 CARLA 自动驾驶模拟器生成;它无法复现工厂车间的射频条件、机械设备的干扰,以及工人的移动模式。
更关键的是,论文没有对照工业控制的时序要求来测试大语言模型的推理延迟。5G 超可靠低时延控制场景的目标周期低于 10 毫秒。在每一轮感知中调用一次大语言模型推理会增加延迟,这部分延迟需要先经过测量 —— 并可能要借助蒸馏、量化或部署在边缘的模型来解决 —— CoAdapt 才能在实时控制中得到验证。38% 的带宽削减是在一个没有计入这部分推理开销的模拟中测得的。
该系统还继承了大语言模型的失效模式:含糊或被截断的场景描述可能导致次优的参与决策;而且,训练出来的网络,其失效行为可以通过实证来刻画,大语言模型控制器在工业回路中的边缘情况行为却尚未得到系统的理解。
与学习型方案的对比
拿 HydraCollab 在其自身基准数据集(V2X-R 和 V2X-Radar)上的结果直接比较,学习型的空间置信度门控实现了更极端的带宽削减 —— 通信量分别只有 Where2comm 的 41% 和 26%,同时还提高了检测准确率。CoAdapt 的 38% 削减是在不同的数据集(OPV2V)上、相对于不同的基线(静态全员参与)测得的,所以这些数字描述的是不同的东西。真正有意义的区别在于架构:HydraCollab 需要针对每个数据集做端到端训练,CoAdapt 则完全不需要。在同等条件下,零样本的灵活性是否要以牺牲绝对带宽效率为代价,仍是一个悬而未决的问题。
这种模式可能走向何方
ACSOS(IEEE 自主计算与自组织系统国际会议)是这项工作合适的归宿。「大语言模型作为运行时控制器」这种模式,如果能经受住从模拟到硬件的过渡,就意味着语言模型推理在工业技术栈中的用武之地扩大了:它不再只是接口或规划器,而是物理传感器网络中每个周期的编排者。悬而未决的问题很具体:这套架构能否满足工业时序预算?从激光雷达到语言的转换在真实工厂条件下是否站得住?把大语言模型推理在内的整个系统延迟预算都算进去之后,38% 的通信节省还能否保持?这些问题的答案,将决定 CoAdapt 的架构思路是成为一种工业工程选项,还是停留在模拟结果。