以色列理工学院为机器人视觉接地引入概率,修补规划中的一个核心缺陷
ANPL 的 NeuS 2026 论文在模拟家居机器人任务中胜过确定性基线

当一台基于视觉语言模型的机器人看着杂乱的厨房台面,试图判断杯子是否在架子上时,当前的主流方法会逼它在开始规划之前做出一个不可逆的判断 —— 是或否。以色列理工学院(Technion)自主导航与感知实验室的一篇论文已被第三届神经符号系统国际会议录用,并于今天发布到 arXiv。论文认为,这种被迫只认定一种符号解释的做法是一个结构性缺陷,而不仅仅是工程上的局限;用一个覆盖各种可能符号世界状态的概率分布取而代之,能让机器人规划器在部分可观测环境中的表现可靠得多。
这项研究提出了作者所说的连接视觉感知与符号化机器人规划的第三种范式 —— 它介于现有的两种主流方法之间,并明确考虑了视觉语言模型在把符号事实与图像对应起来(即接地,grounding)时所带有的不确定性。
为什么现有的两种范式在真实条件下都会失效
要理解以色列理工学院团队要解决的问题,先要理解他们所摆脱的两种范式。
第一种方法有时被称为「VLM 即规划器」(VLM-as-planner):在每个决策步骤中提示视觉语言模型,让它直接根据摄像头图像给出下一个动作。视觉语言模型利用其内嵌的语言和视觉语境知识,以自然语言或可执行代码的形式生成计划。这种方法的长处是模型能调动广泛的常识。它的短处是不提供可验证的计划结构,无法保证逻辑一致性,还可能幻觉出一些视觉上看似合理、但流程上错误的步骤。
第二种方法称为「VLM 即接地器」(VLM-as-grounder):视觉语言模型作为感知引擎,为一个独立的经典规划器服务。模型针对当前图像评估符号谓词 —— 比如「马克杯是正放的吗?」或「门是开着的吗?」—— 并给出二值的真假判断。然后,Fast Downward 这类经典规划器利用这些已接地的符号事实,基于用规划领域定义语言(PDDL)描述的规划领域,生成最优的动作序列。这比让视觉语言模型直接规划更有章法,在观测良好的场景中效果也不错。但它的架构里内置了一个关键假设:视觉语言模型对谓词的二值判断是正确的。
2025 年 5 月发布的 ViPlan 基准量化了这个假设崩溃得有多严重。在一个模拟家居机器人环境中,机器人需要在逼真的部分可观测条件下导航和操作物体,「VLM 即接地器」方法的任务成功率只有约 5%,而直接用视觉语言模型规划的成功率为 34%。当场景存在歧义时,认定一个错误的符号状态会产生一份内部自洽、但与事实不符的计划,错误还会在之后的每一步中不断累积。
延伸阅读:前沿视觉语言模型借一套精简的语义动作接口,零样本控制机器人
把感知当作分布,而不是决定
以色列理工学院的框架拒绝把视觉语言模型的感知输出压缩成二值结论,从而避开了这种失效模式。每一次谓词评估都会给出一个概率 —— 例如,估计杯子在架子上的概率为 75%,而不是一个硬性的「是」。这些逐个谓词的概率定义了一个覆盖各种可能符号世界状态的联合分布,而这恰恰是信念空间规划的形式化方法所需要的输入。
信念空间规划通过部分可观测马尔可夫决策过程(POMDP)理论加以形式化,它把机器人对世界的认知表示为一个概率分布,称为信念状态。信念空间规划器在给定这个分布的条件下选择能最大化预期未来回报的动作 —— 关键在于,当信念的不确定性太高、不宜贸然行动时,它可以选择收集信息的动作。如果机器人不确定杯子是否在架子上,一个设计良好的信念空间规划器可能会先靠近架子再看一眼,然后再尝试抓取,而不是立即执行一份以可能错误的观测为前提的计划。
该校的 ANPL 实验室自 2012 年以来一直在持续发表关于 POMDP 和信念空间规划算法的研究,包括带最优性保证的在线规划、高维信念状态的简化方法,以及语义—几何混合信念模型。这篇新论文把这些积累下来的基础应用到一个本质上不同的问题上:为信念空间规划器提供它们所需的概率化感知输入,而这些输入来自现代视觉语言模型,而不是几何传感器模型。
与同期相关研究的比较
以色列理工学院的框架并不是第一个意识到「VLM 即接地器」的确定性正是其致命弱点的工作。来自美国东北大学、麻省理工学院和普林斯顿大学的《Seeing is Believing》(arXiv 2504.03245,2025 年 4 月发布)是一种密切相关的方法,采用了不同、但结构上相似的思路。该系统用三种取值来表示谓词状态 —— 已知为真、已知为假和未知 —— 并把它们整合进一个任务与运动规划(TAMP)框架,在谓词不确定时生成收集信息的动作。论文报告称,在真实机器人的移动操作任务上,这种方法优于「VLM 即规划器」和确定性的「VLM 即接地器」两类基线。
以色列理工学院论文的形式化方法在一个重要方面有所不同:它不使用离散的三态表示,而是把谓词接地视为连续的概率分布,这可以直接对应到 POMDP 的信念状态形式,也可能允许更细粒度的不确定性推理。NeuS 2026 是一个专门面向神经符号系统的会议,论文收录于《机器学习研究论文集》(PMLR)。对于一项在符号方法与概率方法之间架桥的工作来说,这是一个合适的发表场所,因为不确定性下的规划研究群体与神经符号 AI 研究群体在历史上交集有限。
更宏观的规律是,多个独立的研究团队在大约同一个十二个月的时间窗口内,发现了当前「视觉语言模型用于机器人」流程中的同一个结构性缺口。这种殊途同归本身就是一个信号:确定性接地并不只是一个可以逐步改进的工程选择 —— 它似乎是与真实视觉环境的复杂混乱在架构上的不匹配。
实验说明了什么,又没有说明什么
论文报告称,在一个模拟家居机器人环境中,其任务成功率高于确定性接地基线,尤其是在部分可观测、视觉证据含糊的场景中 —— 而这正是 ViPlan 基准已经表明确定性接地会崩溃的条件。这些是作者在经同行评审的会议上报告的结果,尚未有独立复现。
NeuS 2026 的同行评审提供了一定的质量保证,但实验仅限于模拟环境。模拟家居环境可以精确控制部分可观测性和歧义的程度,因此很适合展示该框架的机制。但它们无法回答这种方法能否扩展到真实的传感器噪声、与机器人板载硬件相匹配的算力预算,以及真实厨房和办公室中多样的感知变化。
另一个实际问题是校准。该框架依赖视觉语言模型给出校准良好的置信度估计 —— 也就是能准确反映真实不确定性的概率,而不是会重新坍缩成近似二值的过度自信分数。众所周知,现代大型视觉语言模型在许多场景下给出的置信度分数校准很差;如果输入的概率本身就不可靠,概率化形式的好处就可能被削弱。
延伸阅读:StateSight:新基准显示前沿视觉语言模型在隐式空间推理上仍然失败
从模拟基准到机器人部署的路径
这一研究方向的重要性,超出了它眼下的实验结果。如何把视觉感知与符号规划连接起来,几十年来一直是机器人学中悬而未决的核心问题之一,而视觉语言模型直到最近才跨过能力门槛,可以充当通用的谓词评估器。2025 年的 ViPlan 基准是对主流架构范式的首次严格比较,清楚地记录了它们的失效模式。以色列理工学院的论文和《Seeing is Believing》都是针对这些失效模式的早期解决方案,都植根于机器人学家多年来发展起来的概率规划理论。
这个领域仍然缺少一个可与之相比的「VLM 即概率接地器」基准 —— 一套严格、可复现的评估套件,能让不同方法在相同条件下进行比较。本论文和《Seeing is Believing》中的模拟实验使用了不同的模拟器、不同的视觉语言模型和不同的规划器实现,难以直接比较。如果研究界能统一出一个标准评估框架,这个问题上的进展很可能会加快。
对于如今正在用基础模型感知构建移动操作系统的工程师来说,眼下的实际启示是一种警示:凡是把视觉语言模型的谓词输出当作事实的架构,在任何机器人无法总是看清所需信息的环境里都很脆弱。概率化的替代方案已经出现在研究文献中,并且正在产出经过同行评审的结果。这些结果与可投入生产的实现之间仍有相当大的差距,但理论上的前进路径正变得越来越清晰。