StateSight:新基准显示前沿视觉语言模型在隐式空间推理上仍然失败
StateSight 的三项程序化生成任务,揭出了格式合规的输出所能掩盖的空间推理失败
今天在 arXiv 上挂出的一项新基准显示,GPT-5.5 和 Claude Sonnet 5 —— 两个目前能力最强的商用视觉语言模型 —— 在该研究测试的每一项空间推理任务上,得分都远低于 30 人组成的人类基线,其中 Claude Sonnet 5 在三项中最难的那一项上只有 7.3%。这项研究题为《StateSight:为视觉语言模型中的隐式空间状态重建建立基准》,作者为 Michelle Lin,提出了一个程序化生成的基准,专门用于隔离出一项更宽泛的 AI 评测通常测不到的能力:仅凭一张图像重建出隐藏的空间结构,且不借助文字标签、领域知识或可识别的物体。
让这个结果比大多数视觉语言模型空间推理研究更难被打发的,是它的评分方法。StateSight 使用确定性的标准答案 —— 由算法生成的数字,不是人工标注的,也不是由另一个语言模型来评判的 —— 并且要求答案精确匹配。所有模型运行都没有产生任何格式错误。模型理解了问题的格式;它们只是没能还原出问题所指向的那个空间状态。
三项抽掉了一切捷径的任务
StateSight 的三个任务族,是为了消除困扰大多数多模态基准的那些混杂因素而选定的:对真实物体的感知、光学字符识别、领域知识,以及语言先验。每一题都给出一张程序化生成的单张图像,并提出一个只有通过在脑中模拟一次空间变换、或遍历一种结构关系才能回答的问题。
第一项任务是立方体展开图对面推理:给出一个立方体六个面的二维展开图 —— 也就是一张展开的平面图 —— 并问哪个面正对着某个指定的面。要答对,必须在脑中把展开图折成三维立方体,并跟踪每个面在折叠过程中的去向。GPT-5.5 在这项任务上得分 59.3%;Claude Sonnet 5 得 53.3%;人类基线达到 80.8%。
第二项任务是被遮挡立方体塔计数:给出一堆立方体,其中位置较低的立方体可能被上方的挡住。模型必须推断总共有多少个立方体,包括那些看不见的。这是一种遮挡推理:正确答案无法从可见表面直接读出,必须从可见的几何关系中推导。GPT-5.5 达到 33.3%;Claude Sonnet 5 为 18.7%;人类为 68.8%。
第三项任务是四邻域连通分量计数:给出一张网格图像,问在四邻接(也就是区域只通过上、下、左、右相邻而连通,不算对角线)的定义下,存在多少个不同的连通区域。与前两项不同,这一项要求非局部推理:模型无法靠孤立地关注局部图块来识别连通分量,它必须在脑中遍历整张网格,才能确定什么与什么相连。Claude Sonnet 5 得分 7.3% —— 在典型复杂度的网格上,几乎与随机猜测难以区分。GPT-5.5 达到 28.3%。人类基线为 64.3%。
基准的设计,以及确定性标准答案为什么重要
在 StateSight 的三个任务族中,每一个都包含 300 道单图提示,合计 900 道评测题。人类参与者(共 30 人)每人回答 60 道 —— 每个任务族 20 道 —— 他们的回答用与评测模型相同的标准答案来打分。这些标准答案由生成该基准的代码确定性地产出,这意味着不存在标注者分歧、真值没有歧义,也不可能出现「评判模型自身的局限抬高了被测模型分数」的情况。
最后这一点很重要。如今越来越多的 AI 基准使用强大的语言模型来评判回答,这就制造出一个循环问题:与评判者同族的模型,可能因风格上的熟悉感或共有的错误模式而占便宜。StateSight 完全绕开了这一点。一个回答要么对、要么不对,而正确与否由算法确立,不是由某种意见确立。
这篇论文还提出了StateSight-Steps,一个配套数据集,包含 900 个图文交错的样例和 3600 个确定性的中间视觉状态。StateSight-Steps 的设计目的,是支撑那些提供逐步视觉监督的训练方法 —— 显式标注出一个正确的求解者在通往最终答案的路上会构建的那些中间空间状态。在 StateSight-Steps 上做微调是否真能弥合这些任务上的人机差距,被留作一个开放的研究问题。
格式流畅度与空间准确度的分离
在操作层面最有分量的发现是:所有最终的直接运行都没有产生任何格式错误。GPT-5.5 和 Claude Sonnet 5 对全部 900 道题都生成了自信、结构规整的答案。失败不在于模型产出了乱码或拒绝作答 —— 而在于它们产出了流畅、可解析、自信的错误答案。
格式流畅度与空间准确度之间的这种分离,对那些把输出质量当作推理正确性代理指标的从业者有直接影响。在生产环境的智能体系统中,响应解析和格式校验是标准的防护措施。StateSight 的发现表明,当错误出在空间推断而非输出格式上时,这些防护措施什么也拦不住。一个机器人控制器、一套物流巡检系统,或一个三维布局规划器,从视觉语言模型那里收到一个格式合规的响应,无法据此推断出背后的空间推断是否正确。
论文摘要把这一点定为核心诊断:格式合规的响应,可以掩盖「未能还原出可验证视觉推断所需的空间结构」这一失败。
延伸阅读:当 AI 的输出具有误导性:口头报告如何掩盖模型真实计算的研究
StateSight 在更广泛的视觉语言模型空间研究版图中的位置
StateSight 不是第一篇记录「前沿视觉语言模型在空间推理上不如人类」的论文,但它在范围和方法论上与此前的工作有实质区别。OmniSpatial(发表于 ICLR 2026)在 50 个细粒度子任务上测试了最先进的模型,发现同类最优模型的准确率峰值约为 57% —— 比人类表现低 30 多个百分点 —— 但它采用的是宽泛的多领域设计,空间推理与其他能力混在一起。CityCube(ACL 2026)发现,「哪些任务对人类难」与「哪些任务对模型难」之间基本不存在相关性,这暗示视觉语言模型敏感的是低层视觉特征,而不是在进行类人的空间建模。
StateSight 的贡献在于隔离:通过剥离真实世界物体、文字、领域知识和语言先验,并且专门要求隐式空间状态重建,它产出的信号更难被归因于记忆、模式匹配或走捷径。一个视觉语言模型不可能因为在训练数据里见过某个立方体的照片,就认出正确的折叠后对面 —— StateSight 每道题里的立方体,都是为那道提示当场程序化生成的。
GPT-5.5 相对 Claude Sonnet 5 的领先在三项任务上都是一致的,其中在连通分量计数上最为悬殊(28.3% 对 7.3%)。这个具体的差距值得注意,因为Roboflow 的视觉评测研究(发表于 2026 年 7 月)发现,Claude Sonnet 5 与 Sonnet 4.6 在 67 道真实计算机视觉提示上基本打平,都是 70%,落后于 Claude Fable 5 的 75% 和 Gemini 3.5 Flash 的 79%。StateSight 的连通分量任务,似乎击中了 Sonnet 5 视觉处理流水线中一个在面向感知的评测里不会显露的特定弱点 —— 很可能是因为,数连通区域需要非局部的图遍历,而基于图块的注意力机制在架构上并不是为这件事优化的。
这道差距对机器人、智能体和部署意味着什么
StateSight 的三项任务不是随意的智力题。立方体展开图推理测试的是物件装配核验所需的那种心理模拟 —— 根据一张俯视或侧视图判断机器人有没有把零件放对。被遮挡塔计数测试的是遮挡条件下的库存推理 —— 这是仓储机器人、手术器械追踪和物流巡检中的标准问题。连通分量计数测试的是对网格布局的结构解析 —— 与印制电路板检测、地形分析,以及任何需要智能体在结构化视觉场中辨认出彼此分离的离散物体的任务相关。
现实后果是:在上述任何一个领域部署 GPT-5.5 或 Claude Sonnet 5 的工程师,如今拿到的是量化的校准数据,而不是关于多模态能力的笼统营销说法。GPT-5.5 在发布时被定位为一个具备强大视觉能力的智能体与计算机使用模型;而 StateSight 的分数表明,视觉任务上的流畅并不自动转化为可靠的隐式空间状态重建,在这些特定任务上与人类表现之间仍留有相当大的差距。截至今天该论文挂出,OpenAI 和 Anthropic 均未对其作出回应。
局限,以及接下来会怎样
有几项重要的局限,限定了 StateSight 的结果能确立什么、不能确立什么。人类基线是 30 名参与者各答 60 道题 —— 样本规模不大,而且论文没有报告个体人类参与者之间的方差。模型评测使用的是默认 API 配置;GPT-5.5 在扩展思考或思维链配置下能否在立方体展开图或连通分量任务上提高分数,以及 Sonnet 5 的推理增强变体能否缩小差距,都仍然未知。该研究也只评测了两个模型,Gemini 3.5 Pro、带视觉的 DeepSeek V4 Flash,以及 Qwen3-VL 等开放权重模型在同样任务上的表现如何,仍是未知数。
StateSight-Steps 数据集 —— 提供 3600 个已标注的中间视觉状态 —— 从长期看可能是更有分量的产物。如果在显式空间状态序列上做逐步监督训练,能教会视觉语言模型去在脑中模拟折叠或图遍历,而不是依赖模式识别,那它就可能在该基准自身的任务上带来可测量的提升。这些提升能否泛化到未见过的空间任务,才是决定 StateSight-Steps 究竟是一项训练资源、还是仅仅一副诊断脚手架的问题。
对于正在构建下一代多模态模型的研究者,这篇论文的核心发现确立了一个具体的靶子:失败不在输出格式,不在领域知识,也不在对可见表面的感知。它具体就在隐式空间状态的重建上 —— 那种「完整理解一张图像所必需、却无法由任何单次注意力操作直接抽取出来」的隐藏结构。