可编程世界模型把引擎与渲染器分开,状态准确率达 98%
一个可执行的状态引擎,追踪画面外的实体、物品栏,以及视频模型会忘掉的规则

来自 AlayaLab、台湾大学和阳明交通大学的研究团队上周在 arXiv 上发表了一篇可编程世界模型(Programmable World Model)预印本,为交互式 AI 世界模型提出了一种新架构 —— 把游戏逻辑完全放在神经网络之外。他们的框架在一个自建的新基准 CombatStateBench 上取得了 98% 的状态准确率和 94% 的计数准确率,而最接近的竞争者分别只有 8% 和 40.75%。
核心问题:视频世界模型没有权威的「真相」
交互式视频世界模型 —— 能根据用户动作生成可玩场景的系统,比如基于《我的世界》的 Oasis、基于《毁灭战士》的 GameNGen —— 在过去两年里产出的画面越来越逼真。但它们共有一个结构性局限,而这是再多的画质提升也解决不了的:它们对「这个世界里什么是真的」没有权威记录。
在 2024 和 2025 年的所有主要系统里,包括 DIAMOND、YUME 和 Matrix-Game,世界的状态都隐含在模型的视觉历史和潜在激活之中。一个走出画面的角色就不再被追踪 —— 模型可能在另一个位置、以另一个血量把这个角色重新生成回画面,也可能根本不再生成。血量、物品栏或阵营归属这类非视觉属性无处安放:只能从视觉记录中不完美地推断出来。而要施加可编程的规则 —— 「血量降到零以下,角色死亡,并且保持死亡」—— 就只能告诉神经网络去渲染什么,而不是强制执行一份可验证的计算契约。
2026 年早些时候发表的独立分析把这种状态管理缺口认定为交互式视频世界模型研究中尚未解决的核心挑战。可编程世界模型预印本直接瞄准的就是它。
架构如何运作:四个组件,一次干净的分离
该系统由四个排成一个回路的组件构成。
第一,一个基于视觉语言模型的编码智能体 —— 由 Qwen3-VL 驱动 —— 读取一张参考图和一段对目标场景的自然语言描述,输出一个可执行的世界程序。这个程序规定存在哪些实体、它们的初始位置和状态、彼此关系、合法动作,以及动作如何改变世界的规则。对于一个战斗场景,智能体会给角色分配血量、定义敌对阵营,并编码这样的规则:命中会降低血量,血量归零触发死亡事件。
第二,一个轻量级状态引擎接收玩家动作,执行世界程序来推进状态。引擎用一个状态元组追踪每个实体,其中包括它的持久身份、三维位置与朝向、语义类别和功能属性。它还维护那些在任何单帧里都看不见、却仍须影响后续事件的事实 —— 物品栏、任务进度、阵营关系。在每一步交互中,引擎都产出一个新的规范世界状态:一份完整、权威的记录,涵盖一切为真的事,而不管摄像机此刻拍到了什么。
第三,一个确定性的状态编译器把更新后的世界状态翻译成渲染指令。由于实体表示为三维有向包围盒(OBB),编译器可以用标准的几何运算把每个实体投影到任意目标相机视角。它生成三张空间对齐的控制图:一张身份图,给每个实体分配持久嵌入,让渲染器能在遮挡和相机移动中保持视觉一致;一张语义图,由每个实体类别的文本编码器嵌入得出;一张方向图,把每个实体在世界坐标中的速度编码为七种离散状态之一 —— 静止、前、后、左、右、上、下。把实体自身的运动与相机造成的表观运动区分开,是一个细微但重要的技术细节:没有它,渲染器就分不清一个在世界里移动的实体,和一个被镜头扫过的静止实体。
第四,一个预训练的视频生成模型 —— 建立在LingBot-World-v1 这一开源世界模型骨干之上 —— 通过一个可训练的 ControlNet 附加模块接收这些控制图,并渲染当前这一步的画面。只有 ControlNet 被训练;底层视频模型的权重是冻结的。这意味着系统继承了视频模型在纹理、光照、关节动作和次级运动上的视觉先验,而所有需要逻辑一致性的事情都交给引擎处理。
为什么是三维包围盒,而不是更简单或更精细的东西
选用带状态的三维 OBB 作为中间表示,背后是一番细致的取舍分析,论文用了整整一节来讨论。
文本提示太弱:它无法对实体在共享世界坐标系中出现的位置施加几何约束。二维包围盒依赖视角 —— 其坐标随每一次相机移动而改变,无法被确定性地重投影到新视角。在另一个极端,完整的三维网格、带关节的人体模型或 G-buffer(传统渲染管线中使用的密集表面属性图)能编码精确几何,但要么需要更丰富的训练监督,要么需要在推理时显式构造高维几何。对于一个倒下的角色,完整的关节表示需要指定每一个关节和肢体的轨迹;三维 OBB 只需编码位置、朝向和空间占用的变化,把实际的运动动态留给生成式渲染器。
作者主张,这种中等抽象层级在训练与推理之间保留了一种有用的对齐:训练时,OBB 从观察到的视频动态中提取;推理时,它们由高层状态转移构造出来。表示越精细,训练能提供的与推理必须构造的之间,差距就越大。
CombatStateBench:这个基准究竟测什么
CombatStateBench 是作者用游戏画面专门构建的一个 50 段视频的评测集,每段都带有同步的三维包围盒、实体状态、相机参数和实例掩码。这个基准专门检验世界模型能否正确处理实体死亡事件 —— 状态变化中最剧烈、也最容易观察的一种 —— 并覆盖多样的相机运动和实体配置,包括一开始就在画面外的实体。
两项指标由一个 Qwen3.6-27B 视觉语言模型评审打分,它只看生成的画面,无法接触真值标注。计数准确率检查画面中可见的存活角色数量是否与引擎的计数一致。状态准确率检查死亡事件之后的三帧中,是否至少有一帧在画面上显示出一个已死亡的角色。
作者指出,这两项指标是刻意设计得粗放的:它们不要求视觉语言模型识别出具体是哪个实体死了、倒在哪里,只看整体画面是否与引擎状态一致。在这么宽松的条件下,LingBot-World-V2 这样的现有系统在状态准确率上也只得了 8% —— 这说明,当一个离散、持久的状态变化必须在长时间推演中正确传播下去时,隐式状态的视频模型失败得有多严重。
值得注意的基准局限
这个基准本身是由研究团队而非独立第三方构建和评测的。评审是一个视觉语言模型(Qwen3.6-27B)而不是人类标注员。按基准的标准,50 段视频的规模偏小,而且全部取自第三人称动作游戏画面。训练数据由《赛博朋克 2077》《极限竞速:地平线 6》和《GTA V》构成 —— 这些商业游戏用于 AI 训练,在商业应用中可能引发知识产权问题,尽管这在世界模型文献中是常规做法。
目前还没有独立研究组复现 CombatStateBench 的结果。在预印本阶段这在意料之中,但在根据这些具体百分比得出强有力的架构结论之前,这一点值得记住。可以独立成立的是这个论点:一个拥有外部权威状态引擎的系统,从构造上就能在推演中正确保持状态;而一个纯神经网络系统必须隐式地学会这一点,并可能在长时程压力下丢掉它。
这对具身智能与仿真意味着什么
这一架构最重要的潜在应用,远不止游戏模拟。机器人训练环境 —— 比如 NVIDIA Isaac Sim 或 AI Habitat —— 需要精确模拟物体状态、物理属性和空间关系,而把这些渲染得像照片一样代价高昂。一个能维护世界的显式逻辑记录、同时把视觉逼真度交给生成式视频模型的系统,可能降低为机器人训练搭建照片级仿真环境的成本,或者让仿真在不重新设计底层物理引擎的情况下,跨视觉域泛化。
延伸阅读:World Labs 的 Atlas 把可控相机视频与三维重建统一进一个模型
论文中展示的 897 帧自回归推演里,许多非玩家角色陆续进入场景,引擎在整个序列中正确追踪了所有角色 —— 这表明该方法不会在长时间交互下立刻退化,而这正是让世界模型可用于智能体训练的关键属性。
这一架构对多人世界模拟也有直接意义。论文的状态形式化明确包含实体间关系和共享的世界事实,而这些是连贯的多智能体交互的前提。另一个团队 2026 年的相关论文 MASS用一个学习得来的逻辑引擎处理类似的多人场景;确定性的外部引擎(更可验证、表达力更弱)与学习得来的引擎(表达力更强、更难审计)之间的取舍,是一个活跃的研究问题。
这条研究线的下一个里程碑,是由外部团队独立复现 CombatStateBench 基准,以及把基准场景扩展到战斗死亡之外 —— 比如在长时间推演中追踪物品栏变化、队伍比分或多步任务进度,而这正是纯神经网络模型的视觉漂移最容易暴露的地方。