World Labs 的 Atlas 把可控相机视频与三维重建统一进一个模型
Atlas 能生成 1440p 视频和三维高斯泼溅,但发布时没有论文、没有定价、没有正式可用日期

World Labs 发布了 Atlas,一个新的「全能世界模型」。该公司称它是第一个在单一统一架构内同时完成视频生成、三维重建和空间仿真的模型。这个模型于 2026 年 9 月 1 日进入早期访问,它是在文本、图像、视频和三维数据上同时从零预训练出来的 —— 这让它在结构上不同于那些「把重建当作附加功能的视频模型」,也不同于那些「事后加上生成能力的重建工具」。
这则公告补齐了 World Labs 自 7 月以来一连串动作的最后一环:7 月 21 日收购机器人仿真公司 SceniX,7 月 28 日发布零样本机器人训练结果,而现在给出了让那条机器人流水线得以规模化的底层模型。Atlas 将驱动 World Labs 的商业三维世界创作平台 Marble 的未来版本,目前正与若干未具名的精选伙伴一起进入早期访问。发布时没有定价、没有正式可用日期,也没有技术论文。
一套把三维空间放在中心的新架构
Atlas 建立在 World Labs 称之为「多模态自回归扩散 Transformer」的架构之上 —— 这个设计取自两个此前基本各自独立运作的模型家族。
从大语言模型那里,Atlas 继承了自回归结构:它处理一个输入序列,每次生成一个新的输出元素,并以此前的一切为条件。这让 Atlas 在根本上是灵活的。每一项任务 —— 生成一个新的相机视角、重建一个三维场景、给一段视频重新取景 —— 都只是同一个序列的不同排布:一部分元素是输入,其余是模型要生成的。增加一项新能力不需要重建架构,只需要定义一种新的输入-输出序列模式。
从潜空间扩散视频模型那里,Atlas 继承了它的生成机制。它具体来说是一个整流流(rectified flow)模型 —— 扩散的一个变体,学习的是从噪声走到信号的相对笔直的路径,而不是早期扩散系统那种弯曲路径。整流流让给定质量下的推理更快,也让用户能在运行时通过调整去噪步数,在速度与质量之间做取舍。输出先在潜空间 —— 一种压缩表示 —— 中生成,再解码成全分辨率像素、深度图或三维几何。
Transformer 骨干把这两半绑在一起。Transformer 架构主要通过大矩阵乘法运算工作,而那与现代 GPU 和加速器硬件高度匹配。这意味着 Atlas 可以直接继承为大语言模型服务所开发的那些系统工程创新:KV 缓存(避免对已见上下文的重复计算)、缓存感知路由,以及把预填充与解码操作拆到专用硬件上的分离式服务流水线。它同时还能继承视频生成领域的算法进展:加速生成的扩散蒸馏、用于引导输出的无分类器引导、偏移的噪声调度,以及改进的变分自编码器(VAE)设计。
与大语言模型和视频模型都不同的关键之处,是 World Labs 所称的「空间上下文」。喂给 Atlas 的每一张图像和深度图,都被钉在一个显式的相机位姿上 —— 一份精确的数学描述,说明拍摄这张图时相机在三维空间中的位置和朝向。这让所有输入都被锚定在同一个三维坐标系里。模型不必从像素模式中推断空间关系;这些关系是被直接给出的。当 Atlas 生成新内容时,它生成的内容与这套几何结构是一致的。
实际后果很重要:用户不是用文字描述相机运动(「向左平移,然后升降下摇」),而是给 Atlas 提供由三维坐标和旋转定义的真实相机轨迹。这在几何上没有歧义。World Labs 基准里测试的每一个竞品,都只能接受基于文字的相机指令 —— 而 Atlas 明确不受这个约束。
四种能力,一个模型
Atlas 执行四类空间任务,每一类都建立在同一套底层架构和空间上下文之上。
可控相机生成在视觉上最抓眼。用户提供一到六张参考图,定义一条穿过三维空间的相机路径,Atlas 就沿这条路径生成一段连贯的视频。模型通过把显式的几何输入与习得的世界知识结合起来,推断场景在未被拜访过的角度下应当是什么样子 —— 物体的背面、参考帧里看不到的一片草坪。World Labs 演示了用人工设计的相机路径和少量参考图,生成 1440p 分辨率的一分钟视频。
空间重建把这一点扩展到对真实世界环境的忠实还原。只需少量输入图像,Atlas 就能从任意新视角生成画面,同时输出显式的三维表示:把场景几何编码为一组三维坐标的点云,以及更进一步的三维高斯泼溅 —— 后者把场景的外观和几何表示为一堆小体积斑块,可以在标准硬件上交互式渲染。高斯泼溅已经是 World Labs 的 Marble 产品所用的表示格式,这意味着 Atlas 的输出可以直接接进现有流水线。World Labs 演示了用 2 到 25 张地面视角的手机照片重建斯坦福大学的 Main Quad,然后从数百米高空生成航拍掠过的画面。
时空仿真处理的是输入视频而非静态图像。Atlas 重建场景的三维结构,并能给它重新取景 —— 也就是「子弹时间」效果 —— 素材来自三到五台架在三脚架上的手机相机。World Labs 在没有专业设备的情况下做了演示;工程师和研究员把相机架在能塞进背包的普通消费级夹具上。结果是:此前需要专业同步相机阵列才能做到的多视角重新取景,现在用这样的素材就能做。
图像生成虽然被描述为次要重点,但能产出文本条件的图像和跨多种视觉风格的 360° 全景。360° 全景这项能力与机器人用例格外相关 —— 导航需要全球面的传感器视野。
那些基准主张说明了什么,又没说明什么
World Labs 在两项任务上提供了定量评测:可控相机生成,以及从稀疏输入做三维重建。两者都需要仔细读。
在可控相机生成上,World Labs 做了一次人类偏好研究,请第三方评分者在 Atlas 的输出与五个竞品之间选择:MiniMax H3、Gemini Omni Flash、Happy Horse 1.1、FLUX 3 和 Seedance 2.5。评分者在 75% 到 94% 的试次中更偏好 Atlas,且相机轨迹越复杂,优势越大。
这个方法里有一处结构性的不对称,是 World Labs 自己披露的:Atlas 拿到的是以它自己的几何输入格式定义的原生相机轨迹。而五个竞品拿到的是对预期相机运动的文字描述 —— pan、truck、crane 这类标准影视术语。World Labs 承认,「更精细的提示词工程或有创意的多模态提示,可能改善某些模型的相机跟随」。这个让步很关键:这些竞品并不是在同等条件下竞争的。文字对相机路径而言天然是一种不精确的描述,几何则不是。所测到的偏好优势,一部分反映的是 Atlas 的相机输入格式,而不只是它的生成质量。
三维重建基准把 Atlas 与五个专用模型在七个数据集(DTU、ETH3D、KITTI、NRGBD、7-Scenes、Tanks and Temples、ScanNet)上作了对比,用的指标是平均绝对相对点图误差(AbsRel × 10⁻³),数值越低越好。World Labs 报告 Atlas 的平均误差为 25.3,Pi3X 为 28.7,VGGT-Ω 1B 为 36.4。
这个对比里的一个基线 —— VGGT-Ω 1B —— 带着一条它自己的作者在 8 月 18 日发布的警告,也就是 Atlas 发布前 14 天。那条发布在 Meta AI 与牛津 VGG 的 GitHub 仓库上的通知称,某个祖先检查点存在基准污染,意味着已发布的 VGGT-Ω 1B 模型的结果「可能被抬高了」,并明确请求评测方「在我们结束调查之前,请不要依赖这些数字」。World Labs 在 Atlas 的发布文章里没有提到这条警告,也没有说明它复现的是哪一个 VGGT-Ω 检查点。
此外,所有重建基线都是 World Labs 自己重跑的,以统一评测条件 —— 而不是由独立第三方跑的。发布时没有附带论文、arXiv 预印本、评测代码、数据集划分或模型输出。独立复现目前并不存在。
这并不意味着 Atlas 表现不好。它的架构是可信的,设计选择在技术上是稳妥的,而 25.3 对 28.7 的 Pi3X 对比,在一个学界已研究数十年的问题上代表了 12% 的误差下降,是有意义的。但这些定量主张应当被当作公司自报,而不是已被独立确立的结论来读。
Atlas 在一个拥挤且投资越来越密集的领域里的位置
2026 年的世界模型版图上,参与者们有着不同的架构哲学,对「世界模型该做什么」也有不同的定义。
英伟达的 Cosmos 3 平台代表的是「物理 AI」路线:用带显式物理推理的视频基础模型,为机器人和自动驾驶生成合成训练数据。Cosmos 3 是开放的,已被包括 FieldAI 和 Skild AI 在内的公司投入运营,并被设计为可接入英伟达更广的 Physical AI 技术栈(含 Isaac Sim)。它的第三代在生成之外还提升了通用推理。Cosmos 与 Atlas 并非纯粹竞争关系;World Labs 已确认它用 Isaac Sim 来验证自家 R2S2R 流水线的一部分。这两套栈是从不同入口去解决同一个问题。
Google DeepMind 的 Genie 3 瞄准的是另一个用例:每秒 24 帧的实时交互环境,通过 Project Genie 面向 Google AI Ultra 订阅者开放。Genie 3 生成的是类游戏的交互世界 —— 它的衡量标准是「人在环」情况下的延迟与可控性,而不是对物理空间的照相级还原。这是不同的问题。Genie 3 与 Atlas 不太可能争夺同一批部署场景。
Meta 的 V-JEPA 2 代表的是 Yann LeCun 那一派的想法:世界模型应当在潜空间 —— 也就是世界的压缩表示 —— 中运作,而不是在像素层面。V-JEPA 2 把未来的世界状态预测为抽象特征,而不是生成视觉输出,这让它每一步的计算便宜得多,也更适合快速的前向规划。它不生成图像或视频。领导 MIT CSAIL 场景表示组的 Vincent Sitzmann 在 7 月对 Ars Technica 说,Atlas 和 Cosmos 这类像素级世界模型能否达到真正的物理智能 —— 而不只是复杂的统计插值 —— 「是一个赌注。这件事还没有定论。」Yann LeCun 的 AMI Labs 在 2026 年 3 月为 JEPA 系世界模型融到 10.3 亿美元的种子轮,它明确是在对着生成式像素范式反向下注。
Atlas 在结构上的差异化,是原生的相机位姿输入和统一的通才架构。目前没有哪个竞品把相机几何当作一等的原生输入类型。这个空档未必能维持很久:相机位姿在机器人和自动驾驶技术栈里本来就是标准配置,而 Atlas 今天在这一点上的优势,任何把位姿条件纳入未来架构的团队都能复制。World Labs 在这个具体设计选择上的竞争窗口,也许该按产品代数来算,而不是按年。
Atlas 合上了 World Labs 在 7 月打开的那个「真实到仿真」闭环
机器人应用是 Atlas 竞争意义最清楚的地方。这个基本难题多年来一直被理解得很清楚:机器人需要多样的训练环境,但物理地搭建并重置这些环境既慢又贵,可变性也有限。仿真可以提供无限的变化,但多数仿真器做的物理假设不真实 —— 刚体、均匀摩擦、无形变 —— 导致训练出来的策略部署到真实硬件上就失效。
World Labs 7 月 28 日的 R2S2R 结果显示,完全在仿真中训练、零真实世界训练数据的机器人,能在物理硬件上自主运行一小时,跨五项操作任务,涉及可形变的线缆、弹性连接件,以及几何公差很紧的物体。那些结果是由随 SceniX 收购一起到手的那套独立仿真引擎产出的。当时缺的,是一种「不靠精密采集设备就能为新环境构建物理精确仿真」的可规模化方法。
Atlas 补的正是这块缺口。只用一段手机视频里的几十帧,Atlas 就能把一个环境重建成带 RGB 与深度数据的交互式三维空间,随后可作为机器人训练与评测的仿真环境。World Labs 用两个大型环境做了演示,各自只用了 24 帧手机视频。英伟达机器人业务负责人 Jim Fan 在 7 月把 R2S2R 的结果称为真实到仿真方向的一大步:「强化学习的一切都在于环境。Real2sim2real 是为物理强化学习扩展环境的最佳途径之一。」Atlas 现在把这条流水线扩展到了「用智能手机而非专业设备就能采集」的环境上。
经济上的含义是多数报道最没有强调的那一点。用 Atlas 加 R2S2R 建出来的每一个仿真环境,都能服务多个机器人平台、多种策略架构、多轮训练。在一个重建出来的环境里多跑一千个模拟训练回合的边际成本,只是物理试验成本的一个零头。对机器人开发团队来说,这与「互联网规模文本数据之于语言模型」的结构性动力是同一个:在高质量数据基础设施上投一次,摊到所有下游任务上。
一个没有论文、没有价格、胜绩也未被复现的全能模型
Atlas 的架构选择站得住,机器人用例有说服力,而这支团队 —— World Labs 联合创始人 Ben Mildenhall 是 NeRF 的共同创造者,那是从图像做三维重建的奠基性技术 —— 有执行的技术信誉。World Labs 也已累计融资 12.3 亿美元,投资方包括英伟达、AMD 和欧特克(后者出资 2 亿美元,是其史上最大的一笔创业公司投资),使它有在无近期营收压力下大规模训练的算力预算。
整个空间智能领域到 2026 年年中累计宣布融资约 60 亿美元,World Labs、Yann LeCun 的 AMI Labs(10.3 亿美元种子轮),以及一批机器人和自动驾驶公司,都在争夺一个基本上还处于商业化之前的市场。World Labs 押的是:仿真器才是世界模型中最有价值的那一类 —— 那个把原始观测变成「智能体可以行动、失败、学习」的环境的系统。Atlas 就是那个本应让这个仿真器真正可规模化的模型,用几分钟手机视频取代昂贵的硬件采集装置。
Atlas 目前还没有的,是能让更广的研究社区复现或质疑其主张的文档。没有 arXiv 投稿、没有模型卡、没有参数量、除了「一个庞大而多样的多模态数据语料」之外没有训练数据描述、没有评测代码、也没有具名伙伴。基准上的胜绩是内部测量的,测试条件在所有竞品之间并不对等,而且其中一个基线的作者已经请求学界在调查结束前不要依赖其公布的数字。
World Labs 说它已看到 Atlas「随规模改进」的「有力证据」—— 考虑到这套架构,这是个合理的预期,但它并未以「具体算力-性能关系的缩放律」的形式发表出来。该模型目前处于早期访问,合作方经过挑选但未具名。发布当时列有四个 Marble 模型的 World Labs API,还没有 Atlas 这一项。
能把 Atlas 的故事从「有前景」变成「已确立」的那个里程碑很直白:一份带评测代码的独立技术报告、一篇披露到足以复现的架构论文,以及独立跑出来的基准。在那之前,「一个通才模型击败了每一个三维重建专用模型」这个说法,是一个由公司自跑的、令人印象深刻的演示所支撑的、有说服力的假说 —— 外加一项即便没有论文也新颖且可验证的结构性架构决定:原生相机位姿输入。那项架构优势是否真能产出 Atlas 所宣称的性能优势,只有在研究社区能自己跑测试时才会得到确认。