JEPA-Anything:同一个世界模型,横跨七个学科赢过专用模型
正交因子分解在全部十项任务上胜过对照基线,还拿到了湿实验室的生物学验证

一支横跨北京大学、香港中文大学及相关实验室的研究团队在周四放出一篇预印本,主张一条单一的自监督训练原则可以做到 AI 研究界长期认为在结构上不可能的事:在七个截然不同的科学领域上胜过各自领域专用的世界模型 —— 从分子模拟到临床病程预测再到天气 —— 而且不必为每个领域重写底层架构。
这篇题为《JEPA-Anything: Learning Predictive Models across Different Worlds》的论文,提出了「正交预测因子分解」(Orthogonal Predictive Factorization,OPF),作为联合嵌入预测架构(JEPA)的扩展。在与各领域专用 JEPA 基线对照的实验中,这个框架在全部十项动力学任务上都提升了所报告的指标,并在四个化学体系上取得了最低的分子模拟误差。最不寻常的是,从模型隐空间中提取出的一个因子,提名了一项生物学干预,而该干预随后在细胞共培养、患者来源类器官、肿瘤组织块和活体小鼠中获得了实验支持 —— 这是一次从机器学习走进湿实验室验证的跨越,在 AI 架构论文里并不常见。
JEPA-Anything 扩展了什么,为什么这很重要
联合嵌入预测架构是 Yann LeCun 对生成式 AI 一个长期批评的回应:预测像素或 token 会迫使模型把容量花在与感知无关的细节上。在标准的 JEPA 中,一个上下文编码器读入世界中被观察到的那部分,一个预测器估计被遮挡或未来那部分的表示 —— 全程在隐空间中进行,而不是在原始观察的空间里。编码器的一份冻结的指数滑动平均副本,在不回传梯度的情况下生成目标表示,以防模型坍缩到平凡解。
Meta 的研究团队通过一系列能力逐步增强的系统发展了这条原则。2023 年的 I-JEPA 把它用在图像块上,从可见的上下文预测被遮挡图像区域的嵌入。2024 年的 V-JEPA 把它扩展到时空视频管。2025 年 6 月发布的 V-JEPA 2 在超过一百万小时的视频上训练,产出了一个机器人规划系统:只需 62 小时的领域专用素材,就能在没见过的机械臂上做零样本操作。这些进展都发生在视觉与物理交互的领域之内。
JEPA-Anything 的主张是:隐空间预测这个接口 —— JEPA 之所以奏效的核心 —— 本质上并不是视觉专属的。如果由各领域专用的编码器负责把原始观察转换成 token,那么同一套因子化的预测学习目标,应该能用完全相同的训练机制,去组织分子图、临床记录、气象场和细胞转录组的预测能力。
机制:把预测拆进正交的子空间
关键的技术新增是正交预测因子分解。标准 JEPA 用一个预测器去预测一整块目标嵌入,而 OPF 引入 K 个可学习的投影矩阵,把目标隐空间划分成互不重叠的子空间,每个子空间都有自己专属的预测器。预测完成后,各因子的预测结果再经过一步伪逆合成,被映射回完整维度的隐空间。
正交性在训练中通过两个惩罚项来保证。在每个因子块内部,投影矩阵被推向正交归一。在不同因子块之间,一个 Frobenius 范数惩罚把各子空间推开,避免不同的预测器盯上同一批隐空间方向。这个设计避免了作者在整块式 JEPA 中指出的一种预测能力浪费:当单个预测器必须同时表示位置、身份、变换和动力学时,方差大或容易预测的结构会主导梯度,而难以预测的结构会被降权。
两个正则项负责防止坍缩。因子活跃度项会在任一坐标的经验标准差低于阈值时惩罚投影器,让每个因子维度在各训练批次中都保持活跃。另一个在线编码器方差项则直接推动上下文编码器在其输出坐标上保持变化。这些都是叠加在各领域原有基础损失之上的 —— OPF 的这些项可以直接加进任何领域专用基线已有的训练目标。
在数学上,如果这 K 个投影矩阵严格正交、且各子空间维度之和等于完整隐空间维度 d,那么这些因子构成一个无损划分:由预测出的因子坐标合成出的状态,与原状态范数相同,并且可以通过把每个因子的投影与其预测坐标向量做外积再求和来精确重建。在正交惩罚下,这个性质在训练中近似成立,在惩罚趋零的极限下严格成立;作者证明,相比不加约束的多头设计,这给出了一条条件良好的合成路径,能减少合成误差的放大。
延伸阅读:可编程世界模型把引擎与渲染器分开,状态准确率达 98%
七个领域,三组实验
评测框架分为三组,分别测试使用世界状态的不同方式。
第一组 —— 终端读出 —— 测试 OPF 预训练能否改善冻结编码器的表示:一是在渲染出的 MuJoCo 场景中的视觉绑定任务上,二是在用 scGPT 骨干、覆盖肾脏、外周血和扰动数据集的单细胞基因表达状态表示上。它还测试了一步合成出的未来状态,能否改善多模态患者队列中超过一千种临床事件风险的纵向疾病事件预测(使用一个 GPT-2 临床语言模型)。在与对照 JEPA 基线 —— 相同编码器、相同优化预算、相同数据、相同下游读出 —— 的比较中,OPF 预训练在这些任务上都有提升。
第二组 —— 隐空间世界动力学 —— 测试预测出的状态能否被递归复用,这对任何世界模型来说都是操作上最难的一档。被评测的设置包括:CITRIS 基准套件中 Interventional Pong 上的干预条件预测,JEPA-Anything 在那里把单次干预的预测误差降低了报告中的 34.8%;PDEBench 物理场基准、WeatherBench 2 天气预报和 CausalWorld 机器人操作上的分布外与长程动力学;Hopper、Walker2d 和 HalfCheetah 上的连续控制规划;以及用 TrajCast 式 O(3) 等变骨干,在四个化学体系上做的、无需计算受力的分子模拟。分子部分的结果 —— 按作者报告,四个体系上的单步误差和 100 步误差都是最低 —— 值得注意,因为分子推演会在 100 个自回归步中不断累积误差,此时隐空间组织上哪怕每一步的小改善,也能阻止轨迹漂移。
第三组从预测表现转向科学可解释性:即便没有朝那个方向做显式监督,OPF 学到的因子坐标是否编码了物理或生物学上有意义的结构。
当隐空间因子走进湿实验室
论文中最引人注目的实验,是那项生物学因子分析。在第三组里,研究者把 OPF 的因子投影 —— 与预训练中学到的是同一批矩阵 —— 当作单细胞数据上的诊断接口来用。这项分析提名了一个因子,作为生物学干预的候选。论文报告称,由这个因子提名的干预,随后在细胞共培养、患者来源类器官、肿瘤组织块和小鼠中获得了实验支持。
这不是一个计算基准。模型在训练中并没有见过湿实验室的结果。如果这个说法经得起推敲,它意味着隐空间的因子分解捕捉到了细胞转录组状态空间中的某种结构,这种结构与某个因果或机制性关系相对应,且具体到足以生成一个有效的、可检验的假设。至于它能否在同行评议这一关站住 —— 实验方案、所谓「实验支持」的性质,以及统计设计都会被仔细审视 —— 还有待确立。这篇预印本尚未经过同行评议。
第二项科学分析,是在完全没有朝物理定律做监督的情况下,从隐空间因子模态中恢复出了轨道力学。把从学到的因子中提取出的频率模态与轨道周期结构做对数—对数拟合,模型的隐空间表示给出的斜率是 -1.4991,而开普勒第三定律的理论值是 -1.5。一个只被训练去预测未来状态的世界模型,几乎精确地还原出一条已知的物理标度关系 —— 这与论文的核心论点一致:预测性的因子分解,可以作为「学习预测」的副产品,让物理上有意义的结构浮现出来。
论证仍然敞开的地方
这套实验设计回答了一个明确的比较:OPF 对照编码器、数据和预算都相同的 JEPA。就现有预印本而言,它还没有给出的,是一项干净的消融 —— 把正交子空间划分的贡献,与额外的正则项、以及 K 个独立预测头相对单个整块预测器所带来的额外预测容量区分开来。2026 年 8 月的前作 Orthogonal JEPA 在更窄的一组视觉任务上确立了 OPF 机制,当时一位评审就明确指出:所报告的收益还不能归因于因子分解,因为这种比较在没有消融的情况下同时加了容量和正则项。JEPA-Anything 把范围扩展到七个领域、三组评测,但并没有靠自己解决这个归因问题。
第二个局限是,以 Apache 2.0 发布的 GitHub 仓库提供了可复用的 OPF 核心库、任务设计工具和一个合成的结构示例 —— 但不包含论文中各领域实验所训练出的模型权重。想要复现分子动力学或临床预测结果的研究者,需要用自己的数据和算力重新训练。这个仓库被明确设计成新实例的起点,而不是一个模型仓库。
这篇论文在 arXiv 上还被归到了 cs.CL 类别下 —— 计算与语言 —— 对一个涵盖分子模拟、偏微分方程场和湿实验室生物学的框架来说,这个归类似乎并不对路。这可能影响它触达计算生物学和物理模拟社区中最相关的读者。
意义:一条训练原则,多个科学世界
JEPA-Anything 覆盖的几乎每一个科学领域,今天都已经有各自的专用世界模型。天气预报有 GraphCast 和在 WeatherBench 上训练的模型。分子模拟有基于力场和机器学习原子间势的方法。临床 AI 有纵向患者模型。单细胞生物学有 scGPT 及相关的 transformer。这些模型都是围绕本领域数据的结构做工程的,通常不经过大量重新设计就无法跨领域复用。
JEPA-Anything 的主张 —— 一个单一的预测因子分解训练目标,叠加到各领域已有的架构上,就能稳定地超过该领域自己的 JEPA 基线 —— 是朝着 LeCun 在 2022 年阐述的理论目标迈出的有意义一步:智能,无论是生物的还是人工的,都围绕一条与领域无关的世界建模原则组织起来,而不是由一堆领域专用模块拼成。OPF 机制比那个愿景要谦逊得多 —— 各领域仍然需要自己的编码器和适配器 —— 但它是迄今最清楚的经验论证之一,表明这条学习原则可以跨越异质的物理与生物系统。
随着领域复杂度和数据规模上升,这一点是否还成立;湿实验室的验证能否经受同行评议;以及因子层面的诊断能否成为药物发现或系统生物学中可靠的假设生成工具 —— 这些才是值得盯住的里程碑。一个能仅凭隐空间、在任何针对性实验之前就提名出有效生物学干预的框架,将改变生命科学中假设生成的经济账。这正是 JEPA-Anything 第三组实验意在证明的,而支撑这一主张的,目前只有一篇未经评议的预印本中所描述的一组生物学实验。