70 亿参数开源模型登顶 RoboLab-120 机器人榜
开源权重,准确率胜过 Cosmos3-Nano,同硬件上还快 3.95 倍

Black Forest Labs 于 9 月 22 日发布 FLUX 3 Action,权重在 Hugging Face 上免费开放 —— 这是第一个来自大型硬件或芯片实验室之外的公司、并在英伟达 RoboLab-120 操作基准上超过此前最好成绩的开源世界-动作模型。这个七十亿参数的模型在其引导蒸馏配置下取得 42.24% 的任务成功率,对比 Cosmos3-Nano-Policy 的 36.8%,同时在数据中心与工作站 GPU 上快 1.52 到 3.95 倍。比榜单位置更重要的,是这个结果对「该怎么造机器人策略」的暗示:一个从没见过机械臂的视频生成骨干,经由大规模视频预训练加针对性微调,能够胜过专门为具身 AI 打造的模型。
一个视频模型是怎么学会控制机器人的
FLUX 3 Action 属于一类被称为世界-动作模型(world-action model,WAM)的系统 —— 这个说法出自 2026 年 2 月发表的DreamZero 研究论文,指的是那些在单一模型里同时预测未来视频帧、以及产生这些帧所需的机器人动作的系统,而不是把视觉理解与运动控制当成两个分开的问题。与之对照的是视觉-语言-动作模型(VLA),比如Physical Intelligence 的 pi0.5。VLA 使用预训练的语言-视觉骨干并直接输出动作,推理时往往跳过视频预测。VLA 更快更小,但分数通常更低:33 亿参数的 pi0.5 在 RoboLab-120 上是 28.0%。
WAM 更准,是因为视频预训练迫使模型学会物理因果 —— 从左边推的物体会往右移动、杯子提得太快可能会倾倒、软材料受力会形变。当模型被微调成不仅预测未来帧、还要预测产生这些帧的运动指令时,这种理解会迁移过去。问题在于联合预测视频和动作会产生很长的 token 序列,让 WAM 变得昂贵。按 BFL 的技术报告,使用约 160 亿参数骨干的 Cosmos3-Nano,在同一硬件上每处理一秒机器人动作所需的时间,约为 pi0.5 的 4.7 倍。
BFL 的 FLUX 3 Action 把这道差距补上了。模型的骨干来自 2026 年 7 月发布的 FLUX 3,那是一个用图像、视频和音频训练的统一多模态系统,用的技术被 BFL 称为 Self-Flow —— 一种在单一架构里同时优化生成质量与跨模态表示的流匹配方法,而不是在推理时把各自单独训练的专家模型对齐起来。视频占了训练 token 的 95% 以上,这正是为什么这个模型对物理动态的表示足够强,以至于在加入任何机器人数据之前就已经能支撑操作任务。
架构、训练与推理优化
FLUX 3 Action 把多路摄像头的视频流、一条文本指令、以及机器人当前的关节位置一起送进 FLUX 3 骨干,再从它的输出里解码出预测的未来视频帧和一段预测的动作序列。每一次前向传播产出 32 条 15 Hz 的运动指令 —— 也就是 2.13 秒的机器人动作 —— 之后机器人执行这些动作,摄像头刷新,模型重新规划。BFL 的技术报告把这称为一个「看、想、动」的循环:模型在每一段动作之后重新观察场景并据此调整。
在机器人微调之前的中期训练阶段,会把预训练视频与四类动作数据混在一起:游戏录像(占样本 19.55%)、带手部姿态标注的第一人称视频(13.54%)、手持夹爪数据(14.03%),以及横跨十四种机器人本体的遥操作数据(15.93%)。游戏画面用一个 64 维的动作空间表示,编码鼠标轴、鼠标按键和键盘按键 —— BFL 把这个设计选择描述为一个有意为之的基础,为的是把动作预测扩展到操作计算机的智能体,而不只是实体机器人。
在 DROID 机器人数据集 上以 2048 的批大小、用关节动作空间(绝对关节位置而非末端执行器增量)微调,可以在 RoboLab-120 上达到约 40%,此后 BFL 再施加两项推理期优化,把性能和速度进一步推高。第一项是引导蒸馏:训练一个学生模型,用单次前向传播复现完整模型的引导预测,从而省掉无分类器引导通常需要的第二次无引导前向传播。这消除了 2 倍的延迟代价而没有准确率损失 —— 引导蒸馏后的检查点实际上还把性能提高了 0.6 到 1.08 个百分点。第二项是步数蒸馏:把采样步数从四步降到一步,再带来 3 到 4 倍提速。步数蒸馏确实要付出 3.51 到 4.32 个百分点的准确率,但由此得到的检查点仍以可观的幅度胜过 Cosmos3-Nano,而所用算力只是它的一小部分。
怎么读 RoboLab-120 这张榜
RoboLab-120 是一个基于仿真的基准,由英伟达、多伦多大学和悉尼大学的研究者开发,在 RSS 2026 上发表。它包含 120 个建立在英伟达 Isaac Lab 之上的桌面操作任务,围绕三条能力轴组织:视觉识别(按颜色、大小或类别辨认物体)、程序性推理(堆叠、重新定向、使用工具)和关系逻辑(合取、计数,以及「在……左边」这类空间指令)。每个任务至少跑十个回合来评分。关键在于,评测由英伟达团队执行而不是由模型提交方自评,这杜绝了曾短暂影响过其他机器人榜单的刷分行为。
完整榜单,按英伟达公布、并被 BFL 引用的版本,把 FLUX 3 Action 排在开源模型第一:
模型 类型 开源 成功率 参数量 FLUX 3 Action(BFL) WAM 是 42.92% 70 亿 OASIS WAM VLM + WAM 否 39.0% —— Cosmos3-Nano-Policy(英伟达) WAM 是 36.8% 约 160 亿 pi0.5(Physical Intelligence) VLA 是 28.0% 33 亿 DreamZero WAM 是 25.7% 140 亿
有一点需要澄清:榜单用的是横跨所有指令具体程度的「总体」成功率。RoboLab 团队在本次发布前几个月的一篇帖子里,报告 Cosmos3-Nano 在该基准「具体指令」变体上是 39.7%,这说明分数会随给模型的文本提示的细粒度而略有不同。BFL 报告的 42.92% 用的是同一个总体指标。截至撰稿,FLUX 3 Action 的这些数字还没有在 BFL 自家评测之外被独立复现过;对一个发布仅三天的模型来说,这在意料之中。
独立的真机结果与仿真不完全一致
仿真基准有已知的局限:从物理仿真到真实硬件的域迁移可能并不均匀,而仿真环境也未必能完整还原实景的噪声和多变。BFL 为此委托了一家罗马尼亚机器人实验室Positronic Robotics做第三方独立评测,用的是 Franka 机械臂。
评测覆盖十项 DROID 任务,每项尝试三次,每次限时 240 秒。操作机器人的人并不知道每次尝试背后是哪个模型在控制 —— 每一次运行都有录像。结果:FLUX 3 Action 完成 30 次中的 28 次(93.3%),Cosmos3-Nano 完成 27 次(90.0%),DreamZero 完成 20 次(66.7%),pi0.5 完成 13 次(43.3%)。
F3A 与 Cosmos3-Nano 在真机上的差距很窄(93.3% 对 90.0%),而且任务集很小 —— 30 次尝试不足以得出统计上稳健的结论,这一点该留神。但方向与仿真结果一致,而且这次评测的盲测设计减少了实验者偏差。它还说明,F3A 在仿真中训练出的检查点,无需在 DROID 配方之外再做真机微调,就能泛化到一条物理机械臂上。
BFL 还在 SO-101 机械臂上用一个小规模遥操作数据集微调了 F3A,并演示了它对训练中未见过的物体、容器和摄像机位置的泛化。SO-101 是一款低成本的开源机械臂,这一点很重要,因为它意味着这个模型可以用不多的数据采集就锚定到新的本体上 —— 对那些负担不起舰队规模遥操作的实验室来说,这是一个相当实际的考量。
延伸阅读:面对危险的机器人任务,前沿 AI 模型不是拒绝而是照做
混合策略的经济账:什么时候该让模型去想
FLUX 3 Action 并不能独自解决所有任务。需要多步规划的复杂任务 —— 按指定顺序排列四个彩色方块,或者在杂物中找出被部分遮挡的物体 —— 目前超出任何纯动作策略的能力。OpenAI 的具身推理模型 GPT-6 Astra 在给足推理预算时能解决某个相关基准里的全部任务,但代价高昂:按 BFL 复现过的Su 等人(2026)的一篇论文,每成功一个回合约需 13.47 美元、约 16 分钟的实际耗时。
BFL 把 F3A 和 pi0.5 分别当作快速动作组件,放进一套混合方案里测试:由推理模型跟踪回合历史,并可以选择执行动作策略预测的动作、修改其中一部分、提出自己的动作,或者叫停。关键发现是,动作策略的质量会大幅改变整个混合系统的效率。
用 pi0.5 当策略时,最优的混合方案每成功一次要 12.28 美元(Astra 中等推理预算)。用 F3A 当策略时,最优混合每成功一次 8.77 美元(Astra 低推理预算),完成任务用 8 分钟而不是 13 分钟 —— 比最优的 pi0.5 混合便宜 29%、快 40%,而且在一个包含若干任何独立策略都解不了的问题的十项任务集上,仍能达到 90% 的成功率。解读很清楚:更好的快策略意味着推理模型更常放手、更少插手,从而降低每一个回合的 token 消耗和延迟。
FLUX 3 Action 单独运行时,在一块每小时 3 美元租来的 H200 上,每成功一个任务约 0.09 美元,耗时不到两分钟。这段时间里大部分是空闲 —— 在等实体机器人把上一段预测出的动作执行完 —— 也就是说,理论上一个 H200 实例可以同时服务 47 路机器人推演而不增加硬件成本。
延伸阅读:GPT-6 Astra 的发布、自主能力,以及 AI 安全监控
非商用许可对机器人团队意味着什么
这次开放权重带着一个重要约束。权重依据BFL 的非商用许可条款提供,允许研究和学术用途,但生产部署需要另行签订商业协议。把 F3A 当作商业产品基础来考虑的工业机器人团队,需要直接与 BFL 谈。
这个结构与 BFL 此前几次 FLUX 发布的做法一致:权重对研究社群开放,商业用途走授权。这让 BFL 既能从工业落地里拿到下游价值,又保持研究生态可用。对学术机器人实验室和非商业研究来说,权重通过 Hugging Face 即刻可用。
还有一个硬件层面的考量。步数蒸馏版本 —— 也就是最快的那个检查点 —— 在 RTX 5090 这类消费级 GPU 上的某些配置下,反而比 pi0.5 慢 1.15 到 2.42 倍。引导蒸馏的检查点在数据中心硬件上快过 Cosmos3-Nano,但在消费级 GPU 上未必有速度优势。在一般硬件上搭系统的团队,应当针对自己具体的 GPU 和服务配置实测,不要想当然地认为基准里的速度数字能直接照搬。
从机械臂到游戏手柄:BFL 真正在造的是什么
BFL 技术报告里最有前瞻性的一段,是把电子游戏当作机器人之外的动作预测试验场。FLUX 3 Action 的中期训练里包含带 64 维动作空间(鼠标、键盘)的游戏数据,BFL 的文稿明确把这说成是通往「能通过计算机操作来使用软件的智能体」以及其他延迟敏感应用的一步。研究上的类比很清楚:一个靠从视觉上下文预测下一帧和下一次按键来玩游戏的智能体,在结构上与一个操作浏览器、电子表格或开发环境的智能体是相似的。
BFL 的技术报告全程致谢了与英伟达的合作,感谢英伟达 Isaac Lab 和 RoboLab 团队提供了支撑该模型评测的基准设施。这两家公司的位置颇为微妙:英伟达的 Cosmos3-Nano 正是 F3A 如今在 RoboLab-120 上超过的那个开源模型,而两者又出自一个共享的生态。
具身 AI 的基准之争大概率还会继续。RoboLab-120 在设计时就带着不断演化的任务库,专门用来防止性能饱和 —— 英伟达团队可以引入新任务,去检验现有模型欠缺的能力。独立研究者会在几周内开始用自己的机器人数据微调 FLUX 3 Action。视频预训练带来的优势在更多样的真实条件下是否守得住,以及非商用许可会不会限制有意义的外部检验,是评估这个基准成绩最终能多大程度兑现到落地机器人身上时,最要紧的两个问题。