英伟达 Vera Rubin NVL72 首次亮相 MLPerf:吞吐量达 Blackwell 的 3.7 倍
GB300 NVL72 在 288 块 GPU 上实现 99% 的扩展效率;Jetson AGX Thor 亮相边缘智能体基准测试

MLCommons 今天发布了 MLPerf Inference v6.1 的结果,英伟达 Vera Rubin NVL72 首次进入这份榜单,在该基准套件中要求最高的两项工作负载上提交了预览(preview)结果。据英伟达 2026 年 9 月 16 日发布的博客文章,Vera Rubin NVL72 在 Qwen3-VL 上的吞吐量最高可达当前一代 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高可达 2.5 倍。这些结果是在 MLCommons 联盟经同行评审的方法论下得出的,而不是来自英伟达自己的测试,这让超大规模云厂商和云运营商在 Vera Rubin 全面商用之前,第一次拿到了经过外部验证的推理性能数据。
这些数字不只是单机架之间的对比。在另一项提交中,四个 GB300 NVL72 机架组成 288 块 GPU 的集群,在 DeepSeek-R1 的离线场景下实现了 99% 的扩展效率 —— 也就是说,吞吐量几乎与新增的硬件同比例增长。软件方面,GB300 NVL72 软件栈的持续优化,让它在 Qwen3-VL 上的性能最高达到同一平台在 2026 年 4 月 MLPerf Inference v6.0 中成绩的 1.6 倍,说明即便在下一代出货之前,代际之间的基准差距也在不断拉大。英伟达 Jetson AGX Thor 也在新引入的 Edge-Agentic 基准上提交了结果,首次把这一测量框架延伸到了端侧智能体推理。
基准结果实际说明了什么 —— 以及没有说明什么
MLCommons 是 MLPerf 背后的开放工程联盟,它通过同行评审的提交流程来管理推理基准:硬件厂商必须在规定条件下运行指定的工作负载,结果在发布之前要经过准确性验证。这套方法论在这里很重要,因为 Vera Rubin NVL72 的数字属于「预览」类提交 —— 硬件已经具备量产条件,但英伟达为该平台打造的软件栈仍在积极开发中。英伟达明确指出,性能还会继续提升,超出 v6.1 所反映的水平。
英伟达援引 MLPerf 封闭组(Closed Division)的 6.1-0106 和 6.1-0074 两条结果作为对比依据,其中 Qwen3-VL 工作负载使用 vLLM 搭配 NVIDIA Dynamo,DeepSeek-R1 工作负载使用 TensorRT-LLM。另外,很早就开始采用 Vera Rubin 的云服务商 Nebius 也提交了自己的 Vera Rubin NVL72 预览结果,表现相当,这提供了第二个数据点,而且来自一家独立于英伟达内部基准团队的运营方。
吞吐量倍数也应结合基准测量的内容来理解。MLPerf Inference v6.1 的数据中心套件涵盖大语言模型和视觉语言模型的离线、服务器和交互三种场景。离线场景在不限批大小的条件下追求最大吞吐量;服务器场景加入了延迟约束;交互场景则强制执行严格的首 token 时延要求。Vera Rubin 在 Qwen3-VL 上的 3.7 倍优势是在全部三种场景下报告的 —— 也就是说,它在延迟约束下同样成立,而不仅限于最大吞吐量条件,对生产部署而言,这才是运营上更有意义的结果。
Vera Rubin 如何实现更高吞吐量:分离式服务、NVFP4 与 MoE 并行
吞吐量的提升主要并不来自更快的裸芯片,尽管 Vera Rubin 相比 GB300 确实是一次重大的架构升级。性能提升来自一组协同设计的硬件特性与服务技术的组合。
核心的服务技术是分离式服务(disaggregated serving),英伟达通过其开源推理框架 Dynamo 来运行它。在传统的聚合式服务中,一块 GPU 同时处理大语言模型推理的两个阶段:预填充(prefill)和解码(decode)。在预填充阶段,系统处理输入的提示词,构建代表对话状态的 KV 缓存。在解码阶段,模型一次生成一个 token,并反复读取累积的 KV 缓存。两个阶段的计算特征截然相反:预填充是计算密集型的,受益于高度的 GPU 并行;解码受内存带宽限制,受益于大容量、高速的内存。让两者跑在同一套硬件上,意味着哪个阶段都无法最优地利用 GPU。
分离式服务把两个阶段拆分到各自专用的工作节点池中。预填充节点负责构建 KV 缓存;NIXL(英伟达的 GPU 间数据交换库)通过 NVLink 或 InfiniBand 把 KV 状态传给解码节点,由解码节点继续生成 token,而不必与新进来的预填充流量争抢资源。结果是整个节点池的硬件利用率更高、可持续的吞吐量更高,对长上下文请求尤其如此 —— 否则,一次繁重的预填充在完成之前会堵住解码队列。在 Vera Rubin 的 Qwen3-VL 测试中,vLLM 担任模型服务后端,Dynamo 在其上层负责预填充与解码之间的路由。
另一项关键机制是 NVFP4 精度。NVFP4 是英伟达的 4 位浮点格式,采用两级缩放方案:E2M1 数值(1 位符号位、2 位指数位、1 位尾数位)按每 16 个元素分为一块,每块共享一个 FP8(E4M3)块缩放因子。均匀的 4 位整数量化会对块内所有数值一视同仁;与之不同,浮点语义让 NVFP4 在相同位宽下比 INT4 拥有更宽的动态范围和更好的精度恢复。实际效果是,模型权重、激活值和 KV 缓存都可以用 4 位精度存储和处理 —— 与 FP8 相比内存占用减半,同时让输出质量保持在基准的准确率阈值之内。英伟达指出,NVFP4 精度降低了模型权重、注意力和 KV 缓存的内存占用 —— 在输出质量损失极小的情况下提高了吞吐量。
两个基准模型 DeepSeek-R1 和 Qwen3-VL 都是混合专家(MoE)架构。在稠密 transformer 中,每个 token 都会用到全部参数。在混合专家模型中,路由层会为每个 token 选出一小部分专门的专家网络,只把该 token 的激活值发送给这些专家。DeepSeek-R1 的 6710 亿总参数中,每个 token 只激活约 370 亿;Qwen3-VL 的 2350 亿总参数中,每个 token 激活 220 亿。混合专家模型能在给定的计算预算内容纳更多容量,但专家路由会在 GPU 之间产生全对全(all-to-all)通信模式 —— 每个 token 可能需要送到位于不同 GPU 上的不同专家。英伟达的大规模专家并行技术把专家网络分布在 72 块 GPU 组成的 NVLink 域中,利用 NVLink 6 互连为每块 GPU 提供的全对全带宽来分发专家调度,免去以太网的开销。
99% 的扩展效率,才是被低估的那个结果
Vera Rubin v6.1 公告的大部分关注,都会落在 3.7 倍吞吐量这个标题数字上。但对于任何在生产规模上规划 AI 基础设施的人来说,99% 的多机架扩展效率同样值得重视。
给分布式推理系统增加硬件,并不会自动带来成比例的吞吐量增长。跨机架通信会引入延迟;请求编排会增加开销;GPU 利用不均衡会浪费容量。如果 GPU 数量翻倍只带来 30% 的吞吐量提升,扩容的经济账就算不过来了:硬件成本线性增长,而创造收入的能力却只是次线性增长。在 99% 的扩展效率下,GB300 NVL72 实际上把每一块新增的 GPU 都转化成了相应的新增吞吐量 —— 这是 AI 工厂在容量和成本上实现线性扩展的必要条件。
英伟达的演示让 DeepSeek-R1 从单个 72 块 GPU 的 GB300 NVL72 机架,扩展到四个机架、共 288 块 GPU,在离线场景下实现了近乎成比例的吞吐量增长。实现这一点的架构,是 NVLink 的机架间互连,加上用于跨机架通信的高带宽 InfiniBand,再由英伟达的软件在扩展后的集群中管理请求分发和 KV 缓存路由。这种四机架、288 块 GPU 的配置,英伟达最早在 MLPerf Inference v6.0 中展示过,如今在 v6.1 中达到了 99% 的扩展效率。
多机架扩展的结果也表明,Vera Rubin 时代在互连上的投入并非纸上谈兵。从 GB300 到 Vera Rubin,每个机架的 NVLink 带宽从每秒 130 TB 翻倍到每秒 260 TB;证明即便是当前的 GB300 系统也能在 288 块 GPU 上达到 99% 的效率,就为 Vera Rubin 确立了一条基线 —— 随着集群规模增长,Vera Rubin 需要达到甚至超过它。
软件优化仍在不断放大代际领先优势
v6.1 结果中较少被讨论的一点是,现有的 GB300 NVL72 这一代在首次参加 MLPerf 之后,一直在靠软件持续进步。从 2026 年 4 月的 v6.0 提交到今天的 v6.1 提交,该平台在 Qwen3-VL 上的性能最高提升到了原来的 1.6 倍;英伟达把这些提升归功于更低精度的 KV 缓存、更多的内核融合、更好的推理内核,以及基于 vLLM 和 Dynamo 的分离式服务的落地。
在固定的硬件上靠软件优化不断累积性能,一直是英伟达 MLPerf 历史中的一贯特征。在 Hopper 这一代,H100 的 MLPerf 性能从首次提交到被 Blackwell 取代前的最后一轮,提升了 6 倍以上。这对基础设施规划很重要:今天公布的 Vera Rubin NVL72 预览结果,很可能只是一条上升曲线上的早期一点。英伟达自己也指出,提交之后在 GPT-OSS-120B 和 DLRMv3 上取得的结果显示了进一步的提升,不过这些数字尚未经过 MLCommons 验证。
延伸阅读:英伟达首次公布 Vera Rubin 实测数据:智能体工作负载能效提升 30 倍
把 MLPerf 基准放在背景中看:它测量什么,局限在哪里
MLPerf Inference 基准在受控条件下、在规定的场景中测量吞吐量、延迟和最低质量要求。它们不是每 token 成本基准,不是能效基准,也不是真实环境中的服务基准 —— 不过结合公开的功耗数据,这些结果可以用来计算相对的经济性。
v6.1 中的 Qwen3-VL 工作负载基于这个 2350 亿参数的视觉语言模型,测试结合图像与文本输入的多模态推理。DeepSeek-R1 工作负载则测试总参数 6710 亿、具备推理能力的大语言模型推理。两者都代表了真实运营方会部署的前沿规模生产负载。该基准的封闭组要求输出质量达到规定的准确率阈值 —— 不能靠把输出质量降到最低标准以下来换取成绩。
v6.1 中 Vera Rubin 结果的主要局限,在于「预览」这一分类。英伟达选择在平台软件达到预期的最优水平之前就提交结果,这体现了它对硬件的信心,但也意味着与 GB300 成熟软件栈之间的对比并不完全对等。可以预期,随着 TensorRT-LLM、vLLM 和 Dynamo 针对 Rubin 的优化逐渐成熟,Vera Rubin 的数字会在 v6.2 及之后的几轮中继续提升。处于生命周期相似阶段的平台的基准结果 —— 比如 GB200 NVL72 首次亮相时的数字,后来就有了大幅提升 —— 表明当前的数字是下限,而不是上限。
Vera Rubin 与竞争格局
MLPerf v6.1 这一轮没有包括 AMD 的 Helios 机架,它由 72 块 MI455X 加速器与 EPYC Venice CPU 搭配而成,配备 31 TB 的 HBM4 内存。AMD 给 Helios 标定的 FP4 推理算力为 2.9 exaFLOPS,低于 Vera Rubin NVL72 的 3.6 exaFLOPS(NVFP4)。截至本文撰写时,AMD 尚未将 Helios 提交 MLPerf 基准测试,这意味着这两套机架级系统之间目前还没有同等条件下的 MLPerf 对比。
在 GPU 层面,AMD 的 Instinct MI355X 在 2026 年 4 月提交了 MLPerf Inference v6.0 结果,在多项服务器推理工作负载上与英伟达 B200 的差距缩小到了个位数百分比 —— 这是该基准历史上两者差距最小的一次。这种竞争地位能否延伸到采用同样分离式服务技术的 Helios 机架级系统,公开的基准数据尚未给出答案。
因此,v6.1 结果的竞争意义主要在于:从 GB300 到 Vera Rubin 的代际跃升如今有了基准支撑的量化数据,而不在于同代硬件上英伟达与 AMD 的比较。在维持 GB300 产能与转向 Vera Rubin 之间做决定的超大规模云厂商,现在可以把经过审计的吞吐量倍数纳入考量,而不必只依赖英伟达在自己测试环境中得出的数字。
同样值得一提的是 MLPerf 历史记录所显示的代际提升轨迹。英伟达 GB200 NVL72 在 2025 年初首次提交 MLPerf 结果时,在某些工作负载上的吞吐量最高可达此前基于 H100 的系统的 30 倍。随着同一硬件上的软件在后续几轮中逐渐成熟,性能还在持续攀升。随后,GB300 NVL72(Blackwell Ultra)在 2025 年 9 月的 MLPerf Inference v5.1 中首次亮相时,在 DeepSeek-R1 上的单 GPU 性能又比 GB200 提升了 45%。如今 GB300 的软件达到其 2026 年 4 月自身基线的 1.6 倍,说明这条曲线并没有变平。对于任何在「现在部署 Vera Rubin」与「再等等」之间权衡的人来说,这条轨迹很重要:历史证据表明,早期的预览数字往往低估了一个平台最终达到的水平,这让眼下 3.7 倍的对比更像是一个保守的下限,而不是稳定的上限。
Jetson AGX Thor 与 Edge-Agentic 基准的首次亮相
v6.1 这一轮还推出了 MLPerf 首个 Edge-Agentic 基准,用来测量这样一类端侧推理:在没有云端连接的边缘硬件上调用工具、处理传感器输入并执行多轮推理循环。英伟达使用 TensorRT Edge-LLM 搭配 Qwen3.6-27B 模型,在这一基准上提交了 Jetson AGX Thor 的结果。
MLCommons 的 Edge-Agentic 基准规范聚焦于长上下文下的多轮智能体编程推理,回放录制下来的交互轨迹,其中包括工具调用、代码执行和不断增长的对话历史 —— 这些模式是简单的文本生成基准捕捉不到的。对于机器人、工业自动化和端侧 AI 智能体等边缘部署而言,相比以往定义边缘推理性能的固定序列测试,这一基准更真实地衡量了硬件必须承受的负载。
Jetson AGX Thor 拥有 2070 FP4 teraflops 的算力,是英伟达嵌入式产品线中最强的边缘设备,专为物理 AI 设计 —— 也就是机器人、自主系统,以及无法为每一步推理承受云端往返延迟的常驻智能体。它在 v6.1 中的首次亮相,契合 MLCommons Edge LLM 工作组所宣布的优先事项:为智能体边缘负载带来标准化的测量。在更广泛的 v6.1 提交结果中,出现了 19 家英伟达生态合作伙伴的成绩,其中 8 家提交了多节点的 Blackwell NVL72 系统。
Edge-Agentic 基准选用 Qwen3.6-27B(一个在单个边缘加速器上以 Q4_K_M 量化运行的 270 亿参数模型),是一个刻意的设计选择。270 亿参数的模型在 4 位量化下能装进高端边缘硬件的内存限制,而它的指令遵循和工具使用能力足以运行真实的编程智能体任务。伯克利函数调用排行榜(Berkeley Function Calling Leaderboard)v4 提供了准确率门槛:系统必须正确调用外部函数并解析其结果,得分超过阈值之后,性能数字才算数。这种两段式结构 —— 先过确定性的准确率门槛,再测性能 —— 有别于只测 token 生成速度的大语言模型生成基准。对于智能体调用错误 API 会带来实际运营后果的边缘部署而言,以准确率为门槛的测量,比只看吞吐量的数字更能反映真实的部署要求。
推理经济学,以及数据中心行业接下来关注什么
MLPerf Inference v6.1 记录下的吞吐量提升,会直接转化为 token 经济学。在 AI 工厂部署中,吞吐量决定每个机架的收入:在同一个模型、同样的功耗范围内,每秒生成 token 数达到 3.7 倍的系统,在相同 token 价格下每小时的收入也是 3.7 倍。更高的吞吐量也使更低的每 token 价格成为可能,从而扩大模型提供商可触达的用户群。这就是为什么英伟达用生成更多 token、服务更多用户、创造更多收入来阐述推理基准,而不是用抽象的算力数字。
99% 的多机架扩展效率补全了这幅图景:它意味着新增推理容量的边际成本大致等于新增硬件的边际成本,而不会出现迫使运营方过度配置的次线性回报。
有两个近期的里程碑,将进一步延伸今天这批 MLPerf 数据所确立的结论。第一,SemiAnalysis 将按照其 InferenceX 方法论,对 Vera Rubin 的 v6.1 结果进行独立验证 —— 此前记录该平台智能体能效数据的,正是同一套基准框架。如果 MLCommons 审计的数字与 SemiAnalysis InferenceX 方法论得出的结果一致,将大大加强向 Vera Rubin 过渡的经济性论证。第二,MLCommons 正在开发 MLPerf Endpoints 基准,它将在 API 服务层面、而不是硬件层面测量 AI 推理,覆盖端到端延迟、真实流量模式下的吞吐量以及每次查询的成本。这一基准将是下一次标准化检验,看今天记录下的吞吐量提升,能否为调用这些 API 的开发者和机构带来更好的结果。
由固定序列 GPU 吞吐量测试定义的基准时代,正在让位于一个智能体工作负载、多机架扩展和每 token 能效同等重要的时代。今天的 MLPerf Inference v6.1 结果,让 Vera Rubin NVL72 站在了这场转变的前列 —— 需要注意的是,该平台的软件仍在积极开发中,今天公布的数字只是一条改进曲线的起点,而按照该基准自身的历史,这条曲线还会继续向上。