英伟达首次公布 Vera Rubin 实测数据:智能体工作负载能效提升 30 倍
Groq 3 LPX 量产,每秒 3400 token;SpaceXAI 为 Grok 智能体选用 Vera CPU
英伟达周一在 Hot Chips 2026 上发布了其 Vera Rubin NVL72 机架级系统的首批实测基准数据,显示该平台在智能体编程工作负载上,每兆瓦的 AI 工厂吞吐量最高可达当前一代 GB300 NVL72 的 30 倍 —— 这个数字附带着若干重要的限定条件,但它标志着推理硬件在设计与评估方式上的一次真实转向。同一天,Groq 3 LPX —— 英伟达专用的低延迟推理加速器 —— 进入全面量产,云服务商 Nebius 签约成为首个客户。SpaceXAI 另行承诺部署英伟达专门打造的 Vera CPU,作为驱动其 Grok 智能体 AI 基础设施的编排层,并确认计划把同一套硬件栈搬上第一代 Starmind 卫星、送入轨道。
把这三项公告放在一起,勾勒出的是英伟达自 2025 年 12 月以 200 亿美元收购 Groq 资产以来一直在构建的一套基础设施论述:智能体 AI 工作负载在结构上不同于常规的语言模型推理,而要把它们服务好,需要三种不同的处理器协同工作 —— GPU、LPU 和智能体 CPU —— 而不是靠单一芯片包打天下。
智能体 AI 已经打破了标准推理基准的模型
支撑英伟达能效主张的基准是 AgentX,这是 SemiAnalysis 推出的一个开源基准,属于其 InferenceX 套件的一部分。AgentX 会回放预先录制的 Claude Code 编程智能体会话 —— 真实的生产风格轨迹,其中包含工具调用、代码执行、子智能体派生,以及在一次会话过程中从约 6 万 token 增长到 40 万 token 甚至更多的上下文窗口。
这个设计之所以重要,是因为智能体不会安分待着。智能体会话中的每一轮,都可能比上一轮长得多或短得多;早先几轮的 KV 缓存可以被复用;而模型调用会被工具执行的空档打断,那期间根本没有推理在发生。一个使用固定序列长度的基准 —— 比如 8000 个输入 token、1000 个输出 token —— 完全说明不了当请求形状在数百次连续调用中持续变化时,系统表现如何。英伟达自己的技术博客指出,传统的固定序列基准在 InferenceX 平台上已被降级为「维护模式」,原因正是这种不匹配。
需求侧的驱动力是真实的:据英伟达援引 OpenRouter 对 100 万亿个真实世界 token 的分析,每次请求的平均提示 token 数已增长约四倍,而单次智能体请求消耗的 token 量是普通聊天交互的 15 倍。
30 倍这个说法:是边界处的性能提升,不是一个统一的倍数
英伟达 Vera Rubin NVL72 在 AgentX 工作负载上的结果,是英伟达自己用 DeepSeek V4-Pro(一个 1.6 万亿参数的专家混合模型)测得的,并被注明尚待 SemiAnalysis 复核 —— 也就是说,截至发稿,这项基准还没有得到独立确认。
能效优势不是一个恒定的倍数。在每用户每秒 110 token 这个相对标准的交互性目标下,Vera Rubin NVL72 每兆瓦的吞吐量约为 GB300 NVL72 的两倍。在每用户每秒 130 token 时,优势扩大到约 10 倍。在每用户每秒 160 token 时,差距拉开到 30 倍。在 GB300 NVL72 已基本耗尽余量的交互性水平上,Vera Rubin NVL72 仍能维持响应性能,而且单位功耗的效率更高 —— 而对受电力基础设施制约的数据中心来说,这才是运营上真正相关的指标。
GB300 NVL72 自己在这条能效曲线上的位置也很可观:在用 DeepSeek V4-Pro 跑的 AgentX 上,它每兆瓦的吞吐量最高可达上一代 H200 NVL8 的 15 倍。面对 2.8 万亿参数的专家混合模型 Kimi K3,GB300 NVL72 每兆瓦的吞吐量最高可达 H200 NVL8 的 80 倍。英伟达还表示,其DSX MaxLPS 电源管理技术可以在同样的兆瓦预算内多配置最多 40% 的 GPU,在架构性能效提升之上又叠加了一层功耗包络优化。
AFD:把两个不同计算问题分开的架构
这些性能提升主要不是更快的 GPU 芯片带来的。它们源自注意力—前馈网络解耦(Attention-FFN Disaggregation,简称 AFD)—— 一种把 Transformer 解码循环中两种计算特性迥异的操作在物理上分开、并分别路由到不同硬件的技术。
在每一个解码步骤中,对累积 KV 缓存的注意力计算严重受限于内存带宽,会从 GPU 显存那庞大的 HBM 容量中获益。而前馈网络的执行 —— 以及在专家混合模型中,把每个 token 路由到一部分专门化专家网络这件事 —— 涉及的工作集更小,由 LPU 的高带宽片上 SRAM 来服务更合适。AFD 会按每个 token 把这两者分派给两种不同的处理器,通过平台的互联结构交换中间激活张量,由英伟达的 Dynamo 服务框架负责编排路由、会话跟踪和 KV 缓存感知的负载均衡。
在机架规模上,Vera Rubin NVL72 通过 NVLink 6 连接 72 颗 Rubin GPU 和 36 颗 Vera CPU,英伟达称其提供每秒 260 TB 的全互联结构带宽,且内部没有铜缆。这种无线缆中背板设计,把机架装配时间从上一代 Grace Blackwell 的 100 分钟缩短到 5 分钟 —— 在地面上这是便利,而在 SpaceXAI 所追求的轨道场景里,这是可靠性要求。
Groq 3 LPX:基于 SRAM 的解码,每秒 3400 token
而 Groq 3 LPX 是实现 AFD 中 LPU 那一侧的推理加速机架。它在 32 个液冷计算托盘中塞进 256 颗 Groq 3 LPU 芯片。机架级规格包括 315 PFLOPS 的 FP8 算力、128 GB 的 SRAM 总量、每秒 40 PB 的片上 SRAM 带宽,以及每秒 640 TB 的纵向扩展带宽。每颗独立 LPU 芯片含 500 MB 片上 SRAM,提供每秒 150 TB 的片上带宽,并有 96 条各以 112 Gbps 运行的芯片间链路。
LPU 的架构与 GPU 有一处关键的刻意差异:Groq LPU 不依赖运行时的动态硬件调度器,而是采用编译器编排的空间执行模型 —— 计算、数据搬运和同步全部在编译期显式排定。硬件强制执行准同步的芯片间协调 —— 让 256 颗加速器对齐成一个具备可预测通信时序的连贯系统,消除那种会在数百个连续智能体解码步骤中不断累积的执行抖动。
一项Artificial Analysis 的独立评测测得 Groq 3 LPX 在 10 万 token 上下文窗口下运行 Gemma 4 31B,输出速度为每秒 3431 个 token —— 这是该模型有记录以来的最高吞吐,约为所测次优平台的四倍。举个直观的例子:以这个速度生成 5000 个 token 约需 1.5 秒,而在每秒 100 token 的典型吞吐下则需要 50 秒。Groq 3 LPX 芯片由三星制造;英伟达的 Rubin GPU 由台积电生产。
Nebius 的 Token Factory 推理平台已经在服务 Cursor、World Labs、Revolut 和 Shopify,它将在 2026 年底之前部署 Groq 3 LPX。「生成是推理中决定一个 AI 系统实际响应快慢的那个阶段,而这正是 Groq 3 LPX 被造出来要加速的东西,」Nebius 首席技术官 Danila Shtan 说。「作为第一家通过 Nebius Token Factory 把它带入生产的 AI 云,我们要确保智能体循环的每一步都让人感觉是即时的 —— 通过开发者已经在用的同一套 API,无需迁移到新的技术栈。」被英伟达收购了技术的初创公司 Groq Inc.,被列为该平台的下一批早期采用者。
Vera CPU 瞄准的是推理调用之间的编排空档
Vera CPU 处理的是一个 GPU 和 LPU 基准都捕捉不到的瓶颈:推理调用之间发生了什么。一个跑在 GPU 上的智能体完成一步推理,然后框架要解析输出、执行工具调用 —— 代码沙箱、数据库查询、文件操作、API 调用 —— 收集结果、组装下一段上下文、并排定下一次推理调用。所有这些编排都跑在主机 CPU 上。一颗因为等待 CPU 端编排而闲置的 GPU,在每一步上都是被浪费的资本。
英伟达对超过 163000 次智能体会话的分析发现,其中超过 97% 呈现出独特的执行画像 —— 那种分散—聚集式的内存访问模式,是为可预测负载的吞吐量而调优的标准服务器 CPU 架构所不擅长服务的。Vera CPU 把 88 个定制的 Olympus 核心与提供最高每秒 1.2 TB 带宽的 LPDDR5X 内存搭配起来,正是针对智能体编排所要求的那些访问模式调优的。
英伟达 2026 年 7 月的内部测试发现,Vera CPU 在智能体工作负载上的单核性能最高可达 AMD Venice 处理器的 1.5 倍 —— 这个数字基于预估的 SPEC CPU 2026 结果,未经第三方独立验证。AMD 对英伟达关于 Vera CPU 的更广泛性能主张提出了异议,声称其 256 核的 Zen 6 Venice 架构在机架层面比 Vera 强 3.3 倍;截至发稿,英伟达和 AMD 双方的数字都没有经过独立测试验证。
SpaceXAI 宣布将为 Grok 的智能体 AI 基础设施部署 Vera CPU,成为继 Meta 之后第二家独立的大规模 Vera 部署方。「Vera 给了我们足够的 CPU 性能和内存带宽,去跑海量的编排、代码和数据处理,同时让 GPU 专心做它们最擅长的事,」SpaceXAI 总裁 Mike Nicolls 说。SpaceXAI 还计划用其第一代 Starmind AI1 卫星把同一套硬件栈送入轨道 —— 那是一套为 120 千瓦平均算力载荷设计的优化版 Vera Rubin NVL72 系统 —— 埃隆·马斯克在 X 上确认目标发射时间为 2027 年第四季度。英伟达和 SpaceX 都把这项轨道部署归类为前瞻性陈述,对该时间表不承担法律承诺。仍有大量工程难题悬而未决:商用硅片面向近地轨道的抗辐射认证、在超过国际空间站全部散热能力的功率水平下的热管理,以及 SpaceX 已经承认的芯片供应约束。
整合本身如今成了竞争护城河
目前没有任何竞争厂商以商业规模出货一套等效的、带统一服务框架的 GPU-LPU-CPU 整合栈。AMD、英特尔、谷歌和亚马逊各自处理推理问题的一部分,但没有一家宣布过可类比于「Vera Rubin NVL72 + Groq 3 LPX + Dynamo 编排」的生产就绪组合。
因此,英伟达正在累积的优势是一条系统整合护城河:AFD 带来的性能提升需要 Dynamo 的编排;Dynamo 依赖 NVLink 6 的结构把 Rubin GPU 与 Groq 3 LPU 连起来;而整套栈的经济性取决于三种处理器都在协同运行工作负载。一家想以有竞争力的延迟和能效交付生产级智能体推理的 AI 云服务商,需要复制的不只是单个芯片,而是整个分层服务系统 —— 这道追平门槛,比对上任何单颗 GPU 的吞吐数字都要高得多。
Vera Rubin NVL72 的 AgentX 基准结果仍有待 SemiAnalysis 的独立复核。Artificial Analysis 对每秒 3431 token 这一数字的独立确认提供了一个有分量的数据点,但 GPU 机架那个 30 倍的头条能效主张仍在等待第三方佐证。这个区分对于「理解架构转向的方向」不那么要紧,对于「校准其量级」则很要紧 —— 而在方向上,来自英伟达和第三方来源的数据指向同一处:由固定序列 GPU 吞吐测试所定义的基准时代已经结束,而那些能在可变上下文、多步骤、被工具打断的智能体工作负载下展示出高效性能的硬件厂商,将定义下一个竞争前沿。