HPE 推出首款搭载英伟达 Vera CPU 的服务器
88 核 Vera CPU 搭配 GPU 集群,应对大规模智能体 AI 的编排负载

慧与(Hewlett Packard Enterprise) 的 ProLiant Compute DL394 Gen12 是第一款围绕 NVIDIA Vera CPU 打造的企业级服务器,将于今年秋季正式上市 —— 与此同时,越来越多的证据表明,最有可能卡住大规模智能体 AI 部署的部件是 CPU,而不是 GPU。这款服务器把 NVIDIA 的 88 核 Armv9.2 处理器与 HPE 现有的 GPU 服务器产品线配对,瞄准的是聊天机器人时代的基础设施从未被设计来高效服务的编排层。每天处理 1.1 万亿条消息的纽约证券交易所,正在考察 DL394 Gen12,连同 Redpanda 流处理和 NVIDIA 的 AI 栈,用于 AI 就绪的市场基础设施 —— 这是一个早期信号:在延迟故障会带来财务后果的环境里,这种架构正被认真对待。
为什么智能体 AI 先耗尽 CPU,而不是 GPU
DL394 Gen12 要解决的瓶颈是结构性的。在聊天机器人时代的 AI 中 —— 大模型以高吞吐批次响应离散的查询 —— GPU 占据了执行时间的大头,每四到八块 GPU 配一颗 CPU 是合理的配置。智能体 AI 从根本上改变了执行剖面。
AI 智能体接到一个任务时,它运行的不是一次推理调用。它要运行推理、解析输出、路由到工具(网页搜索、代码执行、数据库查询)、执行这些工具、在子智能体之间管理状态、组装上下文,然后再次调用模型。GPU 在推理期间高强度工作,但在周围所有步骤中都在等待。这些步骤 —— 编排层 —— 受 CPU 限制,并随智能体规模而增长。
市场研究机构 TrendForce(集邦咨询) 预计,密集智能体部署中的 CPU 与 GPU 配比,正从历史上的 1:4 到 1:8 区间转向 1:1 或 1.2:1。这一转变有直接的资本支出后果:为聊天机器人推理配置的基础设施,在结构上对智能体编排供给不足,而这个缺口无法仅靠软件优化来弥合。
2026 年 8 月发表的一项聚焦智能体 AI 资源动态的独立研究发现,CPU 的配置如今已是智能体部署中的一等基础设施决策 —— 与标准配置相比,匹配得当的 CPU 分配能大幅降低对 CPU 敏感的智能体任务的延迟。
延伸阅读:英伟达 Vera Rubin NVL72 首次亮相 MLPerf:吞吐量达 Blackwell 的 3.7 倍
NVIDIA Vera 的单片架构与 NUMA 的差别
NVIDIA Vera CPU 使用 NVIDIA 自己的「Olympus」核心架构,这是一种 Armv9.2 实现,88 个物理核心做在一块单片裸晶上,而不是 AMD EPYC 和 Intel Xeon Scalable 所用的芯粒组合。单片设计对智能体所执行的那类具体工作很重要。
基于芯粒的处理器引入了 NUMA(非统一内存访问)拓扑 —— 某些核心到某些内存区域的路径更长。对于矩阵乘法这类 GPU 工作负载,NUMA 开销基本无关紧要。而对于智能体在所有核心上同时执行的、对延迟敏感的状态管理和上下文组装,NUMA 延迟会在并发下叠加。据 HPE 的新闻稿,Vera 的单裸晶架构让全部 88 个核心以 1.2 TB/s 的带宽统一访问最多 1.5 TB 的 LPDDR5X 内存 —— 每核心最高可达 14 GB/s。
在 Vera Rubin 平台中,NVLink-C2C 提供 1.8 TB/s 的一致性 CPU-GPU 互连带宽,让 CPU 和 GPU 共享统一的内存地址空间,无需跨 PCIe 复制数据 —— 减少了智能体编排与模型推理调用之间的串行化开销。
DeepInfra 是一家生产级 AI 推理平台,通过 NVIDIA 的开放 AI 生态获得了早期硬件使用权,它于 2026 年 7 月 21 日发布的基准结果显示,Vera 的编排速度比 x86 基线快最多 2.2 倍,并且在相同服务质量下支持最多 1.6 倍的并发 AI 智能体。DeepInfra 用自己的生产 AI 智能体和捕获的流量,把 Vera 与 AMD Zen5(Turin)、Intel Granite Rapids 和 Intel Sapphire Rapids 做了对比测试,并报告称 Vera 在每一类工作负载中都是四种架构里最快的。
Phoronix 于 2026 年 5 月 26 日发布了在 NVIDIA 提供的量产前硬件上的早期基准,称 Vera CPU 是 Phoronix 测试过的最有竞争力的 Arm 服务器性能,尽管核心数少 40 个,在多项工作负载中的表现仍与当前一代 AMD EPYC 9005 Turin 处理器相当。一项内核编译测试中,88 核的 Vera 胜过了 NVIDIA 自己拿来对比的 128 核 Intel Xeon 6980P。随着平台在生产环境中走向成熟,NVIDIA 自己的性能主张应当与这些第三方结果放在一起评估。
HPE 的 AI Factory 整合与企业部署图景
HPE 把 DL394 Gen12 定位为其 AI Factory 栈中的 CPU 层,该栈还包括用于 GPU 密集计算的 ProLiant DL380a 和 XD685,以及用于高 GPU 密度机架的 XD700,统一由 HPE Compute Ops Management 管理。6 月在拉斯维加斯举行的 HPE Discover 2026 上,DL394 被加入 HPE Private Cloud AI,使 CPU 与 GPU 均衡的部署可以在统一管理下进行。
DL394 Gen12 还在每一层嵌入了安全性。据 HPE 称,这款服务器是最早满足 NIST 抗量子计算安全要求的产品之一,配备 Silicon Root of Trust 和 HPE 由 iLO 启用的安全飞地 —— 公司称其在服务器生命周期的每个阶段都提供保护。HPE Compute Ops Management 提供 AI 驱动的运维,旨在减少服务器管理时间。
HPE 于 2026 年 9 月 2 日发布的 2026 财年第三季度财报 显示,其 AI 产品组合有可观的已承诺需求。公司创下 122 亿美元的营收纪录(同比增长 34%),其中云与 AI 板块的服务器营收为 68 亿美元(增长 35.3%)。当季 AI 系统订单达 24 亿美元,环比增长超过 30%,AI 系统积压订单在季度末增至 68 亿美元。这些数字反映的是整个 AI Factory 产品组合;DL394 Gen12 是一个已经在产生可观收入的产品线中最新的组件。
竞争格局:戴尔、联想和 Supermicro 也在做 Vera 服务器
HPE 凭 DL394 Gen12 率先上市,但这个优势狭窄而短暂。戴尔、联想和 Supermicro 各自都已宣布围绕 NVIDIA Vera CPU 打造的企业级服务器平台,形成的是一个多 OEM 的品类,而不是 HPE 独占的产品。HPE 可守的优势在于整合深度 —— AI Factory 软件栈、带 Silicon Root of Trust 和抗量子固件的 iLO 安全,以及企业支持体系 —— 而不是对硬件的独家获取。
更广泛的竞争是 AMD 的回应。AMD 宣布了第六代 EPYC 处理器,明确以智能体编排为定位,主张带有优化内存子系统的现代 x86 可以匹敌 Vera 的吞吐量,同时保持与企业 x86 软件栈的兼容。企业 AI 编排中 x86 与 Arm 之争,还没有被大规模的独立生产证据所解决。
延伸阅读:CoreWeave 上线多机架 Vera Rubin 集群,MLPerf v6.1 证实 3.7 倍性能提升
局限:新硅片、高热设计功耗、有限的量产历史
DL394 Gen12 是 NVIDIA Vera CPU 的第一代企业部署。现有的第三方基准证据来自量产前硬件和一个由 NVIDIA 授予早期使用权的平台 —— 是有用的数据点,但还不足以在真正独立的条件下刻画每一种智能体工作负载类型和配置下的性能。Vera 450 瓦的热设计功耗高于多数可比的服务器 CPU,对数据中心的散热和功率密度有影响。LPDDR5X SOCAMM2 内存形态在企业供应链中的支持不如 RDIMM DDR5 广泛,可能使大规模的可维护性后勤变得复杂。这些都是可知的约束,基础设施架构师应当把它们与性能差距放在一起权衡。
智能体 AI 正在迫使的基础设施更新
DL394 Gen12 的意义超过任何单项基准。2022 年到 2025 年间建成的大多数企业 AI 基础设施的工作假设 —— 高度偏向 GPU 的配置就足够了 —— 正随着智能体部署的成熟而被修正。如果 TrendForce 预计的 CPU 与 GPU 配比转变在大规模上被证明准确,那么为聊天机器人推理优化的数据中心需要的是结构性更新,而不是软件补丁。HPE、戴尔、联想、Supermicro 和 AMD 都在为那个更新周期布局。结果与其说取决于任何一款服务器的基准,不如说取决于哪家厂商能交付大规模智能体部署所需要的整合产品组合、管理工具和企业支持。DL394 Gen12 是 HPE 的开场论点:智能体 AI 的正确答案不只是更多的 GPU —— 而是合适的 CPU 搭配合适的 GPU,在生产规模上作为一个连贯的系统来管理。