押注华为训练芯片:DeepSeek CEO 称这是公司最大赌注之一
6 月用 1000 颗昇腾 910C 跑通了一次后训练,为更大的投入铺路

据 The Information 报道,DeepSeek 创始人兼 CEO 梁文锋对投资者表示,把 AI 训练迁到华为的国产加速器上,如今是公司最大的战略赌注之一;华为最早有望在 2026 年第四季度开始交付专用的训练硬件。这番表态是在一次闭门投资者会议上作出的,于周一首次见报,它所代表的投入,与此前公开已知的情况有本质区别。DeepSeek 此前是把华为芯片用进了自己的推理服务栈;而梁文锋现在描述的是:这家硬件公司对于「模型在哪里被造出来」至关重要。
这个转变之所以重要,是因为训练和推理并不是可以互换的工作负载。运行一个训练好的模型来生成回应 —— 也就是推理 —— 是一项相对有边界的任务,自 R1 时代起,华为的昇腾芯片就一直在为 DeepSeek 承担。而用数千亿个 token 从零教会一个模型,让数万颗处理器以紧密同步的方式连续协作数周 —— 那是性质根本不同的计算,而且直到 2025 年 8 月,华为芯片都还没能稳定地完成这类任务。正是这段历史,让梁文锋对投资者的这番话成为迄今最重要的信号:DeepSeek 的国产硬件图景确实发生了某种变化。
从 R2 的失败到今天,变了什么
要理解这次表态为什么有分量,得先把 2025 年 8 月那次失败摆上桌面。DeepSeek 的 R1 模型在 2025 年 1 月震动市场之后,中国政府官员鼓励这家实验室用华为昇腾加速器、而不是英伟达硬件来训练下一个模型 R2。这次尝试遇到了《金融时报》和路透社记录下的一连串持续问题:长时间训练中多芯片性能不稳定,芯片间通信慢于英伟达的互联,而华为的 CANN 软件框架 —— 相当于英伟达 CUDA 的华为版本 —— 缺少生产级训练所需的成熟工具链和调试基础设施。即便华为工程师在 DeepSeek 的办公室驻场了好几周,也没有完成一次成功的训练。这家实验室最终把 R2 的预训练改回英伟达,华为芯片则留给要求没那么高的推理工作。
据报道,转折点是 2026 年 6 月对 V4 Pro 的一次后训练 —— V4 Pro 是 DeepSeek 的 1.6 万亿参数混合专家模型 —— 用约 1000 颗昇腾 910C 芯片完成,全程没有出现不稳定。后训练的要求低于前沿级预训练:它是打磨一个已经完成的模型,而不是从零造一个;计算任务更小、边界更清楚,对当年让 R2 训练崩掉的那类多芯片同步问题也更宽容。6 月的成功并不能证明华为芯片扛得住 2 万亿参数的预训练 —— 它证明的是华为芯片能胜任较轻的收尾阶段。但对梁文锋来说,这似乎已经提供了下决心所需的证据。
昇腾 950DT:训练赌注的核心芯片
梁文锋押注的硬件,并不是 6 月概念验证中用的昇腾 910C。这次训练投入的核心芯片是昇腾 950DT,计划于 2026 年第四季度商业交付。华为专门为需要高内存容量和高带宽的训练与解码工作负载设计了 950DT —— 正是 2025 年在大规模下压垮旧款 910C 的那种负载特征。
纸面上看,950DT 的内存规格相当亮眼。它集成了 144 GB 的华为自研 HiZQ 2.0 高带宽内存,提供每秒 4 TB 的内存带宽,以及每秒 2 TB 的芯片间互联带宽。在 FP8 精度下,它能达到 1 PFLOPS 的算力;在 MXFP4 下可达 2 PFLOPS。互联带宽是前代昇腾 910C 的 2.5 倍,这对训练尤其关键 —— 训练的瓶颈往往在于数千颗芯片在反向传播中交换梯度的速度。
作为对比,英伟达 H200 配备 80 GB 的 HBM3e 内存,带宽为每秒 3.35 TB。在内存容量和原始带宽上,950DT 公布的规格与 H200 相当甚至领先。差距依然悬殊的,是更高精度和整体算力层面:英伟达将于 2026 年下半年推出的 Vera Rubin VR200,FP4 训练算力标称 35 PFLOPS,而 950DT 在 MXFP4 下是 2 PFLOPS —— 对规模最大、要求最高的训练来说,这个差距最要紧。华为承认自己走的是「一年一代、每代算力翻倍」的节奏,面向 2027 年的昇腾 960 系列目标是把 950 的能力再翻一番。华为自家的 Atlas 950 SuperCluster 规格把超过 52 万颗这种芯片连在一起,宣称总算力达 524 EFLOPS。
CANN 的差距,以及没人宣布的软件难题
单靠芯片规格,决定不了一次训练能否成功。R2 的失败有一部分是硬件问题 —— 互联慢、规模上去就不稳定 —— 但同样也是软件问题。英伟达的 CUDA 平台积累了约 15 年的发展,在调试工具、优化库和分布式训练框架上,整个行业都是围绕它来构建的。华为的 CANN(Compute Architecture for Neural Networks)框架在功能上够用,但一直缺少那样深厚的生态。
至少从 2026 年初起,DeepSeek 就在与华为共同改造 CANN,调校那层把 DeepSeek 训练代码映射到华为加速器架构上的软件。这项工作没有公开细节,但 6 月的后训练成功说明,软件整合相比 R2 时代已大有改善。仍然未知的是这种改善走到了哪一步 —— 它是否覆盖一个 2 万亿参数模型所需的、持续数周、动用数万颗芯片的完整预训练,还是只覆盖了被测试过的、范围更窄的后训练。英伟达 CEO 黄仁勋在 2026 年 5 月的 Dwarkesh Podcast 上直接谈到了这个威胁,称 DeepSeek 针对华为硬件做优化,对美国来说将是「一个可怕的结果」。
延伸阅读:DeepSeek V4 Flash Vision Exp:以文本模型的价格打开多模态智能体工作流
DeepSeek 的扩展野心,以及国产芯片为何重要
梁文锋为什么现在下这个注,背景是 DeepSeek 接下来打算造的东西的规模。据 HuggingNews 所报道的投资者披露信息,这家实验室目前正在训练一个 2 万亿参数的模型,并计划最终做一个 8 万亿参数的模型。这些数字与 DeepSeek 已发布的任何东西都不在一个量级。当前的旗舰 V4 Pro 是一个 1.6 万亿参数的混合专家模型,每个 token 只激活 490 亿参数 —— 这意味着它实际的推理计算成本更接近一个 490 亿参数的稠密模型,而不是 1.6 万亿参数的模型。
一次真正的 2 万亿参数预训练,需要的原始算力要比 V4 Pro 的训练多得多 —— 而一个 8 万亿参数的模型,其训练野心可与全球公开宣布过的最大规模训练相提并论。在这样的规模下,通过中国受限的供应渠道获得英伟达硬件 —— 禁令前囤积的芯片、2025 年 12 月中美协议下有限的 H200 配额(至今尚未带来大量交付),以及未披露的其他来源 —— 不能指望无限扩展下去。国产芯片如果行得通,就能消除这个供应链上的软肋。
英伟达的处境,以及这个预测的意义
梁文锋作出这番投资者表态的背景,是一个变化速度异常之快的半导体市场。英伟达向美国证交会提交的 2026 财年 10-K 文件写道,公司「实际上已被排除在中国数据中心计算市场的竞争之外」—— 这是英伟达自己对三年来不断收紧的出口管制所造成结果的表述。伯恩斯坦研究估计,英伟达在中国 AI 芯片市场的份额已从 2025 年的约 40% 跌到 2026 年底的约 8%,而华为的份额升到了约 50%。
这种转变是被一系列具体的监管举措加速的:2025 年 4 月,连英伟达专为符合既有管制而做的降级版 H20 芯片也被禁售;2025 年 9 月,中国政府指示国内企业停止采购英伟达 GPU;以及 2025 年 12 月的一项有限松绑安排 —— 允许向约 10 家获批的中国企业出售 H200,每家上限 7.5 万颗,美国政府分成 25% 的收入 —— 但截至 2026 年年中,实际交付寥寥无几。最终结果是,中国的主要 AI 实验室 —— 包括 DeepSeek —— 都在靠有限的西方芯片库存运转,必须围绕自己真正拿得到的硬件来规划未来的训练基础设施。
什么必须做对
梁文锋的这一注要想押中,有几个条件必须成立。昇腾 950DT 必须能规模化到货。2026 年华为的 950DT 产能受制于芯片所需的先进高带宽内存组件供应有限,估计 2026 年产量约为 20 万到 30 万颗。DeepSeek 为乌兰察布推理集群下的 16 万颗芯片订单 —— 那是一座正在内蒙古建设的 1 吉瓦数据中心,位于北京西北约 350 公里 —— 已经占去了其中相当大的份额。训练用的交付,将同时与 DeepSeek 自己以及其他同样在转向华为芯片的中国实验室的推理需求争抢产能。
CANN 软件必须从「后训练可靠」成熟到「大规模预训练稳定」。R2 的失败具体是预训练的失败;6 月 V4 Pro 的成功是后训练的成功。要证明华为芯片能在不失稳的情况下撑住持续数周、动用数千颗芯片的前沿预训练,是与那次为梁文锋的表态扫清道路的后训练任务完全不同的工程挑战。
而且模型本身必须值得训练。DeepSeek 2 万亿参数的目标,是 V4 Pro 总参数量的两倍多。MoE 架构的扩展并不遵循线性规律 —— 在非英伟达硬件上,数万亿参数规模下的路由稳定性、专家间负载均衡和训练收敛,仍然是悬而未决的工程问题。
接下来会怎样
华为提速的芯片路线图,制造出一个具体的近期检验窗口。9 月 17 日在上海华为全联接大会 2026 上发布的昇腾 960DT,现定于 2027 年第一季度推出 —— 比原先的 2027 年第三季度提前 —— 随后在 2027 年第三季度推出 960PR 变体。960 系列的定位是把 950 的算力和内存能力大致翻一番。如果 DeepSeek 能在 2026 年第四季度开始在 950DT 硬件上跑训练任务,结果将是梁文锋这一注是否押中的最早的真实证据 —— 也会影响其他中国前沿实验室跟进同一路线的力度。
乌兰察布推理集群预计在 2027 年底或 2028 年初首批算力上线,它也会提供一个可测量的信号:不是华为芯片能不能训练模型,而是它们能不能以 DeepSeek 在中国约 1.3 亿月活用户、以及不断增长的全球 API 用户群真正需要的吞吐量来提供服务。在国产芯片上做到这种规模的推理,会给其他中国实验室提供一个以往任何部署都没能提供的数据点。
梁文锋对投资者说,「一年之内,真实世界的部署就会证明这个生态行得通。」这句话据报道出自 2026 年年中的一次投资者会议,如今它有了一个隐含的期限:2027 年第三季度。到那时,要么华为芯片已经把 DeepSeek 的一次前沿训练跑到了终点 —— 要么,这一注与结果之间的落差,会在 DeepSeek 下一个发布的模型所用的算力栈上显露出来。
延伸阅读:英伟达 Vera Rubin NVL72 首次亮相 MLPerf:吞吐量达 Blackwell 的 3.7 倍