阿里开源 Qwen4 架构预览版,智能体编程能力超过 Claude Opus
凭一层新颖的 N-gram 嵌入,阿里这个开放权重 MoE 在 SWE-bench Pro 上胜过 Claude Opus 4.6
阿里巴巴于 8 月 26 日以开放权重发布了 Qwen3.8-Flash-Next —— 它不是作为一款独立产品,而是作为对即将到来的 Qwen4 模型家族所用架构的一次刻意提前揭示。该模型主网络虽有 1250 亿参数,但每个 token 只激活 60 亿;此外它还通过一层新颖的 N-gram 嵌入追加了 510 亿参数,而这层在每 token 的 GPU 算力上几乎不花钱。在公司自报的编程评测中,它在 SWE-bench Pro 上得分 62.5,超过了 Claude Opus 4.6 在同一评测上官方公布的 53.4。阿里称,训练它所需的算力约为上一代旗舰 Qwen3.7-Plus 的九分之一,而在其公布的结果表中,它在几乎每一个智能体类别上都胜过后者 —— 依据是技术报告。
该模型是多模态的 —— 接受文本、图像和视频 —— 并已在 Hugging Face 和魔搭社区以 qwen-community-1.0 许可证即时可用。QwenCloud 上的 API 接入定价为每百万输入 token 0.16 美元、每百万输出 token 0.47 美元,在输入这一档上约为 Qwen3.8-Max 的十二分之一。一个名为 Qwen3.8-Flash 的生产版本,默认带一百万 token 上下文窗口和内置工具集成,预计将于 9 月 1 日向开发者开放 API。
N-gram 嵌入层:一条扩展模型容量的新路
Qwen3.8-Flash-Next 在架构上最重要的特性,是一个此前任何已发布的、这一量级的主流开放权重前沿模型中都不曾出现的元素:一层 510 亿参数的 N-gram 嵌入,它在不按比例增加 GPU 算力的情况下扩展了模型的有效容量。
标准 Transformer 架构扩展容量主要有两条路:把稠密模型做大(参数更多,且每个 token 全部激活),或者把 MoE 模型做宽(专家子网络更多,但每次只激活其中一部分)。两条路都会增加 GPU 显存需求,而在 MoE 这条路上还会增加 GPU 之间的通信开销。N-gram 嵌入层的做法不同。它不是在推理时把 token 路由过更多参数,而是用当前 token 结合前面的一到两个 token —— 也就是二元组和三元组 —— 做哈希表查找,从一张有 2000 万条目的固定查找表中取回一个 2560 维的表示。每个 token 会做十六次查找:八个二元组哈希头和八个三元组哈希头。
由于这次查找是确定性的表读取而不是矩阵乘法,这 510 亿参数在每个 token 上增加的浮点运算接近于零。更实际的是,整张表 —— BF16 下约 95.4 GB —— 可以被搬到主机 CPU 内存,在主 GPU 计算推进的同时异步读取,因此它根本不必占用 GPU 显存。SGLang 的独立工程报告与模型发布同时发表,确认在 H200 GPU 上以张量并行 4 的配置启用主机内存卸载后,每 GPU 的权重显存从 83.91 GB 降到 60.45 GB —— 减少 23.46 GB —— 同时在相同显存预算下把可用 KV 缓存容量从 184 万 token 提高到 328 万 token。实测吞吐变化小于 0.1%。
这一层位于网络中第二个解码器块,把取回的嵌入喂进模型 Gated Residual 模块的四条并行分支。关键在于,阿里并不只是把它当作一项显存管理优化,而是把它定位为 Qwen4 家族一条根本不同的参数扩展轴:这份容量的增长既独立于 GPU 算力,也独立于那个本会驱动推理成本的专家数量。如果这一主张在 Qwen4 想必会用到的更大规模上依然成立,那就意味着阿里未来的模型能够存储多得多的习得表示,而不必付出成比例的推理硬件成本。
混合注意力架构如何应对长上下文成本
N-gram 嵌入层运作在一个 48 层的架构之内,而这个架构为 Qwen4 这一代还在另外三个维度上做了重新设计:注意力、残差连接和训练配方。
在注意力上,模型用一种 3:1 的混合,取代了「整个网络使用单一注意力变体」的常规做法。每四层中有三层使用 Gated DeltaNet,这是一种线性注意力机制,把历史上下文压缩进一个固定大小的循环状态,而不是维护一个不断增长的 KV 缓存。第四层使用 Qwen 稀疏注意力(QSA),它确实在完整的历史上下文上运作,但走的是两阶段流程:先由一个轻量索引器给上下文的压缩微块打分,找出最重要的区域,然后稀疏注意力只读取被选中的条目 —— 最多 2048 个位置 —— 且使用的是原始未压缩的 KV 值。因此整个模型只有 48 层中的 12 层维护不断增长的 KV 缓存;其余 36 层不论上下文多长都使用恒定大小的状态。这正是该模型能够支持 262144 token 原生上下文窗口而不出现二次方显存增长的结构性原因。
在残差连接上,模型引入了 Gated Residual,把残差流从单一通路拓宽为四条并行分支,并施加动态的逐元素门控,来控制每条分支在每一层的贡献大小。该设计借鉴了 HyperConnection 的研究,但增加了逐分支的写入门和依赖内容的读取门,让网络对信息如何在层间传播拥有更细粒度的控制。对推理实现而言,这要求在每个块上多算 Mix 和 Combine 操作;SGLang 与英伟达合作做了内核级优化,在小批量解码场景下相对此前的 Triton 实现取得 2.05 倍加速。
512 专家的 MoE 子层,每个 token 激活 10 个路由专家外加 1 个共享专家 —— 在路由池上的激活比例约为 4.8%。每个专家是一个 640 维的前馈网络。架构上附带的多 token 预测(MTP)模块支持投机解码:草稿模型复用上一次接受步骤中 QSA 索引器的块选择结果,而不是为每个草稿 token 重新计算,从而在长上下文下大幅降低索引器开销。在 Blackwell B200、张量并行 4、使用 NVFP4 检查点的配置下,SGLang 在批量为 1 且启用 MTP 时测得每秒 540 token,平均接受长度为 3.3。
评测结果:Qwen 在哪里领先,哪里仍有疑问
阿里随发布公布的评测表显示 Qwen3.8-Flash-Next 在多数被测任务上领先,但在得出结论之前,这些结果的来源值得仔细看。
在 SWE-bench Pro 上 —— 这是一项检验在专业代码库中解决真实 GitHub issue 能力的测试 —— 该模型得 62.5,而 Claude Opus 4.6 公布的分数是 53.4。这个对比是表中最可信的一项:Claude 那个 53.4 是 Anthropic 自己公布的数字,而非阿里评测所得,且 SWE-bench Pro 是由 ScaleAI 运营的外部评测。不过阿里的脚注确实承认,它修正了该评测中「有问题的任务」,并在公布前用精修后的版本重新评测了所有基线模型 —— 这给「基线分数是否可与别处公布的分数直接比较」留下了一些不确定性。
在 DeepSWE 1.1 上,Qwen3.8-Flash-Next 得 58.7,DeepSeek-V4-Flash 为 54.4。在长周期办公与生产力智能体评测 CoWorkBench 上,得分为 73.9,而 DeepSeek-V4-Flash 为 45.1、Claude Opus 4.6 为 68.2。CoWorkBench 是阿里内部的评测,覆盖计算机科学、金融、法律和医疗生产力领域。由于它是专有的,这些分数无法被独立复现或审计。Qwen 与 DeepSeek 在 CoWorkBench 上的巨大差距(28.8 分)如果该评测校准良好,是有意义的,但以目前的公开可及程度,第三方无法验证。
GPQA Diamond(91.7)是表中独立可信度最高的分数:它是科学推理领域被广泛使用的学术评测,而这个分数与「一个真正具备前沿级推理能力的模型类别」是相符的。在 Humanity's Last Exam 上,该模型得 35.9,Claude Opus 4.6 为 40.0 —— 这是唯一由 Claude 领先的类别。HLE 的分数由 GPT-4o 评判,这引入了一层次级的模型评判依赖,但它对所有被测模型的影响是相同的。
在视觉—语言这一侧,AndroidWorld(84.5)、OSWorld 2.0 和 MathVision(带指令链 95.7)都取得了强劲结果,其中在移动设备智能体任务上相对 Claude Opus 4.6 的提升尤为显著。截至 8 月 27 日,尚无独立评测方公布该模型的结果;随着社区对这份开放权重进行评测,这幅图景会在接下来几周变得清晰。
延伸阅读:DeepSeek 给 V4-Flash 加上视觉,多模态智能体分数逼近 Opus 4.8
这些竞争数字对开发者的实际含义
对该模型近期普及最要紧的竞争比较,并不是 Qwen3.8-Flash-Next 对 Claude Opus 4.6 —— 那是价位相差很大的不同产品档位 —— 而是 Qwen3.8-Flash-Next 对 DeepSeek-V4-Flash,以及对阿里自家上一代的 Qwen3.7-Plus。
7 月 31 日发布的 DeepSeek-V4-Flash 是一个总参数 2840 亿的 MoE,每个 token 激活 130 亿参数,采用 MIT 许可证,定价为每百万输入 token 0.14 美元 —— 输入比 Qwen 便宜,但输出更贵(0.28 美元对 0.47 美元)。按阿里的评测,Qwen3.8-Flash-Next 在多数智能体和编程类别上领先,尽管其激活参数更少(60 亿对 130 亿)。关键的例外是仓库级代码生成评测 NL2Repo-Bench,DeepSeek-V4-Flash 得 54.2,Qwen 为 48.1。DeepSeek 的 V4-Flash 档位也只支持纯文本;Qwen 则能处理图像和视频。对于多模态智能体用例,在这个价位上没有可直接对比的 DeepSeek 模型。
与 Qwen3.7-Plus 的对比更为鲜明,而且在商业上可能最有分量。Qwen3.7-Plus 总参数 3970 亿,每 token 激活 170 亿 —— 接近 Qwen3.8-Flash-Next 激活参数量的三倍 —— 却在阿里表中每一项智能体编程和办公评测上都落后于这个更新的模型。「Flash-Next 以九分之一的训练算力成本,在这些任务上超过 Plus」这个说法如果经得起独立审视,就代表一次有意义的效率进步。九分之一这个数字是公司自报的,尚未经过独立验证。
至于两周前发布的、拥有 278 亿完全激活参数的稠密模型 Qwen3.8-27B,Flash-Next 在多数评测上表现相当或略优,尽管它只有 60 亿激活参数。这个对比 —— 一个 60 亿激活的 MoE 追平一个完全激活的 270 亿稠密模型 —— 最清楚地展示了 N-gram 嵌入层的贡献:实际上,是那 510 亿参数的额外查找容量,在补偿被削减的激活计算预算。
硬件要求与部署现实
FP8 检查点重 172.78 GB。阿里和 SGLang 验证了在 GB300 加速器上张量并行 2 的最低配置,推荐的完整托盘配置为张量并行 4。BF16 权重达到 335.28 GB;在 GB300 上经验证的 TP2 配置每 GPU 约占用 190 GB。这些数字把该模型牢牢放在数据中心的地界:以原生精度做消费级或工作站部署并不现实。不过,模型发布后 24 小时内 Hugging Face 上已出现 65 个以上的量化变体 —— 包括 Unsloth 的 GGUF 变体和 SGLang 量化的 NVFP4 检查点 —— 门槛会被逐步拉低。阿里明确支持的 llama.cpp 生态,让 GGUF 量化版能跑在装不下全精度模型的硬件上。
N-gram 嵌入的卸载,改变了那些实现了它的推理框架的有效显存算术。把 510 亿参数的查找表钉在 CPU 内存而不是 GPU 显存上,在 BF16 下每 GPU 可腾出约 23 至 24 GB,这直接转化为更多的 KV 缓存容量,也就是在同样的硬件预算下获得更长的有效上下文。这条卸载路径目前需要 NVIDIA CUDA;专门针对 N-gram 卸载的 AMD ROCm 支持尚未实现。
9 月 1 日向开发者开放的生产版 Qwen3.8-Flash API,将通过 YaRN 缩放默认提供一百万 token 上下文,并包含开放权重版本中没有的内置工具集成。对于打算用 API 而不是自托管的团队,上下文和工具方面的情况在那一天会有实质改善。
阿里的提前发布策略,以及它对 Qwen4 释放的信号
这套发布策略本身就带着可供分析的内容。阿里在完整的 Qwen4 家族尚不存在之时,就以一个开放权重、公开文档化的模型公布了 Qwen4 的架构 —— 具体说,就是 N-gram 嵌入、QSA 和 Gated Residual 的组合。它在 2025 年用 Qwen3-Next 做过同样的事,那次预览了 Gated DeltaNet 混合设计,而该设计后来出现在 Qwen3.5、Qwen3.6、Qwen3.7 和 Qwen3.8 中。上一次预览是准确的:那套架构传播到了此后发布的每一代。
由此可推断,Qwen3.8-Flash-Next 引入的四个组件 —— GDN+QSA 混合注意力、Gated Residual、N-gram 嵌入,以及基于 Muon 的训练配方 —— 将在 Qwen4 上以显著更大的规模出现。大多少仍未公布;Qwen4 也没有公开的发布时间表。但这些架构选择提供了一个具体信号,说明阿里认为下一个规模台阶上的效率提升会从哪里来:主要不是靠增加专家数量或注意力头数,而是靠 N-gram 嵌入层「在不成比例增加 GPU 算力的前提下增加参数容量」的能力,以及线性注意力「处理长上下文序列而不产生二次方成本增长」的能力。
对 AI 基础设施社区而言,Qwen3.8-Flash-Next 与其说是一件成品,不如说是一份开放权重的参考实现,实现的是一套将塑造一个大得多的模型的设计。SGLang 在发布当天就放出内核、英伟达做了 Blackwell 优化、发布一天之内就冒出 65 个量化变体 —— 这些都表明生态理解了这次预览的战略价值,并作出了相应回应。无论 Qwen4 是这个季度还是明年到来,它将使用的架构今天已经跑在开发者的硬件上了。
独立验证与生态反应
在正式的独立评测尚未跑出结果时,发布后头 24 小时里生态的反应可以作为开发者兴趣的一个非正式代理指标。在这个窗口内,第三方贡献者在 Hugging Face 上放出了约 65 个量化变体 —— 这个速度超过近几个月里大多数模型发布,既反映了该模型开放权重的可得性,也反映了社区意识到这套架构不是一次增量更新。
SGLang 的技术回应,尤其能说明该模型在基础设施层面的分量。这个由加州大学伯克利分校 LMSYS 实验室开发、并且是生产级 LLM 部署主要服务后端之一的推理框架,专门发了一篇博文,详述为在发布时支持 Qwen3.8-Flash-Next 而进行的四项具体内核级工程工作。其中包括为 QSA 索引器定制的 Triton 内核、与英伟达通过 FlashInfer 联合打造、在小批量下带来 2.05 倍加速的全新 HyperConnection Mix/Combine 内核、用于草稿步骤复用索引器的 IndexShare MTP,以及面向 N-gram 嵌入表的稀疏钉页主机卸载路径。这份工程投入的深度表明,SGLang 把这套架构视为下一代模型的生产推理目标,而不是一件新鲜玩意儿。英伟达和 AMD 都派了工程师参与发布当天的协作,这在每一次新模型发布中并非常规做法。
vLLM —— 另一个主要的生产服务引擎 —— 同时发布了该模型的经验证配方。Unsloth 当天放出了 GGUF 量化版。这个组合意味着,无论是用消费级硬件的开发者,还是跑 H200 集群的开发者,在权重公开后的数小时之内都拿到了生产质量的推理路径。
阿里没有放进表里的评测,以及仍然存在的缺口
读 Qwen3.8-Flash-Next 的评测表,需要既看它包含什么,也看它不包含什么。该表把模型与 Qwen3.8-27B、Qwen3.7-Plus、DeepSeek-V4-Flash-0731 和 Claude Opus 4.6 作比较。明显缺席的是与 Kimi K3 的任何比较 —— 那是月之暗面的 2.8 万亿参数模型,目前在 Arena.AI 的文本和编程排行榜上位居或接近榜首。同样缺席的是与 OpenAI 最新模型或谷歌 Gemini 前沿版本的任何比较。这些省略并不罕见 —— 评测表从来都是有选择的 —— 但它们意味着「击败更大的对手」这个说法,需要对「究竟在跟哪些对手比」作一些限定。
CoWorkBench 的结果 —— 也就是 Qwen 与竞争对手差距最大的那项评测(73.9 对 DeepSeek 的 45.1,相差 28.8 分)—— 同时也是最难独立验证的那一项。作为一项覆盖长周期办公任务的阿里内部评测,它没有可供外部研究者获取的方法论文档,没有独立跑出的基线分数,也没有可供开发者提交自己模型的第三方排行榜。一项声称衡量「跨计算机科学、金融、法律和医疗领域的长周期办公工作」的评测听起来很全面,但在无法独立取用的情况下,它起到的作用是一项公司自报的能力主张。
截至本文写作时,可得的最可信第三方数据来自 GPQA Diamond,这是一项由阿里之外的研究者开发的研究生水平科学推理评测。在 GPQA Diamond 上得 91.7,与前沿级推理模型是相符的。它并不专门验证智能体编程的表现,但它确立了一点:该模型底层的语言能力并不是靠针对评测的调优吹起来的。
来自 Artificial Analysis 等平台的完整独立评测 —— 这些平台会跑标准化的能力评估,并在质量分数之外一并公布延迟和吞吐测量 —— 截至 8 月 27 日尚未完成。Hugging Face 的开放 LLM 排行榜也还没有收录该模型。这些评估到来之时,会给出一幅更稳定的图景,说明该模型相对前沿究竟处在什么位置。
Qwen3.8-Flash-Next 在阿里更大商业栈中的位置
该模型在阿里当前的产品架构中占据一个明确的战略位置。高端是 Qwen3.8-Max —— 一个 2.4 万亿参数的稀疏 MoE,激活参数约 950 亿 —— 支撑着公司的旗舰 API,并为处于公测中的企业 AI 办公平台 QwenWork 提供动力。低端是 Qwen3 8B 一类的小型稠密模型,处理那些能装进单块消费级 GPU 的延迟敏感型应用。Qwen3.8-Flash-Next 占据的是中间地带:一个能做智能体编程和长周期办公任务、而价位又让个人开发者和小团队够得着的模型。
每百万 token 0.16/0.47 美元的定价,让 Flash-Next 的输入成本低于 OpenAI 的 GPT-4o-mini(通常引用的输入价是 0.15 美元),而输出成本略高一些。在企业市场上对比 Claude Sonnet 各版本,这个定价大体具有竞争力。对比 DeepSeek-V4-Flash 的 0.14/0.28 美元,Flash-Next 在输入上略贵、在输出上贵得多,但 DeepSeek 在那个档位不提供任何多模态能力 —— 要处理图像和视频就得整个换到另一个产品家族。
对于已经在用 QwenWork 的企业,Flash-Next 为该平台的「标准」模式提供动力,让智能体生产力功能落在 Flash-Next 的价位上,而不是 Max 档的 2.00/6.00 美元。这个定位让那些无法为日常生产力工作流承担 Qwen3.8-Max 价格的组织,也能在经济上用得起 QwenWork。它也给了阿里一个 Flash-Next 发布之前并不存在的中端市场抓手。
影响阿里云基础设施的《国家情报法》及相关中国数据治理义务,对考虑云 API 部署的企业团队仍然相关。而开放权重的可得性实质性地改变了这笔账:用 Hugging Face 上的权重自托管 Qwen3.8-Flash-Next,数据不会经过阿里的服务器,从而消除了 API 和 QwenWork 使用所带来的主动数据传输风险。对于那些会对阿里的模型发布管线形成长期依赖的组织,更广泛的义务考量仍是一个因素,但就自托管推理而言,实际风险状况远低于依赖云 API 的工作流。
Qwen4 将对竞争格局意味着什么
Qwen3.8-Flash-Next 真正的分量,也许不在它自己的评测数字上 —— 那些数字很强,但尚未经过独立验证 —— 而在这套架构对 Qwen4 可能具备什么能力所释放的信号上。
2025 年发布的上一次 Qwen3-Next 预览引入了 Gated DeltaNet 架构。那套设计随后未经重大改动就出现在 Qwen3.5、Qwen3.6、Qwen3.7 和 Qwen3.8 中 —— 大致是三代模型,它们合起来让阿里在智能体 AI 上的位置变得显著更有竞争力。如果 Qwen4 这一代沿用同样的模式,那么现在已经公开的架构组件有四个:一种为长上下文下块级检索优化的新稀疏注意力机制、一种带动态门控的多分支残差设计、一层可卸载到主机内存的 N-gram 参数扩展层,以及一套在 AdamW 之外使用 Muon、并取消批量大小预热阶段的训练配方。这四项原则上都可以扩展到大得多的模型上。
四者之中,N-gram 嵌入层在战略上的差异化程度最高。OpenAI、Anthropic、谷歌或 DeepSeek 公开披露的旗舰模型中,没有任何一个在接近这个量级上采用了可比的机制。如果在 Flash-Next 这一档展示出的容量收益,在 Qwen4 的参数规模上仍然存在甚至更好,阿里就将握有一项在「单位参数效率」上的结构性优势 —— 而这项优势并不单纯依赖芯片获取、数据中心规模或训练算力。这项优势能否兑现,取决于 Qwen4 训练运行中的工程执行,而那个时间表仍未公开。发布不到 24 小时就已经跑在数千台开发者机器上的 Qwen3.8-Flash-Next,将在 Qwen4 本身出货之前,帮助回答这个问题。