Z.ai 确认 Ox Alpha 就是 GLM-5.3-Flash:一个跑在国产芯片上的 3200 亿 MoE
在以 MIT 许可证揭晓之前,Z.ai 这个隐身模型已在国产硬件上服务了 62 万亿 token
在一个无名编程模型登顶 OpenRouter 全球榜单、把取证团队卷入一场分词器调查之后六天,Z.ai 于周三晚间正式确认,「Ox Alpha」就是 GLM-5.3-Flash —— 一个 3200 亿参数的专家混合模型,公司称其整个匿名预览期都跑在中国 AI 芯片上,全程没有一块英伟达 GPU 参与。权重现已以 MIT 许可证放在 Hugging Face 上,定价为每百万输入 token 0.15 美元;而 Z.ai 的股价周四在香港收涨超过 12%。
在 Z.ai 开口之前,身份问题其实基本已经水落石出。到 8 月 22 日,一位社区研究者通过提交一个构造错误的请求,从服务器拿到了一段 Java 堆栈跟踪;其中的内部类路径直接对应 Z.ai 的 API 基础设施,让这项归属在代码层面几乎确定无疑。彭博在 8 月 26 日上午向智谱求证,并在官方权重发布之前得到了确认。周三的公告新增的内容是架构细节、定价,以及首次明确确认这次免费预览曾充当中国国产芯片生态的一次生产级压力测试 —— 这是单靠评测数据无法确立的一个维度。
延伸阅读:在 Z.ai 确认之前,社区取证已把 Ox Alpha 追溯到智谱
看看 Z.ai 究竟造了什么:一套新架构,而不是一次微调
GLM-5.3-Flash 不是现有 GLM-5.3 或 GLM-5.2 的量化版或蒸馏版。Z.ai 把它描述为一个在 30 万亿 token 多模态语料 —— 文本、图像和视频 —— 上从新基座训练出来的模型,其架构围绕一个长期约束 GLM 家族的问题作了重新设计:以生产级吞吐提供一百万 token 上下文窗口的成本。
架构上影响最深的改动,是一套混合注意力设计 —— 这是 GLM 系列中第一次在同一个模型里结合两种根本不同的注意力机制。标准 Transformer 自注意力随序列长度呈二次方增长:上下文从 50 万 token 翻到 100 万,注意力算力大约要翻四倍。GLM-5.3-Flash 的应对办法,是让 45 层中的 34 层使用一种叫 KDA(基于核的稠密注意力)的线性注意力机制,以 O(n) 的算力近似 softmax 注意力。其余 11 层使用 NoPE 稀疏 MLA —— 一种计算上更精确的稀疏机制,不带旋转位置编码地检索全局相关的上下文。便宜的层负责局部依赖;昂贵的层负责长程检索。按 Z.ai 自己与 GLM-5.3 的对比,结果是注意力算力约减少到三分之一、KV 缓存缩小 4.4 倍 —— 这些数字尚未经过独立审计,但具体到足以被检验。这些架构细节得到了 vLLM 服务配方的独立确认,该配方独立记录了 45 层结构、KDA/MLA 的划分和专家配置。
每个 token 被路由过 288 个专家前馈子网络中的 8 个,另有 3 个稠密的前置层。总参数量 3200 亿;每次推理步骤激活的参数为 180 亿 —— 显著少于 GLM-5.2 的设计(后者约有 320 亿激活参数)。这一削减,加上 45 层的深度对比 GLM-5.2 的 92 层,正是 Z.ai 能把输入 token 的标价做到前代大约十分之一的原因。
一个叫 IndexPool 的机制,通过加权池化压缩稀疏注意力层所用的索引器键向量 —— 大约 4 比 1 的压缩 —— 这是长上下文下 KV 缓存缩减的主要驱动力。Z.ai 承认还有一处弱点:GLM-5.3-Flash 的 KV 缓存仍然略大于 Kimi K3 和 DeepSeek V4 Flash 中的等效设计,公司在模型卡中明确写了这一点,这是一种不常见且有用的透明。该架构还采用了流形约束超连接(mHC),一种残差信息混合方法,Z.ai 认为正是它在更浅、更精简的层数下维持住了模型质量。
该模型是第一个原生多模态而非纯文本的 GLM-5:图像和视频输入经由同一套模型栈处理,而不是外挂一个视觉适配器;而且 Z.ai 训练它在编程和智能体工作流中检视渲染后的界面与视觉输出 —— 这对那些需要判断屏幕上实际有什么的浏览器智能体很有用。
国产芯片这条线,就是基础设施这条线
Z.ai 声称隐身那一周「完全跑在中国 AI 芯片上」、动用约 10 万块加速器 —— 这是该公告中在开发者社区之外引起最多关注的部分。
芯片供应商在 Z.ai 的公开材料中没有点名。基于 Z.ai 的训练历史 —— GLM-5 是在 10 万块华为昇腾 910B 处理器上训练的 —— 可能的候选是华为昇腾家族,但就该公司关于这次具体部署的披露而言,这一点无法被当作已确认。公司确实描述了服务架构:一个基于 SGLang 定制的引擎,采用 EPD(编码—预填充—解码)解耦,把多模态编码、提示词预填充和逐 token 解码拆成独立调度的工作池。Z.ai 声称这在集群规模上带来了 3 倍的端到端服务性能提升 —— 同样是公司自报、未经独立审计。这套服务方案的技术细节比那块没有点名的硅片更有意思:这套架构是专门围绕国产加速器的显存容量和显存带宽约束设计的,而不是与之对抗。
可以独立验证的,是这套基础设施的产出。仅在 OpenRouter 上,该模型在六天隐身运行中就处理了 23.2 万亿 token —— 约为同期该平台上第二名模型的 2.3 倍。半导体研究机构 SemiAnalysis 把「Z.ai 在中国芯片上大规模提供了这次预览」这项披露,标记为该公告中最重要的一环。另外,Artificial Analysis 在 Z.ai 的 API 上测得每秒 48.7 个输出 token、首 token 时间 1.52 秒 —— 这是独立的性能数据,确认了无论 Z.ai 跑在什么硬件上,该模型都在以可用的吞吐提供服务。
地缘政治维度很具体:Z.ai 及其子公司自 2025 年 1 月起就在美国商务部工业与安全局的实体清单上,被列入的理由是该公司通过 AI 推进中国的军事现代化。一家被列入实体清单的公司,证明自己能承接比 OpenRouter 此前任何一次发布都更多的全球推理流量 —— 而且是在不使用美国出口管制所要限制的英伟达硬件的情况下做到的 —— 这是出口管制政策分析者会记下的一个数据点。「中国芯片能否以有竞争力的吞吐在全球规模上服务前沿模型」这个问题,刚刚得到了一个有分量的经验性答案,即便硬件供应商仍未点名。
评测:哪些经过独立确立,哪些没有
Z.ai 报告了一组智能体与编程评测的分数,显示 GLM-5.3-Flash 在若干指标上接近 Claude Opus 4.8,在另一些指标上大幅领先 GLM-5.2。终端智能体任务评测 Terminal-Bench 2.1 给 GLM-5.3-Flash 的分数是 84.3,Opus 4.8 为 85.0 —— 相差 0.7 分 —— 不过 GPT-5.6 Terra 在同一评测上得 87.4。在软件工程评测 DeepSWE v1.1 上,Z.ai 报告 63.4,高于 GLM-5.2 的 46.2。工作流自动化测试 AutomationBench 显示 48.8,而 GLM-5.2 为 26.2。这些全都是 Z.ai 自报的数字,跑在公司自选的评测框架和设置上,细节见模型卡脚注。
独立的锚点来自 Artificial Analysis,它把该模型以 57 分排在其智能指数第 10 位 —— 按该机构的独立测量,领先于 DeepSeek V4 Pro Max。这个独立分数,连同那些独立测得的吞吐数字,为生产规划提供的基准,比在专有评测条件下编制的评测表更可靠。
视觉仍是明显的弱项。GLM-5.3-Flash 在 BabyVision 和 MVbench 上落后于 Gemini 3.7 Flash —— 这一点在 Z.ai 自己的文档中已获承认。对于那些依赖精确图像理解、而非从截图中检视代码的应用来说,这个差距是要紧的。
部署图景:API 还是自托管
对评估 GLM-5.3-Flash 的团队来说,实际的分野很清楚。该模型的 FP8 检查点在运行时和 KV 缓存开销之前约重 306 GB。目前的 vLLM 路径需要英伟达 Hopper 世代或更新的 GPU —— 考虑到 Z.ai 关于国产芯片服务的说法,这有点讽刺,但对多数工程团队所使用的开源推理框架而言,这是现实。以 4 GPU 张量并行做自托管,最低需要一个 GB200 托盘,或者一个 8 GPU 的 Hopper 节点、并把预填充池与解码池拆在同一台机器上。对于没有这类硬件的组织,这个模型就是一款 API 产品。
标准 API 定价为每百万输入 token 0.15 美元、每百万输出 token 0.50 美元,并有一个持续到 9 月 9 日的五折发布优惠,把费率降到 0.075 和 0.25 美元。缓存输入为每百万 0.03 美元。GLM 编程套餐的各档订阅 —— Lite 每月 18 美元、Pro 80 美元、Max 168 美元 —— 各自获得 GLM-5.3 时期三倍的可用 token 配额,而多模态能力则通过 Browser Use 和 Computer Use 功能出现在 ZCode 内部。KTransformers 为拥有消费级硬件的组织提供了一条替代性的本地服务路径,代价是吞吐。完整的定价细节与编程套餐信息见 Z.ai 公布的材料。
面对 DeepSeek 和 Kimi 的开放权重卡位
如今有三个开放权重模型占据着 flash 档的多模态编程空间,而它们的架构哲学差别不小。DeepSeek V4 Flash 使用自家的压缩稀疏注意力与重度压缩注意力组合,从 1.6 万亿参数的基座中激活 490 亿参数 —— 是一个总参数大得多、每 token 激活算力也更多的模型。来自月之暗面的 Kimi K3 则是三者中参数密度最高的,总参数 2.8 万亿、896 个专家,因而服务成本也最高。GLM-5.3-Flash 占据的是另一种效率画像:三者中最小的激活参数足迹(180 亿)、最浅的层数,以及那套混合线性/稀疏注意力设计 —— Z.ai 声称这让它在这一组中拥有最低的每 token 注意力算力 —— 代价是 KV 缓存比另外两者略大。
按 Z.ai 自己的 DeepSWE 数字,GLM-5.3-Flash 得 63.4,DeepSeek V4 Flash-Vision-Exp 为 59.3。在把自然语言描述翻译成仓库规模代码的评测 NL2Repo 上,Claude Opus 4.8 得 69.7,而 GLM-5.3-Flash 为 56.3 —— 在仓库规模上,这仍是一道不小的差距。它的竞争主张并不是「GLM-5.3-Flash 打败一切」,而是:它在一个带原生多模态、采用 MIT 许可证的 3200 亿参数封装里,以开放权重模型此前未曾达到的价位,交付了接近前沿的智能体表现。这个主张能否在规模化的独立评测下站住,是接下来的问题。
延伸阅读:DeepSeek 给 V4 Flash 加上视觉,进入多模态智能体赛道
把隐身发布当成产品策略
更大的模式才是要紧的。OpenRouter 的隐身机制在 2026 年已被中国实验室用过四次,每一次使用都在精炼这个形式能带来什么:一周的生产流量、真实的开发者反馈,以及在具名发布把机构声誉押上之前先积累起的采用基础。GLM-5.3-Flash 把那一周用得比此前任何隐身模型都更有效 —— 处理了更多流量、吸引了更多用户,也催生出一场更有条理的、关于其身份的社区调查。Z.ai 揭晓的时点 —— 就在彭博通过传统报道确认身份的同一个晚上放出权重 —— 说明该公司当时在盯着,并在新闻确认到来时相应地加快了官方公告。
实际效果是:一款具名产品,带着公开文档化的架构、已定价的 API 接入、可下载的权重,以及一批已经对该模型在自己真实工作负载上的表现形成看法的既有开发者受众。免费期结束了。现在的问题是,吞吐、价位和 MIT 许可证是否足以把那 30 多万名用过 Ox Alpha 的开发者,转化为付费的 Z.ai API 客户 —— 又或者他们会直接奔向权重,去搭建 Z.ai 无法直接变现的自托管流水线。真正的商业检验是这个转化率,而不是那张评测表 —— 它决定了一周隐身是否值 62 万亿 token 的免费推理。