Mistral Large 4 开放预览,1.05 万亿参数
稀疏 MoE 每 token 激活 520 亿参数;开放权重和许可条款月底揭晓

Mistral AI 于 2026 年 10 月 6 日开放了 Mistral Large 4 的公开预览,通过其 La Plateforme API 提供一个 1.05 万亿参数的混合专家模型 —— 并承诺在月底前发布完整的模型权重。如果这次发布如期到来,它将成为迄今公开发布的最大的开放权重语言模型,总参数量超过 Meta 的 Llama 3.1 405B 两倍以上。
这个模型内部昵称为「Le Chonk」,在 Mistral 自有的欧洲数据中心用 3,800 块 NVIDIA Grace Blackwell GPU 训练 —— 这笔可观的基础设施投入,既反映了该公司 2026 年 9 月 D 轮融资的 30 亿欧元(由三星领投),也反映了它一贯的主张:AI 能力可以在欧洲本土建成,无需把数据经由美国控制的云基础设施。
一种以小算力打大仗的稀疏架构
Large 4 的决定性工程选择是稀疏激活。尽管总参数量达 1.05 万亿,模型让每个 token 只经过其中约 520 亿个 —— 约占整个网络的 5% —— 而不是在每次前向传播中激活所有权重。这是混合专家设计的核心取舍:总参数量(以及模型所需的内存)巨大,但每 token 的推理计算量相当于一个规模约为其二十分之一的稠密模型。
这个区别对定价和可扩展性很重要。在当前的预览期内,Mistral 按每百万输入 token 0.68 美元、每百万输出 token 2.09 美元收费 —— 一旦理解了推理承担的不是 1 万亿活跃权重的成本,而是约 520 亿,这个价格在经济上就更站得住。预览期之后的标准定价分别列为每百万 token 1.36 美元和 4.18 美元。
该模型还处理 100 万 token 的上下文窗口,并带有一个独立的 16 亿参数视觉编码器用于多模态输入。Mistral 把 Large 4 的视觉组件训练为附着在 LLM 主干上的独立模块,而不是把多模态路由紧密整合进核心的 MoE 结构。
用 Mistral Forge 做工业规模的强化学习
后训练强化学习如今是从预训练模型中榨取能力的主要杠杆,而 Large 4 代表了 Mistral 迄今最雄心勃勃的一次应用。该公司构建并使用了一套名为 Mistral Forge 的内部 RL 基础设施,它运行一个可组合的训练环境:不是为不同的行为领域依次施加微调阶段,而是把对话质量、科学推理、安全性和长程工具使用的奖励信号合并在一次训练中。
这个环境的规模值得注意 —— 每天 330 亿 token 的 RL 吞吐量,其中约 160 亿是可训练的补全 token。作为参考,大多数已发表的学术 RL 微调设置只有这个吞吐量的一小部分;Mistral 实际上是在自己的欧洲算力栈上运行工业规模的偏好优化。
把欧洲基础设施当作产品特性
Mistral 的基础设施故事与其市场定位密不可分。CEO Arthur Mensch 曾就 AI 主权在法国议会作证,并一贯主张欧洲企业不应被迫在受《云法案》(CLOUD Act)约束的美国超大规模云厂商基础设施上处理敏感数据。
Large 4 在 Mistral 自有的欧洲设施上训练和提供服务。对受 GDPR 或特定行业数据驻留要求约束的企业 —— 医疗、金融、法律、政府 —— 来说,实际含义是他们可以使用一个前沿级别的模型,而不必把数据经由 AWS、Azure 或 Google Cloud。这个区别不只是修辞:它影响欧盟受监管行业的企业采购决策。
30 亿欧元的 D 轮(由三星领投,对 Mistral 的估值超过 210 亿欧元)为这类基础设施投资提供了资本基础。三星的参与引出了 Mistral 尚未详细公开回应的数据治理问题,不过据报道,交易结构保留了公司的运营独立性。
Large 4 领先在哪 —— 以及基准数字究竟意味着什么
Mistral 声称 Large 4 在一系列评测中领先:DeepSWE v1.1 智能体编程基准、Artificial Analysis 的智能指数、Harvey 法律智能体基准、KORA、SciCode-Verified 和 Dense 200。Artificial Analysis 智能指数的结果分量较重,因为 Artificial Analysis 是独立的第三方评测机构,而不是 Mistral 自己。
Harvey 法律智能体基准的结果值得注意,但需要背景:Harvey 是一家使用 Mistral 模型的法律 AI 公司,是合作伙伴而不是无利害关系的一方。它的基准结果在 Harvey 衡量的是自己领域专长这个意义上是可信的,但读者在评估这一主张时应了解这层关系。
延伸阅读:StepFun 的 Step 5 Preview:6000 亿参数 MoE,承诺 10 月 15 日开放权重
Mistral 听起来最惊人的主张涉及网络安全:CyberGym-E2E(82%)、Cybench 和 B3 AI 安全基准,据称 Large 4 在这些基准上以极大的优势胜过 Claude Opus 5.5 和 GPT-6 Astra —— 有些情况下领先超过 80 个百分点。这些差距的解释,主要不是竞争模型缺乏完成网络安全任务的技术能力。Claude Opus 5.5 和 GPT-6 Astra 按安全政策被设计为拒绝进攻性安全请求,通过有意弃权产生接近零的完成率。DeepSeek V4 Pro 0813 是一个安全过滤不那么激进的中国开放权重模型,在同样的基准上得分远高于美国的闭源模型 —— 这与「政策性拒绝」的解释一致。
这是一种真实的产品差异化,而不是捏造的:Mistral 明确把 Large 4 推向需要一个会完成进攻性任务的模型的安全研究者和红队。但如果没有这层背景,把网络安全基准结果说成是对 Anthropic 和 OpenAI 的纯粹能力领先,是有误导性的。
部署限制,以及尚不清楚的事
总参数量 1.05 万亿,在 Mistral 的 API 之外部署 Large 4 需要大量硬件。全精度(BF16)部署需要大约 2 TB 的 GPU 内存,也就是几十块高端加速器。实际的开放权重部署几乎完全取决于量化版本,而 Mistral 尚未发布。这样的算力和内存要求意味着,Large 4 的「开放权重」与 7B 或 70B 模型的开放权重含义不同 —— 它在资源充足的机构和大学的能力范围之内,而不是用消费级硬件的个人开发者。
开放权重版本的许可证也还不清楚。Mistral 此前的 Large 3 以 Apache 2.0 发布,这是最宽松的主流开源许可证;Large 4 的条款尚未公布。商业使用条件、微调限制和部署要求,都取决于 Mistral 随权重一起宣布的内容。
对 100 万 token 上下文窗口在极限处质量的独立验证尚未发表。长上下文退化 —— 随着窗口填满,模型对早期上下文信息失去连贯的回忆 —— 是前沿模型中有记录的失败模式,即便它们名义上支持百万 token 上下文。考虑到模型的规模,Mistral 关于上下文质量的说法是可信的,但尚未得到外部评测者的确认。
开放权重发布会改变什么
即将到来的开放权重发布,对 AI 研究界和企业 AI 买家来说是更大的事件。一个可以自由部署、具备前沿能力的 1 万亿参数 MoE —— 假定 Mistral 的基准主张经得起独立审视 —— 会从根本上改变开放与封闭模型的权衡。那些一直被迫在能力(美国闭源模型)和控制权(较小的开放权重模型)之间二选一的机构,将获得第三个选项:在自己的基础设施上获得前沿能力,受制于 Mistral 公布的任何许可条款。
对于美中 AI 竞争的态势,一个开放权重的欧洲前沿模型改变了格局。一直在推动自有 AI 能力的欧洲技术政策,将获得一个具体的概念验证。问题在于 10 月底的发布是否准时到来,许可证是否真正开放,以及量化版本能否让没有数据中心级 GPU 预算的机构也能自托管。这些答案到来的窗口现在是几周,而不是几个月。