Gemini 4 Argon 发布,输出上限一百万 token
18 项基准领先 12 项,还挖出医院软件漏洞,但仅限量开放

Google DeepMind 周二发布了 Gemini 4 Argon,这是自 Gemini 3 以来的第一代新旗舰模型,带来了 100 万 token 的输出上限、一条自主的三阶段漏洞修补流水线,以及面向网络安全机构的限量开放 —— 同时没有宣布任何面向公众的全面发布日期。发布当天,彭博社报道称,一些谷歌员工质疑 Argon 的编程基准分数是否反映了真实世界里的日常表现,这种张力,定义了 2026 年最具分量的 AI 发布之一的这个时刻。
输出 token 跃升 15.6 倍,改变了智能体一次调用能生成什么
周二这次发布里,架构上最有意义的数字是输出 token 上限:100 万 token,而前代 Gemini 模型是 6.4 万 —— 提升了 15.6 倍,跨过了一道让一类新的智能体工作流变得可行的门槛。
在 6.4 万 token 的上限下,改写大型代码库、生成详尽的安全报告,或产出完整的 Rust 迁移差异,都需要把任务拆成块、再把输出跨多次模型调用缝合起来,每一处接缝都可能引入不一致。在 100 万输出 token 下,其中许多工作流可以在一次推理里跑完。谷歌已经在实践中演示了这一点:Argon 智能体通过多轮基于性能剖析的实验,把 libgav1 开源视频解码器 —— 3.2 万行 C++ SIMD 代码 —— 改写成了 Rust,性能比此前的 Rust 移植版提升 2.7 倍,同时输出的视频完全一致。在 Fuchsia 操作系统的 Zircon 内核上,谷歌展示了 Argon 智能体处理 80 万行以上 C++ 代码的迁移。
这些是公司自称的数字,且来自公司自己的项目,但原则上可以通过谷歌的开源仓库来验证,这让它们有别于纯内部的基准表格。支撑 100 万输出 token 的架构没有公开文档,Argon 也没有发布技术论文。谷歌表示,当模型有余地在一条轨迹里生成数十万 token 时,它会为推理增添一个新的深度层级,从而在一次连续的推演中解决难题。
自主漏洞修补:三个阶段,已经找到一个真实的医院软件缺陷
第二项主要能力在结构上更为新颖:Argon 可以自主发现、验证并修补软件漏洞,而无需人类指定要找什么。这条流水线分三个阶段运作 —— 生成候选漏洞假设,构造一个利用代码来验证漏洞是否真实可利用,然后提出修复补丁。在衡量模型修复安全漏洞能力的 CWE-bench v1 上,Argon 以 68% 的得分并列第一。
在公开发布之前,谷歌通过 Wiz Scan for Good 合作伙伴计划部署了这项能力。Wiz 用发布前的 Argon 扫描医院软件,发现了一个严重漏洞,它会让全球医院所用的医疗软件里的敏感个人信息暴露 —— 这是早先的前沿模型漏掉的发现,并且在公开宣布之前已做了负责任的披露。这是该流水线在真实生产软件上运作、并产生真实安全结果的一个有记录的案例。
这项能力正通过 Fairwind 计划分发,这是一个限量开放的项目,让 650 家以上受信任的网络安全机构提前使用。这个命名本身就带着信号:顺风,受控的航行。一个能快速生成可用利用代码和补丁的模型,是一种两用能力,谷歌的限量开放,等于隐含地承认:没有信任控制的广泛开放,会给这些机构本该守护的软件基础设施带来真实的风险。受信任的 Fairwind 合作伙伴和谷歌内部团队拿到的 Argon 不带网络安全护栏,以便他们能用上其完整的前沿级能力。
基准领先、被承认的差距,以及内部的怀疑
谷歌的发布材料称,对比 GPT-6 Astra 和 Claude Fable 5.1,Argon 在 18 项公开基准中领先 12 项。领先的维度包括:DeepSWE v1.1 的 77.9%(真实世界的长周期软件工程)、Vals Index(知识工作,按 GDP 加权)、Zapier 的 AutomationBench 51.3%(业务任务执行)、LVBench 91.7%(长视频理解),以及 Gray Swan IPI(对间接提示词注入的稳健性)。
全部 18 项结果都是公司自报,发布时也没有宣布对整套结果的任何独立复现。竞争性的 AI 发布里的基准对比需要解读:即便基准名称相同,方法学、提示策略和硬件配置在不同机构之间也可能有实质差异。18 项里领先 12 项这个说法,是一个有待随时间用独立测试去评估的主张。
有两项基准需要特别注意,那里是竞争对手领先。在 FrontierSWE v2 —— 两套智能体软件工程测试里较难的那套 —— 上,GPT-6 Astra 以 65.5% 领先,Argon 为 55.0%,差了十个百分点。在衡量自主完成命令行任务的 Terminal-Bench 4.0 上,Claude Opus 5.5 以 66.4% 领先,Argon 为 57.4%。FrontierSWE v2 衡量的是长周期的智能体软件工程 —— 与在真实项目上部署编程智能体的团队最相关的那种持续开发工作。对任何工程师在命令行上运行 AI 智能体的机构来说,终端任务上的这道差距同样要紧。
彭博社在发布当天报道称,据能直接接触该模型的人士,一些在内部使用过 Argon 的谷歌员工说,它在前端任务和日常开发上的编程表现,与结构化基准的结果并不相符。这些信源是匿名的。谷歌直接予以反驳,告诉彭博社把这个模型描述为编程表现不佳是不准确的,一位员工也对彭博社说,内部对 Gemini 4 处于前沿存在「很大的共识」。彭博社描述的这种模式 —— 基准表现强劲、真实世界泛化参差 —— 是前沿 AI 编程模型上反复出现的发现,在有独立的 API 访问之前无法得到证实。
延伸阅读:Claude Sonnet 5.5 以更低的价格登顶智能体编程测试,而 Opus 5.5 领跑 Terminal-Bench 4.0
Argon 在竞争格局中的位置
Gemini 4 Argon 进入的市场里,谷歌、OpenAI 和 Anthropic 在过去一年里都已发布了前沿级模型。在 Argon 领先的维度上 —— 网络安全基准、知识工作表现、业务自动化、长视频理解 —— 优势是实质性的,而不是边际的。在 FrontierSWE v2 和 Terminal-Bench 4.0 上,GPT-6 Astra 和 Claude Opus 5.5 分别握有稳固的领先,这对那些主要用例是持续的、智能体驱动的软件开发的团队很重要。
100 万输出 token 的上限,是目前竞争集合里已宣布的最大输出限制。对任何从事大规模代码迁移、长文档生成或单次通过的智能体任务的机构来说,光是 Argon 的输出上限,就改变了该选哪个模型的成本收益计算。发布时的 API 定价在推广期内是每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入 token 享 95% 折扣 —— 这套结构是为那些同一份长上下文在各生成步骤间反复使用的智能体工作流设计的。推广期之后,价格翻倍,分别为每百万 token 4 美元和 20 美元。
Rust 迁移能力,及其对基础设施的后果
C 和 C++ 撑起了大部分基础软件设施 —— 操作系统内核、设备驱动、嵌入式系统、网络协议栈 —— 而这些代码库里的内存不安全,占了生产软件中被利用漏洞的大多数。美国国家安全局和 CISA 在一份联合指南里正式建议把关键基础设施迁移到内存安全语言,以 Rust 为主要目标。大规模的人工迁移贵得令人却步;一个 80 万行的代码库,需要人类工程师花上数年时间。
Argon 已展示的处理这种规模迁移的能力 —— libgav1 的结果显示的不只是功能等价,还有 2.7 倍的性能提升 —— 描绘了一条为一项被业界基本当作愿景的基础设施现代化工程提速的现实路径。谷歌指出,鉴于所涉系统的关键性,即便是它自己的大规模 C++ 到 Rust 迁移,在推向生产之前也要经过严格的自动与人工审计、仿真测试和审查。仍需外部团队验证的是:迁移质量能否在那些文档质量、遗留依赖和构建复杂度各不相同的第三方代码库上保持。
接下来是什么:独立验证,以及全面发布的日期
谷歌表示,它正在积极参与美国政府自愿性的发布前模型访问流程。Fairwind 的限量开放,加上没有公开可用日期,合起来描绘的是一种由 Argon 所能做的事的两用性质所塑造的发布策略。谷歌并不是在把它当作一次带有全面可用日期的常规产品发布;更广泛的开放将从付费 API 客户和 Google AI Ultra 订阅用户开始,没有宣布时间表。
接下来有意义的里程碑是:独立的基准复现 —— 外部 AI 研究者和企业能否得出与谷歌 18 项领先 12 项的说法一致的结果,尤其是在 GPT-6 Astra 已经领先十个百分点的 FrontierSWE v2 上 —— 以及对 Fairwind 漏洞流水线在真实基础设施上的第一次大规模第三方评估。OpenAI 或 Anthropic 是否会在 Argon 全面可用之前回应 100 万输出 token 这个上限,可能决定了这个上限会成为一道持久的竞争优势,还是一项业界几个月内就会跟上的特性。