Gemini 3.8 Flash 以旗舰零头的价格拿到接近前沿的编程分数
没有新的预训练:仅靠后训练就把与 Anthropic 旗舰的编程差距拉近了

Google DeepMind 发布了 Gemini 3.8 Flash(2026 年 9 月 2 日),这是它六周内的第三个 Flash 档模型,也把前沿 AI 市场上一场相当低调却激进的实验往前推了一步:在同一批冻结的基座权重上,靠一轮又一轮后训练榨出显著更好的性能。结果是 3.8 Flash 在长程编程基准上与 Claude Opus 5 只差不到一个百分点 —— 而它的 token 成本大约是 Anthropic 旗舰的六到七分之一。
该模型即刻可通过 Gemini API、Google AI Studio、Google Antigravity、Android Studio 和 Gemini Enterprise 使用。Google AI Pro 与 Ultra 订阅者可在 Gemini 应用、Google 搜索的 AI 模式,以及 Google Sheets 里的 Gemini 中使用它。与常规版一同发布的还有 Gemini 3.8 Flash Cyber,一个面向网络安全的变体,仅通过一个名为Fairwind的新计划,向经审核的政府机构、关键基础设施运营方和软件维护者开放。
Google 的 Flash 节奏已经成了它真正的产品战略
Gemini 3.7 Flash(2026 年 8 月 13 日)与 3.8 Flash 之间隔的三周,不是排期上的偶然。Gemini 3.6 Flash 于 7 月 21 日发布;3.7 恰好三周后到来;3.8 又在三周后跟上。这个看似异常快的发布节奏,更该被理解为一套持续循环运行的系统性后训练优化程序 —— 而底下那个基座模型自 2025 年初起就没有变过。
这是埋在模型卡里、结构上最重要的细节:Gemini 3.8 Flash 建在 Gemini 3.7 Flash 之上,后者建在 3.6 Flash 之上,再往下是最初那次 Gemini 3 Flash 的预训练。这三代的知识截止对多数领域都是 2025 年 1 月,少数领域到 2026 年 3 月。Google 的工程团队并没有为每个 Flash 版本做新的大规模预训练。他们做的是在后训练上快速迭代 —— 监督微调、来自 AI 反馈的强化学习,以及越来越多地,用运行中的 AI 系统去生成下一代模型训练信号的智能体式评测循环。
官方博文把 3.8 Flash 和 3.8 Flash Cyber 都描述为「由长时间运行的智能体循环进一步加速,这些循环被设计来递归地评估和精炼底层模型」。这句话值得比发布报道通常给它的更多注意。它意味着 Google 正在用智能体式 AI 系统去生成改进下一版模型的信号 —— 把此前需要人类标注员、评测员和偏好排序员完成的相当一部分工作自动化了。
对开发者和企业买家来说,这套架构带来的实际后果有点反直觉:Flash 档不是一个预算级的妥协模型。它是一个在有能力的基座上被快速优化过的版本,已经承受了数月聚焦的后训练;而在特定任务领域 —— 尤其是编程 —— 它的结果如今正在逼近那些每 token 贵五到七倍的模型。
Gemini 3.8 Flash 是怎么把「思考」加重的
3.8 Flash 性能提升背后的技术机制,在设计上就是可配置的。和它之前的 3.7 Flash 一样,新模型支持三档思考级别 —— LOW、MEDIUM 和 HIGH —— 用来控制模型在生成回答之前为内部推理分配多少 token。在 MEDIUM(默认)档,3.8 Flash 在管住 token 成本的同时比 3.7 Flash 更准。在 HIGH 档,它会执行额外的推理步骤并迭代地调用工具,代价是 token 消耗大幅上升。
关键在于,此前某些 Flash 配置中可用的 MINIMAL 思考级别,3.8 Flash 不支持。把 3.7 Flash 配成 MINIMAL 的开发者需要迁到 LOW,或者继续使用 3.7 Flash —— 后者对效率优先的负载仍完整支持。Google 的官方博文说得很明确:「对于算力效率是首要约束的应用,开发者可以使用更低的强度档来最小化 token 开销,或继续依赖 Gemini 3.7 Flash。」
这一点要紧,是因为那些头条基准分数通常是在 HIGH 思考档下取得的。在复杂编程任务上以 HIGH 思考运行时,3.8 Flash 用掉的 token 约为 3.7 Flash 跑同一评测的两倍 —— 这一点 Google 在博文中承认,开发者在自己的测试中也独立观察到了。性能提升是真实的,但它附带一项推理成本上的取舍,开发者在把生产负载押到 HIGH 思考档之前必须把它算进去。
这份首发定价 —— 每百万输入 token 0.75 美元、每百万输出 token 3.75 美元 —— 持续到 2026 年 12 月 31 日,之后回到输入 1.50 美元、输出 7.50 美元,翻一倍。这给工程团队大约四个月时间,去验证 3.8 Flash 的性能画像是否值得在经济性改变之前从 3.7 Flash 全面迁移过来。
基准分析:那些数字究竟说了什么
Google 的发布基准需要仔细读,因为 3.8 Flash 用了几套不同的评测框架和取数方式,而这个模型还没有出现在所有公开的第三方排行榜上。
在 DeepSWE v1.1 上 —— 这是由 Datacurve 维护的长程软件工程基准 —— Google 报告了一个自测分数 73.7%,用的是 mini-swe-agent 框架、高思考档。Datacurve 的这个基准在 91 个活跃开源仓库、五种编程语言上抽出的 113 道原创任务上评测 AI 编程智能体,使用隔离的任务环境和基于程序的验证器 —— 没有「LLM 当裁判」的环节,这让它比很多编程基准更可信。公开的第三方排行榜上,Claude Opus 5 是 73.6%,GPT-5.6 Sol 是 72.7%;而 Gemini 3.8 Flash 的 73.7% 是 Google 用同一套 mini-swe-agent 框架自己算出来的数字,尚未提交给 Datacurve 的第三方评测流水线,也未经其独立确认。在第三方确认到来之前,3.8 Flash 与 Opus 5 在 DeepSWE 上那个个位数的差距,应当被当作统计噪声范围内来看待。
在衡量较短程编程任务的 Terminal-Bench 2.1 上,3.8 Flash 得 90.8% —— 相对 3.7 Flash 的 81.6% 提升了九分多,是三周内的真实增益。而在衡量同一类任务、但时长与复杂度都显著更高的 Terminal-Bench 4.0 上,图景截然不同:3.8 Flash 得 19.1%,Claude Opus 5 是 51.8% —— 超过 32 分的差距,反映出 Flash 档在持续的、多步的自主工作上存在真实的架构局限。这些数字取自Google 公布的评测方法文档。
在 HLE-Verified 上 —— 一个含 1811 道题、测试跨 STEM、人文与专业领域多步推理的基准 —— 3.8 Flash 得 54.9%。对一个 Flash 档模型来说这是强表现。而在 GDPVal-AA v2 知识工作综合评测上 —— 这是由 Artificial Analysis 维护、以 Elo 评级聚合更广一批专业任务表现的评测 —— Claude Opus 5 以 1824 分领先,3.8 Flash 约为 1545 分。在综合性知识工作上,这是一道很宽的差距。
3.8 Flash 领先于更大前沿模型的那两个基准,则更偏领域专用:Vals Finance Agent V2 与 Harvey 的法律智能体基准,两者都由Vals.AI维护,衡量的是在结构化金融与法律分析工作流上的表现。Google 关于自己在这两项评测上领先的说法,看来源自第三方基准运营方,这让它们比内部测试结果更可信 —— 不过这些基准本身衡量的能力切片,比综合智能指数要窄。
经过成本校正之后的对比,才是 3.8 Flash 真正有竞争力的地方。输入 0.75、输出 3.75 美元,对 Opus 5 的输入 5、输出 25 美元;一个每天跑数千道编程任务的开发者,每完成一个任务大约可少付五倍的钱,同时取得相当或更好的自报编程基准表现。这个经济论据并不会被 Terminal-Bench 4.0 的差距或 GDPVal-AA 的距离推翻。对于「中等长度的离散软件工程」这个具体任务领域,3.8 Flash 是一个成本低得多的可信选项。
延伸阅读:GLM-5.3-Flash:在国产芯片上跑出接近 Flash 档水平的 3200 亿 MoE
3.8 Flash 仍然落后于前沿模型的地方
Google 并没有声称 3.8 Flash 整体胜过 Claude Opus 5 —— 仔细读发布材料就会发现,公司在这一点上很谨慎。官方博文里的基准表在 DeepSWE 和那两个 Vals.AI 智能体基准上对比占优,但 Google 自己的评测方法文档在别处显示出显著差距。
Terminal-Bench 4.0 的差距 —— 19.1% 对 Opus 5 的 51.8% —— 是 Flash 架构在哪里失效的最清晰指标。那些需要持续多步规划、大上下文追踪、在几十上百轮里做复杂工具编排的长程自主任务,暴露了当前 Flash 档设计的极限。而这恰恰是那些正在为自主研究智能体、复杂代码库迁移器或多系统编排器评估旗舰模型的企业团队所看重的工作流。32 分的差距不是增量差异;它提示:当前的后训练技术无论在离散编程任务上多有力,都还没有把同等增益迁移到持续的智能体语境中。
当任务变成长程时,经济账会变。在 HIGH 思考档下,3.8 Flash 在可比评测上的 token 用量约为 3.7 Flash 的两倍。对一个消耗 200 万输出 token 的任务,这意味着 3.8 Flash 的 HIGH 思考档实际上侵蚀掉一部分相对 Opus 5 的价格优势。按每百万输出 token 3.75 美元、HIGH 思考让消耗翻倍计,跑一个 200 万输出 token 任务的开发者大约要付 7.50 美元 —— 仍远低于 Opus 5 同等输出量的 50 美元,但差距收窄的速度比「0.75 对 5」的输入价对比所暗示的要快。对算力效率型负载,MEDIUM 思考档能把成本优势找回来。
在聚合更广一批评测得出综合分的 Artificial Analysis 智能指数上,Gemini 3.8 Flash 排在第八位左右 —— 与 Kimi K3 和 GLM-5.3 同档 —— 明显落后于 Claude Opus 5 和 GPT-5.6 Sol。一次编程专项的跃升把这个 Flash 模型的编程排名推到接近榜首,却没有按比例抬高它的整体智能排名,这与 Google 这一代后训练的靶向性质是一致的。在由Artificial Analysis维护的综合知识工作 Elo 评测 GDPVal-AA v2 上,Opus 5 得 1824 分,3.8 Flash 约 1545 分。对于 AI 负载横跨法律分析、复杂财务建模、科学推理及其他需要广泛知识综合的领域的机构,这道差距仍然要紧。
开发者还应留意,该模型对 2025 年 1 月之后事件的知识并不均匀。模型卡说明某些领域的截止延伸到 2026 年 3 月,但在另一些领域,模型的知识实际上停在 2025 年 1 月。对那些自 2025 年初以来演进显著的代码库、API 和框架 —— 而在 AI 工具这个领域,变化很多 —— 3.8 Flash 可能给出过时的写法,除非用检索增强来加以锚定。这是 Flash 档架构的已知局限,贯穿全部三个 3.x 代次。
Gemini 3.8 Flash Cyber:一个访问受限的独立模型
Google 还发布了 Gemini 3.8 Flash Cyber,这是 3.8 Flash 的网络安全专用变体,共享同一套基础权重,但叠加了针对漏洞发现和自动补丁生成优化的领域专用后训练。访问权仅限 Google 新设的Fairwind 计划的参与者,包括政府机构与国家网络安全主管部门、关键基础设施运营方,以及规模化运营的软件维护者。普通开发者无法使用 Cyber 变体。
这种专门化在内部部署中产出了有记录的结果。据 Google 称,Chrome 安全团队发现 3.8 Flash Cyber 为 Chrome 漏洞生成的正确补丁数量,是当时可用的最佳商业模型的 2.6 倍 —— 而那些模型参数量更大。企业安全公司、Fairwind 伙伴 Wiz 报告,在其内部渗透测试基准上召回率提升了 7.5 到 9.7 个百分点,成本则比可比的前沿模型低 2.3 到 5.2 倍。Google 的云漏洞研究团队用 3.8 Flash Cyber 在两小时内识别出一个关键的基础性漏洞 —— 该团队称这类任务通常需要数月的人工研究。
这些结果来自在早期访问计划下运作的公司伙伴,而不是独立安全研究者,因此这些数字应被当作有希望的内部信号,而不是已被独立确立的基准。更可信的外部信号是由 Collinear 维护的CWE-Bench:Gemini 3.8 Flash Cyber 在自动代码补丁上得 47.2%,某个领先前沿模型是 47.8%,而它的单任务成本显著更低。这把它放在了 Google 所称的「帕累托前沿」上 —— 本质上是在性能上与领先模型打平,而每次部署的价格更低。
3.8 Flash Cyber 背后的设计哲学值得一提:Google 明确表示它「专门聚焦于给防御方装备专家级能力,让他们相对攻击方取得优势」,并「把(漏洞修复)置于漏洞利用这类攻击性能力之上」。该模型出厂时带着比标准 3.8 Flash 更宽松的安全配置,专门为了让那些本会被拦下的安全研究工作流得以进行 —— 而这正是它的访问权被限制在 Fairwind 计划内、而非公开可用的原因。
部署、访问与基础设施
Gemini 3.8 Flash 是闭源权重 —— 没有自托管、本地部署或开放权重的路径。开发者必须走 Gemini API,而它跑在 Google 的基础设施上。对受监管行业或有数据主权要求的机构,这意味着在迁移生产负载之前,要先评估 Google Cloud 的企业数据处理条款是否满足合规义务。
该模型可通过五个开发者入口访问:Gemini API(直接的 API 集成)、Google AI Studio(浏览器里的原型与评测)、Google Antigravity(Google 自研的智能体式应用构建平台)、Android Studio(移动开发工作流),以及通过 Google Cloud 的 Gemini Enterprise Agent Platform。已经在 Gemini 3.7 Flash 上构建的企业团队会发现迁移路径很直接:主要的破坏性改动是移除了对 MINIMAL 思考级别的支持。传 thinking_level="MINIMAL" 的应用会收到 API 校验错误;它们必须在迁移前改成 LOW 或 MEDIUM。
Google 的迁移说明还指出,temperature、top_p、top_k、frequency_penalty、presence_penalty 和 candidate_count 这些采样参数在 3.8 Flash 上不受支持 —— 这个约束自 3.6 Flash 起就存在,但从更早的 Flash 版本迁移过来的团队需要显式处理它。
对 Gemini Spark 的用户 —— 那是面向 160 多个国家的 Google AI Pro 与 Ultra 订阅者提供的 7×24 个人云智能体 —— 3.8 Flash 现在是底层模型,接替 3.7 Flash。这次升级意味着 Spark 涉及文件归并、邮件起草和跨服务任务执行的复杂多步工作流,现在跑在一个编程与智能体基准表现更强的模型上;不过对多数消费级 Spark 工作流而言,实际感受多半不明显 —— 相比之下,Flash 档升级周期对专门的开发者 API 用量的影响要大得多。
把后训练当竞争策略:更大的那个模式
Gemini 3.x 的 Flash 世代,让前沿 AI 实验室在次旗舰档上竞争方式的一次更广转变变得可见。传统范式 —— 造一个有能力的基座、发布它、等下一代 —— 正在被一种滚动优化模型取代:同一批基座权重通过后训练被持续精炼,而这些精炼被当作离散的产品版本发布出来。
Google 已经在不到七周内发布了三次这样的迭代,每次之间相隔约三周的后训练工作。从 Gemini 3.5 Flash 世代 2026 年 5 月发布时约 35% 到 37% 的 DeepSWE 通过率起步,Flash 这条线仅靠后训练、没有新的预训练,就在同一类基准上达到了 73.7%。那是四个月里任务完成率近乎翻倍 —— 而基座模型的知识截止一直没动过。
这对竞争对手和更广的市场意味深长。如果后训练能在四个月里、在一个有意义的编程基准上把 0.75 美元的模型与 5 美元的模型之间的差距抹掉大半,那么预训练的规模优势 —— 前沿实验室传统的护城河 —— 对那些后训练优化最有效的具体任务领域来说,就没那么决定性了。持续的、复杂的推理任务看起来更抗拒这种压缩;离散的编程挑战则看起来更容易被压缩。
对当前正在为 AI 辅助软件开发支付旗舰价格的企业团队来说,3.8 Flash 的数据造成了一项真实的重新评估义务。这个模型不能在长程自主工作上取代 Opus 5,而 Terminal-Bench 4.0 上 30 多分的差距,应当阻止过于自信的部署决定。但对那些大批量跑离散编程任务的团队 —— 代码评审、缺陷修复、测试生成、文档 —— 「接近前沿的 DeepSWE 分数」加上「低五到七倍的 token 价格」这个组合,与三个月前相比,是一个确实不同的经济命题。
一条评估这项取舍的实用标尺:如果一个团队价值最高的 AI 编程工作流,在 3.8 Flash 的 MEDIUM 思考档 —— 也就是默认的、token 高效的配置 —— 下就能成功完成,那么从 Opus 5 迁移过来的定价理由很强,而 12 月 31 日的首发价截止日让紧迫性变得具体。如果那些同样的工作流需要 HIGH 思考档才能达到可接受的完成率,团队应当先算清 HIGH 档下的实际 token 消耗,再假定广告上的价差能全额兑现。两种配置下差距都仍然可观,但在规模化预算时,量级是要紧的。
延伸阅读:Gemini 3.5 Transcribe 进入公开预览,Google 扩展 Gemini API
开发者与企业团队接下来要盯什么
对考虑 3.8 Flash 的团队来说,最紧迫的技术问题是:当该模型被提交给 Datacurve 的框架做独立评测时,Google 自报的 DeepSWE 分数会不会被确认。第三方公开排行榜目前显示 Opus 5 为 73.6%、GPT-5.6 Sol 为 72.7%;Google 为 3.8 Flash 自测的 73.7%,若被独立确认,会让它实际上与当前榜首持平。Google 的评测方法文档指出,3.8 Flash 的结果是用 mini-swe-agent 框架、在高思考档下自测的,这可能与 Datacurve 在公开排行榜上衡量其他模型的方式并非完全可比 —— 这条方法学上的保留意见,意味着在把「接近持平」当作定论之前,需要独立复现。
定价窗口是一条真实的截止线。0.75 / 3.75 美元的首发价于 2026 年 12 月 31 日到期,之后翻倍到 1.50 / 7.50 美元。对正在评估从 Opus 5 做生产迁移的企业,这给了大约四个月时间去跑验证负载、测量真实世界的任务完成率,并决定成本下降是否值得这次迁移。迁移决定对每种工作流并不相同:跑那类「Terminal-Bench 4.0 表现要紧」的长程自主工作的团队会发现差距太大;而跑离散、中等长度编程任务的团队则会发现,在首发价下 3.8 Flash 很难被略过。
Google 已确认 Gemini 4 Pro 正在预训练中,Sundar Pichai 形容早期结果「令人兴奋」;它才是一旦发布就会最大程度重塑「Flash 对旗舰」这笔账的那个变量。在 Gemini 最初的两位技术共同负责人都已离开、而 Sergey Brin 据报更深地参与核心模型开发的情况下,下一次预训练世代的领导层背景,与产出当前这个基座时已有实质不同。Flash 这条线已经展示了后训练能做到多少;下一次预训练则会揭示还剩多少天花板。