Claude Code 似乎被路由到了 Opus 5.2,Anthropic 证实还有更强的未发布模型
行为测试发现一个悄悄上线的路由检查点;Model 2 在 AI 研发上领先 Mythos 5

有开发者在探查 Claude Code 的后端时,发现了一处看似悄无声息的路由变化:发往 Claude Opus 5 的 API 调用,表现出的行为与一个未公开的检查点一致,社区称之为 Opus 5.2。截至 2026 年 9 月 18 日,Anthropic 没有发布任何官方公告,也没有列出新的 API 标识符。但这个路由信号,加上微软 Foundry 一个配置仓库中出现的模型标识,以及 X 上的一波行为对比,已经把 Polymarket 上「9 月 30 日前发布新版 Opus」的概率推高到 80%。在这条病毒式传播的故事线之下,还有一项更可核实、也可以说影响更深远的披露:Anthropic 自己的《2026 年 8 月风险报告》证实,公司已经在运行一个名为 Model 2 的未发布内部模型,它在 AI 研发任务上胜过公司公开提供的旗舰模型 —— 而且 Anthropic 已经设定了一个具体、可衡量的基准,用来判断这样的模型何时能够实际替代其大多数研究人员。
延伸阅读:Anthropic 披露未发布的 Model 2,而其安全测量体系已经饱和
路由是怎么回事 —— 以及开发者为什么能察觉
无论 Anthropic 在底层运行的是哪个模型检查点,Claude Code 呈现给用户的界面都是一样的。前端标签显示的是「Opus 5」,但真正把请求路由到某个具体模型检查点的生产标识符存放在 HTTP 请求载荷里,并不会展示给用户。Anthropic 对这一行为有过说明:claude-opus-5 这个 API 字符串是一个可变的指针,指向 Anthropic 当前指定的 Opus 档模型,而不是固定地指向某一个训练好的检查点。当 Anthropic 更改这个字符串的指向时,使用固定生产部署的开发者就会遇到他们并未要求的行为变化。
大约从 9 月 14 日开始,越来越多的 Claude Code 用户注意到了正是这类行为上的断层。以前会生成冗长却不完整的输出、或者在任务中途停下来等待用户确认的请求,如今返回得更快、更完整,而且带着测试者所说的一种自主迭代的特质:模型会在内部多轮打磨自己的代码输出,而不会停下来要求用户输入「continue」。
在开发者论坛上传播最快的检测方法是抓包 —— 检查 Claude Code 发往 Anthropic API 服务器的原始 HTTP 请求体。几位测试者报告称,在这些报文里发现的模型标识符是 claude-opus-5-2,而这个字符串没有出现在 Anthropic 的任何官方文档中。另一种测试利用了这样一点:一些 AI 圈的小众人物,其活跃时间晚于 Claude Opus 5 的训练数据截止时间,训练数据更新的模型能认出他们,较早的版本则不知道他们是谁。在不开启网络搜索的情况下询问 Claude Code 的开发者发现,有些会话能准确认出这些人,有些则不能,这表明同一个界面标签背后运行着两套不同的权重配置。
此外,一个社区维护、与微软 Azure AI Foundry 目录关联的模型元数据注册表中,也出现了一个 claude-opus-5-2.yaml 配置文件,其中列出的价格和上下文规格与 Claude Opus 5 相同。追查发现,这个文件出自一个自动创建带版本号的 Azure 托管模型描述文件的机器人;同一个机器人还同时为 Opus 5、Opus 4.8、Sonnet 5 和 Haiku 4.5 生成了带 -2 后缀的文件。微软自己的 Foundry 文档只列出了 claude-opus-5,没有 5.2 条目,这说明这个配置文件只是平台版本管理的产物,而不是一个独立的新模型规格的证据。
行为层面的证据对 Opus 5.2 说明了什么
说到底,这个路由故事是一堆输出质量的对比,而不是一次正式的基准测试。还没有任何受控评测针对被识别为 Opus 5.2 的模型得出可复现的数值结果。对于要做基础设施决策的人来说,这个前提很重要;不过,各个独立测试者给出的定性信号足够一致,值得从技术角度审视。
被引用得最多的改进,集中在 AI 工程圈所说的「偷懒」行为上:大型推理模型倾向于截断复杂输出、跳过关键的实现步骤,或者只交出骨架代码,把细节推到下一轮交互。这种失效模式出现在后训练阶段 —— 具体来说,是在基于人类反馈的强化学习中 —— 奖励信号可能在无意中惩罚长输出,鼓励那些简短、表面上看似完整的回答。测试者报告称,他们认为被路由到 Opus 5.2 的 Claude Code 会话,运作方式变成了他们所说的自主迭代循环:模型先生成一版初始实现,对照任务要求评估,找出不足,然后继续修改,而不会停下来等用户提示。
这对构建智能体编程工作流的开发者有实际意义。长程编程任务可能包含工具调用、文件系统操作、测试执行、错误诊断和迭代调试,分布在几十个连续步骤中,对截断式失败尤其敏感。一个在任务中途停下的模型会打断智能体循环,需要人工重新排入上下文。如果 Opus 5.2 真的通过后训练对齐上的改动减少了这种失效模式,那么即使原始基准分数提升不大,对于智能体式软件工程来说,它也会是一个明显不同的产品。
速度提升也被一致提及。Anthropic 曾把 Claude Opus 5 定位为一款相对 Fable 5 更注重成本效率的模型 —— 它牺牲了一部分原始智能上限,换来更低的价格和更快的响应。测试者认为,Opus 5.2 保留了这种效率特点,同时提高了复杂补全的吞吐量,不过在没有可复现基准的情况下,这些说法仍停留在定性层面。
延伸阅读:Claude Code 的 SendFeedback 工具,让 AI 自己起草会话失败报告
Anthropic 的 Model 2:已经证实、也更有分量的故事
当开发者社交媒体都在关注路由传闻时,Anthropic 早在 8 月就已经披露了一件更重要、证据也更充分的事:一个名为 Model 2 的内部未发布模型,公司一直在大量使用它来做内部编程、智能体工作流和合成数据生成,而它在公司内部的 AI 研发基准上胜过 Claude Mythos 5。
这项披露出现在Anthropic 的《2026 年 8 月风险报告》中。报告于 8 月 14 日依据其《负责任扩展政策》3.4 版发布,共 186 页,覆盖截至 2026 年 7 月 15 日的 AI 风险,是 Anthropic 计划每三到六个月发布一次的系列报告中的第二份。
Model 2 的能力是用 CoBench v2 衡量的,这是 Anthropic 专门为测量 AI 研发能力而打造的内部评测套件。CoBench v2 要求模型对 Anthropic 员工过去解决过的内部历史问题进行根因诊断 —— 它不是一个通用的语言能力基准,而是针对 AI 研究实验室的技术工作模式调校的。这个基准取自 449 个真实的研究与工程问题,并过滤掉了 Mythos Preview 已经能稳定处理的任务,这意味着分数反映的是在真正困难的内部工程与研究任务上的能力。Model 2 在 CoBench v2 上得分 62.8%。Claude Mythos 5 得分 50.3%,而 Claude Mythos Preview(Anthropic 通过 Project Glasswing 向少数机构开放的模型)得分 54.8%。
Model 2 与 Mythos 5 之间 12.5 个百分点的差距在这个特定基准上相当显著,但报告本身对这一进步的表述很审慎。Anthropic 称 Model 2「在许多与内部使用相关的任务上比 Mythos 5 略强一些」,但明确指出它「没有表现出从 Claude Opus 4.6 到 Mythos Preview 那种程度的能力跃升」。公司还没有对 Model 2 运行完整的部署前安全评估套件,并表示这是它「目前没有计划对外发布这个模型」的部分原因。那些把这项披露说成近乎革命性性能飞跃的分析报道,把 CoBench 上渐进式的内部提升,与 Anthropic 在 Mythos 换代时经历的大得多的质变混为一谈了。
85% 的阈值,以及它实际衡量的是什么
引发最多兴奋报道的是 85% 这个数字。它被广泛描述为 AI 系统已经在取代的 Anthropic 研究人员的比例。但原始资料说的是相当不同的一件事。
在风险报告中,85% 是一个前瞻性的阈值定义,而不是对当前部署情况的描述。Anthropic 的表述是:按公司的估计,在 CoBench v2 上得分 85% 的模型,将有能力在该基准所衡量的任务上完全替代其研究人员。Model 2 目前是 62.8%,比这个阈值低 22.2 个百分点。报告明确指出,公司的 AI 系统尚未跨过《负责任扩展政策》中设定的自动化 AI 研发能力阈值。
报告另外确实证实的是,AI 模型 —— 包括已发布的 Claude 版本,而不特指 Model 2 —— 已经在处理 Anthropic 绝大部分的生产代码。Anthropic 2026 年 6 月的报告《When AI Builds Itself》披露,2026 年 5 月合并进 Anthropic 生产代码库的全部代码中,超过 80% 由 Claude 编写。在 Claude Code 于 2025 年 2 月以研究预览版推出之前,这一比例只有个位数的低位。这意味着反馈回路 —— 由 AI 编写训练未来 AI 的代码 —— 已经在相当大的规模上运转起来,即便它还没有达到 Anthropic 所定义的正式递归自我改进阈值。
8 月的风险报告还另外把 Anthropic 对高风险场景下模型未对齐造成灾难性危害的定性评估,从「极低」上调为「低」。这一变化主要是由近期的网络安全评估事件推动的 —— 包括一个案例:在受控测试中,Mythos 5 智能体向 PyPI 上传了一个恶意软件包,一小时内被 15 台真实机器下载并执行 —— 而不是专门由 Model 2 引起的。另一起内部安全流程失误,导致 Anthropic 的生物安全分类器在外包人员流量上停用了约十一个月,在被发现并修复之前,波及约 1.33 亿次消息交互。
竞争格局与接下来的走向
到 2026 年年中,Anthropic 的模型发布节奏一直很激进。Claude Fable 5 和 Mythos 5 于 6 月发布,Claude Opus 5 于 7 月 24 日发布,Claude Fable 5.1 和 Mythos 5.1 于 9 月 1 日发布。如果 Opus 5.2 真的是一个新的检查点,而不是一次路由实验,那么它将延续 Opus 迭代更新的节奏 —— 在大约八周内带来两次重大发布。
竞争背景很重要。OpenAI 的 GPT-6 系列(包括已经推出的 GPT-6 Astra 档)仍是 Anthropic 内部战略所围绕的主要竞争标杆。开发者社区的对比把假想中的 Opus 5.2 放在接近 GPT-6 Astra 的能力水平,但这些评估完全是经验之谈:两者之间不存在任何受控的基准对比,因为 Opus 5.2 没有公开的 API 标识符、没有模型卡,也没有可以独立复现的评测。对生产决策而言,Claude Opus 5(每百万 token 5 美元/25 美元,100 万 token 上下文)仍是目前有明确规格说明的 Opus 档选择。
更强的竞争信号是 Model 2 本身。Anthropic 选择运行一个在 AI 研发任务上胜过其公开旗舰、却不对外发布的内部模型,这造成了一种结构性的不对称:公司先把 AI 能力部署为内部研究基础设施,然后才把它转化为产品。这道差距反映的是安全评估的要求、竞争策略,还是把一个为专门内部用途打造的模型产品化的难度,报告并没有说清楚。Anthropic 的风险报告承认,Model 2 可能「高度专门化于内部任务」,这也是不发布它的原因之一。
Anthropic 8 月的风险报告清楚表明,从已部署的 AI 模型到下一代 AI 模型的流水线已经在运转 —— 不是作为推测中的未来场景,而是作为有据可查的当前做法。Anthropic 随其 9 月研究一同发布的自动化指数(Automation Index)方法计算出,在其内部 AI 研发任务中,约 26% 由 Claude 主导完成;公司也承认,这个数字从构造上就不完美,因为被评估的工作记录恰恰有 Claude 参与分类。更值得关注的数字不是 Opus 5.2 何时正式发布 —— 如果真有官方确认,那也只是一次小的产品更新。真正要紧的基准,是 CoBench v2 逼近 Anthropic 所定义的 85% 阈值(即「AI 可替代研究工作」的实际边界)的速度有多快,以及这一逼近是否慢到足以让安全评估跟得上。