Sonnet 5.5 同价登顶,但 Max 档反而更贵
以 Sonnet 5 的价格登顶智能体编程测试,直到 Max 档把账算反

Anthropic 于 2026 年 9 月 28 日发布 Claude Sonnet 5.5 —— 时间点就在 OpenAI 年度开发者大会的前一晚 —— 把这个中端模型定位成智能体编程任务上更强的选项,而标价与其前代 Claude Sonnet 5 相同。新模型在 Terminal-Bench 4.0(衡量自主完成命令行任务的主要基准)上拿到 70.6%,超过 Claude Opus 5.5 在同一测试上的 66.4%。但这个头条成绩带着一条来自Anthropic 自家公告的重要脚注:两个模型并不是在同一 effort 档位下测的,而且在最大算力负载下,成本结构会以一种开发者在把活路由给便宜那个之前必须搞清楚的方式发生反转。
这次发布落在一个被压缩的竞争窗口里。Anthropic 于 9 月 22 日发布 Claude Opus 5.5,那是 Claude 5.5 家族的第一个模型;Sonnet 5.5 是第二个。新模型保持 Sonnet 5 的标价 —— 每百万输入 token 2 美元、每百万输出 token 10 美元,约为 Opus 5.5 的 4 美元输入、20 美元输出的一半 —— 并且卡着时间点,让基准数据在 OpenAI DevDay 2026 前一晚送到开发者手上,那场大会定于 9 月 29 日在旧金山举行。
延伸阅读:Claude Code 似乎被路由到 Opus 5.2,Anthropic 证实内部有更强模型
Claude Sonnet 5.5 是什么,变了什么
Sonnet 5.5 是 Anthropic 的第二个 Claude 5.5 模型。Anthropic 称它比 Sonnet 5 快 30% 以上,并且在质量相当的前提下可把单任务推理成本降低最多 30% —— 这个成本下降不是来自更低的 token 单价(价格没变),而是来自完成同样的活需要更少的 token 和工具调用。
这个模型瞄准的是 Anthropic 所说的日常专业工作:多文件编程、文档综合、UI 生成、长流程的业务工作流,以及那些模型必须跨工具和环境连续执行动作、每一步都没有人盯着的智能体流水线。Anthropic 把 Sonnet 5.5 定位为 Claude 5.5 这一对里的主力 —— 开发者天天在跑的那个 —— 而 Opus 5.5 负责复杂度最高的持续性任务。第三个 Claude 5.5 模型 Haiku 5.5 预计在未来几周推出。
除了原始性能数字,Sonnet 5.5 还带着两项标志着真正代际进步的能力:视觉图表理解准确率接近翻两番,以及第一次仅凭原始游戏截图、不借助任何图像处理工具就通关《宝可梦 红》。两者指向同一个底层变化 —— 这个模型现在能读懂早先的 Claude 版本无法可靠解析的复杂、密集的视觉信息。
effort 系统如何同时决定性能与成本
关于 Claude Sonnet 5.5,最要紧的不是它的基准分数,而是它的 effort 系统怎么运作 —— 以及为什么它在最高档位上造出了一个出人意料的成本模式。
Anthropic 的 API为 Claude 模型开放了一个 effort 参数,共五档:Low、Medium、High、Xhigh 和 Max。这个参数控制模型在给出最终答案之前,为内部的扩展思考分配多少 token。在 Low 档,模型简短推理、快速作答;在 Max 档,模型的内部思维链基本没有 token 预算上限,可以想多久就想多久。
默认档位在 Claude.ai 消费端应用和 Claude Code 里是 Medium,而 Claude Platform API 默认是 High。没有显式配置 effort 的开发者,跑的就是各自接入点的默认档。这个区别之所以重要,是因为 Anthropic 公告里的基准数字并非全部采集自同一档位 —— Terminal-Bench 4.0 的结果中,Sonnet 5.5 跑的是 Max,Opus 5.5 跑的是 Xhigh,这是算力预算上一个实打实的差距,而头条式的对比把它掩盖了。Anthropic 在其基准表的脚注里披露了这一点。
更深的问题出现在开发者把 Sonnet 5.5 推到 Max 档去做复杂编程任务的时候。独立测试发现,该模型在 Max 档下平均每个任务生成约 19.3 万个输出 token —— 是那位评测者记录过的最高单任务输出量,比 Opus 5.5 的 Max 档数字高出约 60%。因为输出 token 决定推理成本,而 Sonnet 5.5 的单 token 价格低于 Opus 5.5,档位与花费之间的关系并不符合直觉:在 Max 档下,独立测试发现一个 Sonnet 5.5 任务约花 7.60 美元,而同等的 Opus 5.5 任务是 5.98 美元。当两者都跑在最大负载上时,那个「更便宜的模型」反而是单任务更贵的那个。
原因在行为而不在架构。在 Max 档下,Sonnet 5.5 会激进地派出多个子智能体去做代码审查,而 Opus 5.5 不会。这些子智能体各自消耗 token,把单任务的总输出量急剧推高。在 FrontierCode 1.1 上 —— 这个基准衡量的是代码改动能否通过人类的合并审查 —— 这种行为反而拖累了成绩:Sonnet 5.5 在 Xhigh 档拿到 52.1%,在 Max 档只有 46.2%,因为那些额外的子智能体经常对与任务无关的文件做出越界修改,并在较长的运行中触发超时失败。Anthropic 自己在脚注里解释了这个反转:「在 Max 档下,Sonnet 5.5 更常运行 Claude Code 的代码审查技能,该技能会把审查拆给许多子智能体,其中两次导致了超时或超出任务范围的额外修改。」
从数据里能读出的实践建议很清楚:Low 到 Medium 档适合修 bug、生成文档和单文件编程;High 或 Xhigh 适合多文件工程任务和复杂的文档综合;Max 档应当留给真正模糊的问题上的长周期智能体工作 —— 而即便如此,Opus 5.5 跑 High 或 Xhigh,成本质量比也可能好过 Sonnet 5.5 跑 Max。
带上下文再看基准结果
在 Terminal-Bench 4.0 上 —— 它衡量的是自主执行多步命令行任务的能力,包括环境搭建、调试循环,以及没有人工检查点的长周期执行 —— Sonnet 5.5 达到 70.6%。它的前代 Sonnet 5 在同一测试上约为 10.3%,也就是说一代之内大约提升了七倍。与 Opus 5.5 的 66.4% 相比时,需要带上前面提到的档位警告:两个分数是在不同条件下采集的(Sonnet 5.5 用 Max,Opus 5.5 用 Xhigh),应被当作大致可比而非严格等价。
在 FrontierCode 1.1 上 —— 它模拟真实的拉取请求审查,对错误的修复和对无关文件的越界改动都施加惩罚 —— Sonnet 5.5 在 Xhigh 档拿到 52.1%,高于 GPT-6 Sol 在同一基准上的 49.3%。Opus 5.5 在 FrontierCode 上是 54.4%,比 Xhigh 档的 Sonnet 5.5 领先两个百分点。Max 档那个反转(46.2%)是这个基准评分结构特有的 —— 它惩罚的正是 Max 档派子智能体所倾向产生的那种扩张式修改。
CursorBench 4.0 的任务集取自 Cursor 环境中真实的开发者编程会话,而不是合成场景,它把 Sonnet 5.5 放在 55.5% —— 比 Sonnet 5 的 34.1% 高出 21 个百分点以上,与 Opus 5.5 的 57.8% 相差约两个百分点。GDPval-AA v2.1 用横跨 44 个专业职业、九个行业的 Elo 评分来估计真实工作质量,给了 Sonnet 5.5 一个 1844 分,Opus 5.5 是 1846 分。Elo 尺度上两分的差距属于统计噪声;这两个模型在通用知识工作上实际打平。
带工具的「人类最后的考试」—— 一个为难住前沿模型而设计的多学科推理基准 —— 达到 64.5%,比 Sonnet 5 的 54.9% 提高约十个百分点。这是编程之外全面推理质量提升的最清楚的证据。
发布之后,Artificial Analysis的独立智能指数把 Sonnet 5.5 放在总榜第二,仅次于 Opus 5.5 —— 这个排名基于跨多个能力维度的综合评分。按这一尺度,Sonnet 5.5 是目前可用的最强中端模型,在同一价位上高于 GPT-6 Sol。
视觉理解:Chartography 的跃升与《宝可梦 红》
影响面远超编程的那项能力提升是 Sonnet 5.5 的视觉理解。Chartography 这个基准检验的是模型能否在拿不到底层数据、也不用图像处理工具的情况下,仅凭截图准确解读复杂的图表和数据可视化;Sonnet 5.5 在上面拿到 61.6%,而 Sonnet 5 是 15.6%。这是一代之内 3.95 倍的提升 —— 任何 Claude 模型在这个基准上单代跃升的最大幅度。Opus 5.5 在同一基准上是 64.4%,Sonnet 5.5 紧跟在这个更贵的兄弟之后。
实际后果通过 Anthropic 内部的《宝可梦 红》通关测试显现出来 —— 公司一直把它当作一项持续进行的长周期视觉智能体测试。这个游戏提出的视觉阅读挑战格外苛刻:基于精灵图的地图元素、细小的物品图标,以及必须从低分辨率像素画里辨认出来的触发物。此前的 Claude 模型总是卡在几个具体的瓶颈上。更早的 Opus 版本曾长时间被困在游戏里,因为它们无法辨认并拿到一张钥匙卡,或者找不到一个像素表示太小、难以可靠解析的地板开关。2026 年 5 月,一个 Claude Opus 模型第一次通关了这个游戏 —— 但用了两项工具增强:一个截图放大工具,和一个跨会话保存视觉状态的内存快照工具。
Sonnet 5.5 不用这两个工具就完成了整个游戏,只依赖原始截图。这件事的意义不在于打游戏,而在于它证明了:在此前中端模型一直失手的分辨率和复杂度上,模型具备了真实的视觉细节识别能力。同样的能力适用于读密集的财务图表、工程图纸、版式复杂的扫描文档,以及其他需要精确解读细节的真实视觉材料。
OSWorld 2.1 检验的是模型通过解读截图、发出点击和键盘动作来操作桌面计算机的能力,它把 Sonnet 5.5 放在 80.1%,Opus 5.5 是 81.8% —— 相差不到两个百分点,说明这两个模型在计算机操作任务上几乎等同。
延伸阅读:Claude Code 历时 13 个月支持了 AGENTS.md,还带来一套 TypeScript 钩子系统
OpenAI DevDay 前一天的竞争位置
Anthropic 的时间点是有意为之的。把 Sonnet 5.5 放在 OpenAI 年度开发者大会前一天发布,能确保抵达 DevDay 的开发者已经有一晚时间接触新模型及其基准数据。在中端价位上与 GPT-6 Sol 对齐同样有针对性:如今以同样成本评估两者的开发者,手上有 Artificial Analysis 智能指数的数据,显示 Sonnet 5.5 排在 GPT-6 Sol 之上。
Anthropic 自己的基准表里没有列出公开报告过的 GPT-6 Sol 的 Terminal-Bench 成绩,并注明 OpenAI 未报告 GPT-6 Sol 在该测试上的表现。在 FrontierCode 1.1 上,Xhigh 档的 Sonnet 5.5(52.1%)领先 GPT-6 Sol(49.3%)。9 月 29 日的 OpenAI DevDay 2026 会不会拿出改变这个竞争格局的模型发布,还有待观察。
反蒸馏分类器,以及模型推理过程的安全
有一项特性受到的关注远不如基准成绩:Sonnet 5.5 的反蒸馏保护 —— 这是该机制第一次出现在 Sonnet 级别的模型上。
当 Claude 使用扩展思考时,它会在给出最终答案之前生成一条思维链推理轨迹。这条轨迹可以通过 API 流式传给开发者。Anthropic 要应对的隐患是:足够大量的高质量推理轨迹可以被用来训练一个竞争模型 —— 这种手法有时被称为思维链蒸馏。通过大规模收集数万条 Claude 的推理输出,第三方有可能训练出一个复刻 Claude 推理风格的模型,而不必为访问付费。
Anthropic 把自己的对策称为「preserved thinking」(受保护的思考)。Claude 的内部推理无法与生成它的账号解绑,而安全分类器会监测那种从单一账号或协同账号群中高强度、结构化地抽取推理输出的行为 —— 这种特征与正常的应用使用明显不同。分类器触发时,抽取尝试会被拦下。
这是第一个带着这项保护的 Sonnet 级模型;此前它只在 Opus 级模型上提供。把它下放到中端,反映出 Sonnet 5.5 的推理质量如今已经让它成为一个值得被蒸馏的目标 —— 而这本身就是能力的一种度量。
Sonnet 5.5 时代对部署架构意味着什么
Sonnet 5.5 的发布并没有让 Claude 的部署决策变简单 —— 它增加了开发者需要一起优化的变量数量。这个模型在各 effort 档位之间的性能落差比以往的 Sonnet 版本更大,也就是说同一个模型会因为配置不同而表现得很不一样。
对大多数真实负载而言 —— 编程辅助、文档综合、UI 生成、业务流程自动化 —— Sonnet 5.5 跑 Medium 或 High 档,相比上一代能带来可观的成本下降,同时达到或超过上一代在 Max 档的质量。按 Anthropic 自己的测试,Sonnet 5.5 在 Medium 档的 Terminal-Bench 成绩就超过了 Sonnet 5 的最好成绩,而单任务成本不到其十分之一。
到了复杂度最高的智能体任务上,这笔账就变了:长时间的自主编程运行、范围模糊的多文件重构,或者在超大语料上做研究综合。在这里,选 Max 档的 Sonnet 5.5 还是 High 档的 Opus 5.5,从标价上看并不显然。考虑到 Max 档下的单任务成本反转 —— 独立测试里 Sonnet 5.5 约 7.60 美元对 Opus 5.5 的 5.98 美元 —— 以及 Opus 5.5 在派发子智能体上更克制的行为,对持续性的高复杂度工作来说,即便每 token 标价更高,Opus 5.5 也可能是更划算的那个。
Sonnet 5.5 最清楚地展示的一件事是:模型档位之间的界线正在被压缩。一个中端模型如今在自家家族的主要智能体编程基准上领先了大号模型。Sonnet 与 Opus 之间剩下的差距,每一代都在收窄。而在与 OpenAI 领先中端模型相同的价位上,Sonnet 5.5 至少在一个独立智能指数上压过了那个对手 —— 至少目前如此。