Anthropic 发布 Haiku 5.5,价格直降 90%
官方基准:知识工作近乎翻倍,智能体编程从 0% 跳到 39.2%

Anthropic 于 2026 年 10 月 7 日发布了 Claude Haiku 5.5,把大多数工作负载的 API 入门价格下调了 90%,并首次在 Haiku 系列中引入可调的努力程度(effort)设置,让开发者在推理深度与推理成本之间权衡。这次发布让 Claude 5.5 这一代与 Opus 5.5、Sonnet 5.5 一起配齐,也标志着 Haiku 级别的模型第一次可以作为智能体流水线的支点,具备电脑操作能力、终端工作流和子智能体协调 —— 这些能力此前需要路由到更贵的档位。
对于短于 100,000 token 的提示,Haiku 5.5 的价格为每百万输入 token 0.10 美元、每百万输出 token 0.50 美元,在主导大多数智能体工作负载的维度上与 OpenAI 的 GPT-6 Luna 相同。Anthropic 自报的基准声称在这个价位上电脑操作性能领先,此时 DeepSeek、Google 和 OpenAI 正在向同一个每百万 token 不到一美元的区间收敛。
降价 90%,但分词器抵消了一部分
从 Haiku 4.5 的每百万 token 1.00/5.00 美元降到 0.10/0.50 美元,就短上下文请求的标价而言,确实是 90% 的降幅。Anthropic 自己给出的平均实际节省约为 75%,而不是 90%,因为 Haiku 5.5 使用了更新的分词器 —— 与 Sonnet 5.5 和 Opus 5.5 共用 —— 对同样的输入,它产生的 token 数量约为 Haiku 4.5 分词器的 1.25 倍。独立开发者 Simon Willison 通过非正式测试证实了这一开销,发现同一条提示在 Haiku 5.5 下需要多出约 25% 的 token。
把生产工作负载迁移过来的团队,应当重新校准对提示长度的假设:此前估计接近 100,000 token 边界的工作流,可能会跨入第二个定价档,在那里成本跳升五倍,达到每百万 token 0.50/2.50 美元。Anthropic 表示,Haiku 4.5 的 API 请求中约有 90% 落在短上下文档,所以多数现有用户仍留在较低的价格区间。该档的缓存读取价格降至每百万 token 0.01 美元(Haiku 4.5 为 0.10 美元),这一降幅对缓存系统提示占据 token 预算大头的智能体应用尤其有利。另外,Anthropic 同日把 Sonnet 5.5 的缓存读取价格减半至每百万 token 0.10 美元,使大多数 Sonnet 5.5 智能体工作负载的成本降低约 20%。
可调努力程度实际改变了什么
Haiku 5.5 是第一个支持 Anthropic 努力程度参数 的 Haiku 级模型,该参数控制模型在回应之前进行扩展推理的频率和深度。有五个级别可用:Low、Medium、High、Xhigh 和 Max。Haiku 5.5 默认为 Medium,意味着它对中等复杂度的请求进行推理,对简单请求跳过推理。这与没有任何自适应推理能力的 Haiku 4.5 有本质区别。
这一机制对成本管理很重要。思考 token 按输出 token 计费,所以在复杂任务上一次 Max 努力程度的请求,可能比同一提示下 Low 努力程度的请求贵好几倍。在请求之间改变努力程度,还会使提示缓存的断点失效,这意味着动态调整努力程度的应用每次切换都要付缓存写入的费用 —— 在高吞吐流水线里,这是一个不小的考量。
在多智能体架构中,努力程度参数让 Haiku 5.5 更适合充当路由和编排层。简单的分类和摘要可以用 Low 跑;能从推理中受益的任务可以升到 Medium 或 High,而无需切换模型。对于复杂的多步骤编程或规划,Anthropic 明确表示 Sonnet 5.5 和 Opus 5.5 仍是正确的选择。
延伸阅读:Claude Sonnet 5.5 的智能体编程表现与各努力档位的成本
基准主张:电脑操作领先,智能体编程从零起步
以下所有基准数字均为公司自报,发稿时未经独立复现。
最引人注目的改进在 OSWorld 2.1 上,这是一个真实电脑环境基准,衡量 AI 智能体能否在真实应用中 —— 浏览器、电子表格、代码编辑器、跨应用工作流 —— 跨 Ubuntu、Windows 和 macOS 完成任务。Haiku 5.5 得分 72.4%(离线子集),相比之下 Haiku 4.5 为 15.7%,据 Anthropic 自己的对比表,GPT-6 Luna 约为 48.9%。在测试多步骤命令行编程的 Terminal-Bench 4.0 上,Haiku 4.5 的得分正好是零。Haiku 5.5 达到了 39.2% —— 低于 Sonnet 5.5 的 70.6%,但在相当一部分终端任务上,从「做不了」跨到了「能派上用场」。在 GDPval-AA v2.1 这个覆盖 44 种职业的知识工作质量基准上,Haiku 5.5 的 Elo 得分为 1,620,Haiku 4.5 为 735,GPT-6 Luna 为 1,437。
OSWorld 的分数应当谨慎解读。独立研究记录了 OSWorld 基准分数与真实生产环境表现之间的平均差距,原因包括界面漂移、长尾任务,以及忽略部分成功的二元通过/失败评分。完成 OSWorld 任务的智能体通常比人类专家用更多的步骤,这一差异在生产环境中会放大延迟和成本。72.4% 的分数对一个小模型来说是重要的能力里程碑,但不是部署保证。
竞争格局:价格趋同,差异化转移
GPT-6 Luna 的定价为每百万 token 0.10/0.50 美元,上下文窗口接近 100 万 token,并且直到约 272,000 token 才分档定价 —— 门槛远高于 Haiku 5.5 的 100,000 token 边界。对长上下文工作负载来说,Luna 的定价结构更有利。Google 的 Gemini 2.5 Flash-Lite 标价为每百万 token 输入 0.10 美元、输出 0.40 美元,在所有上下文长度上输出成本都略低于 Haiku 5.5。DeepSeek V4.1-Flash 的闲时档定价更低,不过它的按需 SLA 保证与超大规模云厂商托管的可用性有所不同。
多家主要供应商的输入标价都收敛到每百万 token 0.10 美元,这意味着差异化转向基准表现、延迟和智能体基础设施的深度。Anthropic 自报的 OSWorld 和 GDPval-AA 优势,是专门针对电脑操作和知识工作任务为 Haiku 5.5 提出的能力论据。它能否经受独立复现,将决定价格趋同是否像当前基准表格所暗示的那样有力地惠及 Anthropic。
GPT-6 Luna 更高的上下文门槛,对一种特定的架构选择也很重要:把大段文档上下文塞进单个请求的检索增强生成流水线,在 Haiku 5.5 已经跨入贵五倍的长上下文档位的长度上,仍可以留在 Luna 的统一价格档内。构建文档密集型智能体的团队,面临一个单看每 token 标价无法体现的结构性成本抉择。
企业客户的结果,以及它们说明了什么
五家企业客户为 这次发布 提供了性能数据,全部由 Anthropic 挑选,没有一家经过独立验证。Asana 报告延迟降低超过 30%,每轮智能体推理最快提速 2.5 倍。HubSpot 的内部 CRM 模拟在三次运行中平均准确率为 92.8%。AlphaSense —— 每周处理约 800 万次 Haiku API 调用 —— 在 400 条生产风格的查询上测得准确率 0.84 对 0.76。Box 报告比 Haiku 4.5 高 11 分,延迟约为一半。Cognition 的编程智能体 Devin 把 Haiku 5.5 用作辅助模型,以更低的成本和延迟达到了 66.2 的 FrontierCode 1.1 分数。
Devin 的结果说明了 Haiku 5.5 预期中的架构角色:它处理工具调用、摘要和快速查询,而 Sonnet 5.5 或 Opus 5.5 负责更高层的规划和复杂编程。把大部分工具调用工作交给一个每百万输入 token 0.10 美元的模型,而不是 2.00 美元的模型,即便由更强的模型协调流水线,也能大幅降低每个任务的推理成本。
安全改进,以及一处有记录的退步
来自 Haiku 5.5 系统卡 的对齐指标显示,在没有系统提示的 API 上,单轮无害回应率达到 98.39% —— 这是 Anthropic 为近期模型报告的最高值。过度拒绝率降至 0.17%(Haiku 4.5 为 0.44%)。在 Gray Swan 的 15 次尝试测试中,提示词注入攻击的成功率从 83.2% 降至 7.1%。
安全图景有两点需要注意。基于图形界面的电脑操作提示词注入,成功率仍有 24.4% —— 随着模型获得真实的界面交互能力,这是一个不小的攻击面。系统卡还记录了一处退步:在关闭推理的情况下,当意图模糊时,Haiku 5.5 比 Haiku 4.5 更愿意帮助起草自杀遗书。Anthropic 表示 claude.ai 上更新后的系统提示已针对这一模式作了处理,但在关闭思考的情况下使用 API 的开发者被建议自行添加防护。
网络安全方面的姿态介于前两代 Haiku 之间:在防御性安全任务上比 Haiku 4.5 更严格,但在渗透测试上不如 Sonnet 5.5 宽松。同一周,Anthropic 把其网络安全验证计划扩展为三个访问层级,为经过审核的团队覆盖事件响应、恶意软件分析和漏洞评估。
实际限制,以及 Haiku 5.5 做不到的事
39.2% 的 Terminal-Bench 分数意味着,大约 60% 的复杂多步骤终端编程任务仍在 Haiku 5.5 的可靠范围之外。100,000 token 的价格断崖,对检索增强生成流水线、长文档集和冗长的对话历史构成了架构上的约束 —— 跨过边界的工作负载面临五倍的成本增加。分词器的变化意味着,为 Haiku 4.5 构建的现有成本估算逻辑会系统性地低估 token 数量,可能让看似稳稳处于短上下文范围内的工作负载触发更高的定价档。
Haiku 5.5 发布时,除了关于分词器的说明之外,也没有披露上下文窗口、参数量或架构细节。对于把它与公布这些规格的竞品做对比评估的团队来说,这种不透明是一个实际的限制。
价格战对小模型层级意味着什么
随模型发布,Anthropic 为付费订阅用户推出了每月 API 额度:Max 5x 用户每月 100 美元,Max 20x 用户 200 美元,Team 方案订阅者最多 500 美元的共享额度,均不跨计费周期结转。Python 和 TypeScript SDK 同日获得了电脑操作和浏览器操作的测试版支持。
这次定价重组之际,据报道 Anthropic 正接近在年底前 IPO。Haiku 级别的定价历来按每 token 计比市场领先者贵 10 到 20 倍,这把对成本敏感的开发者推向了 OpenAI 和 Google。在输入价格上与 GPT-6 Luna 持平,同时声称基准上领先,拿掉了把高流量轻量级工作负载路由给竞争对手的两个主要理由。下一步的竞争举动,是来自开放权重模型驱动的低于 0.05 美元的定价 —— DeepSeek 的架构让自托管部署达到这一门槛变得可信 —— 还是来自让基准对比不再可互换的能力差异化,将决定在智能体流水线层级走向成熟时,哪些实验室握有市场份额。