Anthropic 下一代模型现身 API,而 Fable 5 停在企业支出的 11%
两个 Claude EAP 标识符于 8 月 24 日浮出水面;Opus 5 发布不到一个月就反超了旗舰
两个未公开的 Claude 模型标识符 —— claude-marshmallow-eap 和 claude-melon-eap —— 于 2026 年 8 月 24 日出现在 Anthropic 的开发者 API 与社区 Discord 中,预示着新一轮发布周期已经启动,而公司尚未承认有任何新模型在路上。这一发现所处的同一周,支付公司 Ramp 的企业支出数据揭开了一个更棘手的问题:Anthropic 现有的旗舰模型 Claude Fable 5,在商业上已被公司一个月前才发布的更便宜的模型反超。两件事放在一起,勾勒出的是这样一家公司:新检查点推进得很快,却仍未理清自己的定价架构能否撑起外界所传的 2 万亿美元 IPO 估值。
食物代号意味着什么:Anthropic 的 EAP 命名惯例
后缀 eap 是 Early Access Program(早期访问计划)的缩写,是 Anthropic 给那些在公开发布前只小范围分发给少数开发者的模型检查点所贴的标签。食物代号的做法有先例:在 Claude Fable 5 于 6 月 9 日发布之前,开发者就曾在同一频道发现过 claude-fruitcake-eap。更早的一个检查点 claude-honeycomb-eap,则出现在今年夏天 Sonnet 5 与 Opus 5 发布之前的测试阶段。Anthropic 的商用模型采用一套文学化的层级命名 —— Haiku、Sonnet、Opus、Fable、Mythos —— 而内部检查点似乎用的是一次性的食物代号,这些代号并不能可靠地预示模型最终以什么商用名称发布。
早期测试者的反馈经由开发者社区传出 —— 其中包括最早报出这两个模型标识符的 Max For AI 的 X 帖子 —— 这些反馈认为 Marshmallow 在对话质量上优于 Melon。按照这些评估,两个模型都还没有达到 Fable 5 的能力层级。社区推测 Marshmallow 对应 Opus 级别的更新、Melon 对应 Sonnet 级别的迭代,不过 Anthropic 并未确认其中任何一种推断。两个 EAP 标识符同时出现,意味着下一次发布可能不止涉及一条产品线的更新。
把 Fable 5 的企业采用难题量化出来
Ramp 追踪着大约 7 万家美国企业的 AI 支出。它公布的数据显示,自 Fable 5 于 6 月发布以来,这些企业花在 Anthropic 工具上的钱里,约有 11% 流向了 Claude Fable 5 —— 而且这个数字已经连续两个月原地踏步。根据Ramp 2026 年 8 月 AI 指数,在 token 层面,Fable 5 只占 Anthropic 使用量的 6%;也就是说,它的收入占比与实际工作负载占比之间的落差,反映的是它的价格溢价,而不是广泛部署。
与 OpenAI 旗舰模型的对比很扎眼。7 月 9 日发布的 GPT-5.6 Sol,在同期拿下了 OpenAI 支出金额的 23% 和 token 量的 25%。尽管 Fable 5 的输入价格约为每百万 token 10 美元 —— 大致是 Sol 那 5 美元输入价的两倍 —— 它在 7 月创造的收入却只有 OpenAI 旗舰模型的约 75%。Ramp 向《金融时报》证实,Claude Opus 5 在企业支出上已经反超 Fable 5,而此时距离 Opus 5 发布还不到五周。
延伸阅读:Anthropic 招入谷歌 TPU 缔造者 Amir Salek,主导自研芯片
Opus 5 的内部蚕食:半个百分点的差距,两倍的价格
Claude Opus 5于 7 月 24 日发布,价格为每百万 token 5 美元 / 25 美元(输入 / 输出),正是 Fable 5 停滞的直接原因。在面向编程的评测 CursorBench 3.2 上,Opus 5 在最高思考强度下得分 70.0%,Fable 5 为 70.5% —— 这是 Vellum AI 的分析结果。这半个百分点的能力差距,对应的单任务成本却是 8.23 美元对 17.32 美元 —— Opus 5 便宜一倍还多。再往下降一档强度,Opus 5 在「extra high」设置下实际上还赢过同档位的 Fable 5(69.3% 对 68.4%),单任务成本 7.35 美元,Fable 5 则是 11.73 美元。
要明白这为什么重要,得先理解 Anthropic 的思考强度架构。Opus 5 和 Fable 5 都接受一个 thinking effort 参数 —— 从 low 到 max —— 用来控制模型在作答之前分配多少算力做扩展的内部推理。对于每月要跑数百万个智能体任务的企业系统来说,这个强度滑杆是一项成本架构决策,而不是什么无关紧要的配置项。把这些任务交给中等强度的 Opus 5,而不是任何档位的 Fable 5,就能以零头的花费拿到几乎等同的结果。
在智能体编程评测 Frontier-Bench v0.1 上,Opus 5 领先 Fable 5 将近十个百分点 —— 43.3% 对 33.7% —— 这个差距得到了 Vellum AI 的独立验证。Fable 5 仍在 SWE-bench Pro 以及双重用途的网络安全任务上保有微弱优势,后者正是 Anthropic 的 Mythos 级安全分类器专门用来管控风险的场景。但对大多数编程和企业知识工作而言,Opus 5 是更划算的选择。还有一项差异同样倒向 Opus 5:它支持零数据留存协议,而 Fable 5 带着强制 30 天数据留存的要求 —— 对于合规框架要求数据处理过程绝不在 Anthropic 服务器上留痕的医疗、法律和金融服务客户来说,这是个有分量的区别。
Fable 5 剩下的技术差异化点是它的 Mythos 级安全架构。该模型对网络安全和生物领域的传入请求实时运行分类器;超过风险阈值的请求会被改道至 Opus 4.8,由后者给出拒绝或受限的回答,而Anthropic 曾表示,分类器的触发平均发生在不到 5% 的会话中。Anthropic 在 2026 年 8 月更新了生物领域的分类器,测试中误报率下降约 85% —— 说明这套系统的精度仍在提升。对于身处受监管行业、需要管理双重用途 AI 风险的企业来说,这套有据可查的回退架构,相比网络安全分类器更宽松的 Opus 5 是一项真实的差异化优势。问题在于,明确需要 Mythos 级安全管控的企业买家,其规模是否大到足以撑起一个旗舰定价层级。
开放权重模型的挤压:62% 的 token,不到 4% 的支出
内部蚕食的故事还有一个更大的行业背景。Vercel 的 AI Gateway —— 它为超过 20 万个开发团队、跨 200 多家 AI 供应商路由生产流量 —— 其实时榜单显示,截至 8 月 22 日,开放权重模型占到了 token 量的 62%,而 6 月这个数字是 29%,4 月约为 11%。尽管承担了接近三分之二的网关流量,这些模型在该平台上的支出占比却不到 4%。仅 DeepSeek V4 Flash 一家,输入价格每百万 token 0.14 美元,就跑掉了全部网关 token 的 16.9%。
Anthropic 仍以 30% 的 token 量拿走了 Vercel 网关支出的 65% —— 这个比例反映出它确实集中在高价值、前沿难度的工作负载上。但它同样画出了天花板。当一项任务并不需要最好的模型时,开发团队就会把它交给能跨过自己质量门槛的最便宜的那个。而这道门槛随着开放权重模型的每一轮发布不断抬高,能够正当地要求一个每百万 token 10 美元的模型来做的工作,范围正被不断压缩。
Marshmallow 与 Melon 可能改变什么 —— 以及它们改变不了什么
如果 Marshmallow 是 Opus 级别的迭代,那么它进入的市场里,现有的 Opus 已经以一半的价格在大多数评测上压过了 Fable 5。更强的 Opus 会改善 Anthropic 的竞争位置,尤其是在中端对抗开放权重挑战者的时候,但它会加深高端层级的蚕食态势,而不是化解它。如果 Melon 对应的是 Sonnet 级别的更新,那么它进入的层级里,Sonnet 5 在 Anthropic 8 月 10 日的定价决定之后已永久定为每百万 token 2 美元 / 10 美元,并且已经能高性价比地处理开发者的大部分日常任务。
这件事的利害关系一直延伸到 Anthropic 的资本结构。据《金融时报》报道,多位 Anthropic 投资人正在按 2 万亿美元甚至更高的上市估值建模,这是该公司 H 轮融资 9650 亿美元投后估值的两倍还多。支撑这个数字的叙事,要求 Anthropic 证明的不只是自己拥有技术上最精密的模型,还得证明它能把这种能力转化为企业市场中持久的定价权。而 Fable 5 的头两个月 —— 评测成绩很高、收入份额停滞 —— 让这个故事变得复杂。对投资人最要紧的比较,并不是 Fable 5 对 Opus 5、或者 Fable 5 对 GPT-5.6 Sol;而是 Fable 5 那 11% 的支出份额,对上「高端产品理应带来高端收入集中度」这一更普遍的预期。
Ramp 和 Vercel 的数据所描述的这个结构性难题,不是新增一个模型层级就能自动解决的。每当 Anthropic 拿出一个以一半成本几乎追平上一代旗舰的模型,它就在用数字含蓄地宣告:上一代旗舰的定价,高于其边际能力优势所能支撑的水平。正在为潜在的 2 万亿美元上市估值定价的投资人,同时在权衡两个信号:7 月,Ramp 追踪的美国企业中有 43.5% 为 Anthropic 的订阅或 token 付了费,这反映出平台真实的覆盖广度;而 Fable 5 在发布两个月内就停在 Anthropic 支出的 11.4% 不动,这让人对高端层级的定价权打上问号。下一个值得盯的里程碑不是 Marshmallow 和 Melon 什么时候发布 —— 而是发布之时,Anthropic 是否带来了一套正视这种蚕食格局、而非延续它的定价结构。