Codex 额度烧得太快,OpenAI 承诺 28 天日更
三天两次重置额度,加上更省 token 的 Opus 5.5,逼得 OpenAI 出手

OpenAI 核心产品与平台负责人 Thibault「Tibo」Sottiaux 于 10 月 4 日在 X 上发布了一项不同寻常的公开承诺:未来 28 天里,Codex 和 ChatGPT Work 团队每天至少交付一项有意义的改进 —— 否则就发放一次完整的额度重置。此前两天,他刚就 DevDay 期间的服务器过载发出全公司层面的道歉,并宣布了一周内的第二次全局额度重置,这时的 Sottiaux 已经没有立场只承诺更好的基础设施。他的承诺更应被解读为一种承认:围绕 OpenAI 智能体额度体系的信誉问题,已经严重到需要一个可见、可衡量的回应。
这个 28 天窗口 —— 大致持续到 10 月 31 日 —— 是一个已反复上演的故事的最新一集:Codex 用户,尤其是每月 100 美元 Pro 档的用户,经常在计划中的开发工作完成之前就耗尽每周配额,而且往往说不清额度花到了哪里。
一个失控的任务就能抹掉一周的 Codex 额度
用户向 Codex 提交任务时,平台并不是把它当作一次推理调用来执行。它启动的是一条多步骤的智能体流水线:模型生成代码、读取代码库上下文、跨步骤维护状态、总结中间结果,还可能为并行子任务派出子智能体。每一步都独立地从用户的共享额度池里扣减。
一个看起来不大的任务 ——「重构这个模块并写测试」—— 在完成之前可能消耗几十次工具调用和上下文窗口读取。Pro 档用户反映,一次卡住或范围没界定好的会话,就能耗掉每周额度中相当大的一部分。OpenAI 没有公布按操作计的额度消耗数据,Codex 目前在执行过程中提供的实时监控也有限,所以用户通常是事后才发现额度被耗掉了。
这造成了一个层层叠加的问题:更强的模型往往在每个任务上执行更多推理步骤,所以改进模型反而可能提高额度消耗速度,而不是降低。OpenAI 在 2026 年 6 月推出了 可留存重置(banked resets)功能,让 Pro 订阅用户可以把没用掉的速率限制重置留到以后。这项功能之所以有必要,本身就说明到年中时,智能体的 token 经济已经不均衡到需要在产品里内置配额平滑机制。
粉丝自建的追踪网站 codex-resets.com 记录到,自 Codex 上线以来已有 35 次额度重置,平均间隔约 8.9 天。在 Codex 用户中,Sottiaux 得了两个绰号:一个是「Reset Guy」(重置哥),原因显而易见;另一个更亲昵,把每次重置当作一笔意外之财。10 月 4 日的承诺发布前几小时,Sottiaux 在另一条帖子里列出了收窄后的团队议程:简化产品、提高效率以增加有效用量、交付突破性功能、发布新模型。他承认用户「显然希望东西更简单」,这与 OpenAI 近来快速堆叠功能的做法相比,是一次不寻常的转向。
延伸阅读:ChatGPT Dots 智能体在 DevDay 2026 上发布
Anthropic 的 Opus 5.5 暴露了 token 效率差距
Anthropic 于 9 月 22 日发布了 Claude Opus 5.5,与 OpenAI 发布 GPT-6 Sol 是同一天。在衡量智能体编程任务完成度的基准 FrontierCode v1.1 上,Anthropic 自己公布的表格显示,Opus 5.5 得分 54.4%,GPT-6 Astra 为 53.3% —— 差距 1.1 个百分点。Anthropic 的基准表格里没有 GPT-6.1 Sol 在这项对比中的数字。两组数字都是公司自己报告的;截至撰稿时,尚无对 FrontierCode 结果的独立复现发表。
基准上的差距不大。对 Codex 订阅用户更重要的,是据报道的 token 效率差异。基准表现和 token 效率是两种不同的属性:一个用更少的中间推理步骤和更简洁的工具调用完成任务的模型,无论它在排行榜上排第几,每单位工作消耗的用户额度都更少。Anthropic 特别强调,Opus 5.5 的后训练减少了智能体链路的开销。Anthropic 引述的早期测试者反映了一致的效率提升 —— GitHub 的首席产品官指出,在他们的测试中,该模型使用的 token 和步骤属于测到的最少之列,而 Kiro、Spotify 和 Optiver 的开发者则说,完成同等任务的 token 成本大约是 Opus 5 的一半。多位 Codex 开发者也独立反映,在任务难度相当时,Opus 5.5 比 GPT-6.1 Sol 能让他们的智能体额度预算撑得更久。
Anthropic 给 Opus 5.5 的定价比 Opus 5 低约 40%。GPT-6.1 Sol 的定价约为 GPT-6 Astra 的五分之一 —— 这是 OpenAI 自己在同一周的激进定价举动。但对一位支付固定月费的 Codex 订阅用户来说,单价是次要的:重要的是在撞上配额之前能完成多少工作,而在这个维度上,Opus 5.5 看起来握有 GPT-6.1 Sol 尚未追平的优势。
延伸阅读:GPT-6.1 Sol 的发布与定价
xAI 的 Grok Bot 不用承诺,已经在持续交付
28 天承诺的帖子发出后不久,xAI 的 Grok Bot 团队成员 Lauren Tan 在 X 上写道:「期待很快看到更多发布,来自 The Ship Company。」Sottiaux 引用了这条帖子,并向她发起挑战,要她做出同样的承诺。Tan 的回应 ——「这场仗只有你能赢」—— 带着明确的弦外之音:Grok Bot 已经在每天交付,不需要公开承诺。据 Tan 自己在 X 上的帖子,她最近提到在一个月内完成了约 2,500 个拉取请求(PR),并做了一场 72 小时的编程直播,只用 Grok Bot 搭建一家公司的软件基础设施。
因此 OpenAI 面临的竞争压力来自两条战线。在对 Codex 目标用户最重要的能力档位上,Anthropic 赢在 token 效率。xAI 赢在交付节奏,而且没有明显到需要公开重置的额度可靠性问题。Sottiaux 的 28 天承诺,是按 OpenAI 自己的方式回应了第二项挑战,但效率差距仍是模型层面的问题,单靠产品改进解决不了。
这项承诺没有界定什么 —— 以及它修不了什么
Sottiaux 的帖子没有定义其中最重要的那个词:什么才算「对大多数 Codex 和 Work 用户真正有用」?在开发者社区的回应里,各种解读都有,从真正的功能改进,到表面的产品改动 —— 更大的按钮、ChatGPT Dots 智能体界面换一套配色、更新界面文案。按宽松的解读,这些在技术上都算数,却丝毫不触及促成这项承诺的额度耗尽问题。
结构性的额度消耗,也不在一项 28 天交付承诺所能解决的范围内。多智能体流水线中的 token 消耗,取决于一个任务需要多少推理步骤,以及这些步骤的计量有多透明 —— 这两者都是模型架构和计费透明度的问题,而不是产品简化的问题。OpenAI 没有宣布对按操作计的额度报告、任务级额度隔离,或造成额度乘数效应的智能体流水线设计做任何改动。
GPT-5.5 一直可以在 Codex 和 Work 中使用,按计划将于 10 月 14 日从这些方案中退役。这次过渡会把 Codex 和 Work 的会话迁到 GPT-5.6 Sol 或其他更新的模型上 —— 这可能是 28 天窗口内用户体验上最大的一次变化。GPT-6.1 Sol 能否在真实规模上带来更好的 token 效率,而不只是在 Anthropic 自己的评测上缩小与 Opus 5.5 的基准差距,这个问题将在未来四周由实践来回答,而不是由公司自报的表格来回答。
Sottiaux 设想的最坏结果 —— 没有交付改进,于是重置额度 —— 是他的用户群早已计入预期的情形。悬而未决的问题是,这 28 项交付里,有没有哪一项会触及真正驱动这场比较的差距:不是功能数量,而是一位开发者在订阅周期重新开始之前,能把多少额度预算变成可用的软件。