GPT-6.1 Sol Ultrafast 上线:6 倍价格换 8 倍速度
API 全员可用,ChatGPT 里只限 Pro 500;可能没用 Cerebras

OpenAI 周四在其 API、Codex 和 ChatGPT Work 上推出了 GPT-6.1 Sol Ultrafast —— 一个新的速度档位,公司称它以每秒约 300 个 token 的速度提供接近旗舰的 AI 性能。在 Codex 中,这相当于标准 Sol 吞吐速率的八倍;通过 API,开发者以标准每 token 价格的六倍获得访问。这次发布是 Codex 负责人 Tibo Sottiaux 28 天体验改进承诺的第 4 天,它也解决了 DevDay 留下的最大悬念:OpenAI 在 9 月 29 日预告的 Ultrafast 档位究竟什么时候真正上线。答案是十天之后 —— 而这次推出所附带的定价结构,赢得了 API 开发者的称赞,也招来了发现自己被挡在门外的 ChatGPT 订阅用户的批评。
延伸阅读:GPT-6.1 Sol 相对 Astra 的基准定位
「快八倍」实际意味着什么 —— 以及这个说法在哪里站不住
OpenAI 公告中的 8 倍,描述的是 Codex 中的 token 生成吞吐量:模型开始回应之后产出输出 token 的速度。标准版 GPT-6.1 Sol 在各订阅产品中的速度约为每秒 30 到 50 个 token,OpenAI 在 28 天行动的第 1 天把这个速率从约 30 提到了约 50,比 Ultrafast 上线早四天。Ultrafast 把这个数字提高到约每秒 300 个 token —— 至少在 OpenAI 受控的测试环境中如此。
8 倍这个数字没有计入几项影响实际用户体验的因素:首 token 时间、连接开销、智能体会话中的工具执行,以及应用侧的处理。Kingy AI 做了一次小规模的独立试点,在一个代码修复和一份研究简报上跑了 16 次,测得实际任务完成速度比标准版快约 3.7 到 3.9 倍 —— 提速可观,但不到头条数字的一半。OpenAI 建议 Ultrafast 的智能体会话使用 WebSocket 连接而不是标准 HTTP,反映的正是这个现实:持久连接减少每轮的开销,让更多的提速落到最终用户身上。通过 API 的 service_tier: "ultrafast" 参数启用 Ultrafast、却仍然反复走 HTTP 周期的开发者,可能会发现开销吞掉了吞吐优势的相当一部分。
话虽如此,即便是 3.7 倍的真实提速,对 OpenAI 瞄准的用例也很要紧。在事件响应中,值班工程师正实时看着系统出故障;在电脑操作智能体里,它正在浏览器中导航完成任务;在语音界面里,用户正在等一句对话回复 —— 这些场景里,秒都算数。Ultrafast 的商业理由在这样的地方最强:有人在看着模型干活,而他们的时间或注意力的成本超过了 token 的差价。OpenAI 的 开发者社区公告 里有该档位完整的技术规格。
定价算术:Sol Ultrafast 是悄悄的 Astra 升级
Sol Ultrafast 的 API 定价为每百万输入 token 12 美元、每百万输出 token 60 美元 —— 恰好是标准 Sol 2 美元和 10 美元的六倍。把这个看似严苛的倍数与 GPT-6 Astra 的标准 API 价格放在一起就更有意思了:每百万 token 输入 10 美元、输出 50 美元。Sol Ultrafast 的价格约为标准速度 Astra 的 1.2 倍,而 OpenAI 称它的性能与 Astra 相当,速度则远超后者。
OpenAI 开发者关系工程师 Dominik Kundel 说得很直接:「智能接近 Astra 的水平,速度是 Sol 的 8 倍,而成本只有 Astra 的 1.2 倍。」
把 Astra 自己的 Ultrafast 档位放进来看,比较就反过来了。Astra Ultrafast 的定价是每百万 token 输入 60 美元、输出 300 美元 —— Sol Ultrafast 的五倍。对于既需要接近旗舰的智能、又需要接近极限速度的团队,Sol Ultrafast 几乎消解了选择 60/300 美元的 Astra Ultrafast 档位的理由,除非 Astra 与 Sol 之间那点质量差距比五倍的价差更重要。
用实际数字来定位:一次 20,000 个输入 token、2,000 个输出 token 的请求,在 Sol 标准版上约花 0.06 美元,在 Sol Ultrafast 上约 0.36 美元。带大上下文的重度智能体工作负载按比例花得更多。超过 272,000 个 token 的长上下文输出还有额外加价,输出按每百万 token 90 美元而不是 60 美元计。完整的定价细节见 OpenAI 的官方定价文档。
基础设施之问:是 Nvidia,不是 Cerebras
OpenAI 在 2026 年 8 月推出第一个 Ultrafast 档位 —— GPT-5.6 Sol 的预览版 —— 时,基础设施是公告的核心。为它提供算力的是 Cerebras,用的是 WSE-3 晶圆级芯片:一颗整张硅晶圆大小的处理器,带 44 GB 的片上 SRAM 和每秒 21 PB 的晶圆内聚合内存带宽。这种设计消除了制约 GPU 推理的「内存墙」—— 在 GPU 上,每生成一个 token,模型权重都要从片外的 HBM 内存搬到计算单元。在 Cerebras 的硬件上,权重常驻在使用它们的核心旁边。GPT-5.6 Sol Ultrafast 由此达到的速度是每秒 750 个 token —— 据称是标准速率的 14 倍。
GPT-6.1 Sol Ultrafast 看来运行在不同的硬件上。基础设施研究机构 SemiAnalysis 在 9 月 29 日 DevDay 公告的同一天报道称,新档位以低批次规模运行在 Nvidia GPU 上,而不是 Cerebras 芯片。OpenAI 既没有证实也没有否认这一说法。Nvidia 的官方账号在 X 上用一个「眼睛」表情回复了 SemiAnalysis 的帖子,这不算表态。Cerebras 当时没有公开评论。
硬件转移的意义超出推理机制本身。今年早些时候上市的 Cerebras,据了解 OpenAI 在其推理订单积压中占相当大的份额。如果 GPT-6.1 Sol Ultrafast —— 一个比 GPT-5.6 Sol 强得多的模型 —— 不在 Cerebras 上运行,Cerebras 业务的依赖性问题就更尖锐了。技术上,GPT-6.1 Sol 的架构细节未披露;有可能这个模型的规模或设计无法干净地映射到 Cerebras 的分层切分方式上 —— GPT-5.6 Sol 用的是把层组分布到多台 CS-3 系统上。Cerebras 的产能扩张和 OpenAI 的发布时机也可能有影响 —— 利用 Nvidia GPU 的富余产能可以更快推出,同时等待专用推理产能爬坡。
头条倍数更低 —— 8 倍而不是 14 倍 —— 与低批次规模的 Nvidia 推理相符,而不是 WSE-3 的晶圆级速度。Cerebras 公布的 WSE-3 上其他开源模型的数字,包括 GPT OSS 120B 的每秒 3,000 个 token 和 Gemma 4 31B 的 1,850 个,比大型专有模型在常规硬件上的成绩高出几个数量级。
开发者得到了什么 —— 以及被挡在了什么之外
Ultrafast 的访问采取双轨结构。通过 API,任何开发者都可以在 Responses API 调用中把 service_tier 设为 "ultrafast" 来启用这个档位,按用量支付每 token 的费率。速率限制在 Build 档默认为每分钟 100 万 token,Launch 档升到 400 万,Grow 档 4,000 万。
ChatGPT Work 和 Codex 里面的情况则不同。在那里,Ultrafast 只对 Pro 500 订阅用户(每月 500 美元,包含 Plus 用量额度的 25 倍)、由工作区管理员启用该档位的符合条件的按用量计费企业客户,以及按额度计费的 Edu 方案用户开放。ChatGPT Plus(每月 20 美元)和 Pro(每月 200 美元)订阅用户无论付多少钱,都无法在 ChatGPT 或 Codex 里使用 Ultrafast —— 哪怕愿意用更快耗尽额度来换也不行。
这项限制是开发者不满的来源。Ultrafast 在 ChatGPT 内运行时,消耗所含用量的速度是标准版的八倍,这使 Pro 500 的额度只相当于 Plus 在标准速度下额度的约三倍。一些在 XHigh 努力程度推理设置下测试该档位的开发者反映,几分钟内就烧掉了 Pro 500 额度的约百分之一。消耗速度是一个真实的约束,不只是营销上的小字。
反方观点 —— 由 OpenAI 开发者社区论坛 上的几位开发者提出 —— 是 OpenAI 应当让任何付费订阅用户自行选择用更快耗尽额度来换取更高速度。既然用量池反正是有限的,按档位而不是按用户选择来限制访问,读起来像人为的限制,而不是产能上的限制。由于 API 没有这样的门槛,这个论点有一定道理:技术上的约束在每 token 的成本上,而 API 六倍的溢价已经解决了这一点。
延伸阅读:OpenAI 对 Codex 的 28 天改进承诺
Sol Ultrafast 在推理速度版图中的位置
Ultrafast 的竞争参照主要不是其他 AI 供应商当前的模型 —— 而是 OpenAI 自己的产品档位。对已经在用 Sol 标准版、需要更快响应的团队,升级路径清晰且相对便宜。对考虑 Astra 标准版的团队,Sol Ultrafast 以更低的价格提供相当的速度,除非智能上的差距 —— GPTS24 此前报道为视任务不同相差 1.3 到 3 个基准分 —— 对他们的用例有实质影响。
与其他前沿模型相比,独立测得的吞吐数据表明,Gemini 3.5 Flash 约为每秒 167 到 180 个 token,Gemini 2.5 Flash 约为每秒 204 个 —— 都是快模型,但低于 Sol Ultrafast 声称的每秒 300 个。Anthropic 没有为 Claude Sonnet 5.5 宣布同等的超低延迟档位,而 Sonnet 5.5 在其他方面与 Sol 标准版的每 token 定价持平,每百万 token 输入 2 美元、输出 10 美元。没有 Sonnet Ultrafast 档位,留下了一个由 Sol Ultrafast 占据的空缺。这些跨供应商的比较并不严谨,因为延迟取决于模型规模、硬件分配、请求形态和地理路由,而竞品模型的数字也不是在同等条件下采集的。
对 OpenAI 的开发者生态最要紧的比较,是 Sol Ultrafast 与此前的 GPT-5.6 Sol Ultrafast 预览版之间的比较。早先的档位声称在 Cerebras 硬件上达到每秒 750 个 token,比 Sol Ultrafast 的速度快近 2.5 倍。原始速度上的倒退是真实的。说这一代的 Ultrafast 尽管更慢却更有价值 —— 因为 GPT-6.1 Sol 比 GPT-5.6 Sol 强得多 —— 这个论点说得通,但建立在部分由公司自报的能力提升之上。来自 BenchLM 的独立基准数据 把 Sol 定在 71.9%,Astra 为 73.2%,差距 1.3 分 —— 这是在不同价格水平上评估速度与智能之间取舍的背景。
28 天行动,以及接下来会怎样
Sol Ultrafast 作为 28 天改进冲刺的第 4 天发布,被框定为一个更长序列中的一个里程碑。前三天交付了所有模型的基准提速、API 基础设施的简化、Decisions API(一个建立在 Luna 模型上的轻量分类与路由层),以及 GPT-6 首次出现在 ChatGPT 主界面中。第 5 到第 28 天尚未宣布。
OpenAI 尚未公开回应的,是 SemiAnalysis 提出的基础设施问题。GPT-6.1 Sol Ultrafast 最终会不会迁移到 Cerebras 或其他专用加速器,当前基于 Nvidia 的部署是有意为之还是过渡安排,Sol 在低批次规模下是否存在真正的硬件架构速度上限 —— 这些都没有说清。8 月 Cerebras 的 14 倍基准仍是 Ultrafast 架构所能达到的参照点;Sol Ultrafast 在看来是常规 GPU 硬件上的 8 倍,留下了一个悬念:真正的速度升级会在剩下的 24 天里到来,还是今年晚些时候。对于那些每 50 毫秒延迟都会改变用户行为的应用的开发者来说,这个问题不是纸上谈兵。