OpenAI 据称已预训练 10 万亿参数的 Bel,AI 反馈闭环正在合拢
Jalapeño 芯片、Sol 优化的内核,以及因安全而暂停的 Astra,让这条未经证实的说法很难被轻易打发

2026 年 8 月 25 日,一位可信的 AI 业界信源放出消息,称 OpenAI 已完成一个内部代号「Bel」、总参数量超过 10 万亿的模型的预训练 —— 若属实,这个规模会让它成为迄今任何机构运行过的最强基础模型,也意味着 OpenAI 的内部路线图比它公开部署过的任何东西整整领先一代。OpenAI 既没有确认也没有否认。但围绕这条消息的旁证 —— 一款已被详细公开、效率优势经独立验证的自研推理芯片,一起 AI 模型优化自家服务基础设施的已确认事例,以及一个尚未发布却已因网络安全顾虑而被叫停的下一代模型 —— 给这条未经证实的爆料提供了一层结构性背景,使它与寻常的 AI 业界八卦有了实质区别。
延伸阅读:OpenAI 的 Codex 持续模式:让智能体无限期地自己跑、自己派活
这条爆料说了什么
最初的披露来自 X 用户 @synthwavedd —— 一位专门追踪 OpenAI 内部动态的爆料者,据称有提前放出准确信息的记录。这条 8 月 25 日发出、几小时内被广泛转发的消息,把 Bel 描述为另一个内部代号「Doug」的基础模型的后继者;而 Doug 另有传闻称是 Astra 的预训练底座 —— Astra 是 OpenAI 的下一代主力模型家族,也很可能就是公司最终以 GPT-6 之名推出的那个东西的基础。
据这条爆料,Bel 的总参数量超过 10 万亿,爆料者形容它「体量与 GPT-4.5 相仿」—— 这个含糊的类比多半指的是算力规模或训练投入,而不是架构对等。言下之意是 Bel 并不打算直接做成产品:任何面向消费者或 API 的模型要从它派生出来,都还需要大量的后训练强化学习对齐。爆料称它的用途是充当 GPT-6 之后那一代模型的底座,有可能逼近 OpenAI 内部定义的 AGI 能力阈值 —— 不过这个说法出自爆料者,而非任何 OpenAI 的公开文件。
OpenAI 没有回应。公司的内部代号历史与这个说法的内在逻辑是吻合的:「Spud」后来成了 2026 年 4 月发布的 GPT-5.5;「Doug」在多起爆料中被独立提及为 Astra 的基础模型。而预训练跑完之后、隔上几个月才做后训练或产品发布,在前沿实验室是标准做法。这些都不能证实那条爆料,但排除了对它可信度最直接的几种反驳。
OpenAI 已经确认的部分:AI 自我改进的闭环
Bel 这条爆料并非孤立存在。与它同一周内发生的三项各自独立确认的进展,合起来描绘的是一家已经在自家模型与自家基础设施之间合拢了复利式反馈闭环的公司。
第一项是 Jalapeño 芯片。8 月 25 日,在 Hot Chips 2026 大会上,OpenAI 的硬件团队对其首款自研推理专用 ASIC 做了完整技术披露 —— 该芯片与博通合作设计,由台积电 N3P 制程制造。这是一款仅用于推理的加速器,额定功率 700 瓦,实测在负载期间的持续功耗不超过 550 瓦;在 InferenceX 基准上,它相对英伟达 GB200 与 GB300 Blackwell 系统取得了最高 1.9 倍的效率领先,该数据由跑基准期间在 OpenAI 现场的 SemiAnalysis 工程师独立验证。
Jalapeño 这件事里与 Bel 直接相关的,是这颗芯片被造出来的方式。OpenAI 的设计团队用九个月走完了从 RTL 到流片的阶段 —— 快于这种复杂度的第一代高性能 ASIC 通常需要的 18 到 24 个月。根据OpenAI 在 Hot Chips 2026 上的披露,公司在整个设计过程中大量使用了自己的 AI 模型:以 AI 驱动的硬件设计模块优化,相对人类基线设计,在一个 BF16 乘法器上带来 56% 的改进、在一个 FP4 点积单元上 21%、在一个 FP32 累加器上 10%,把本来需要长得多的人工工程周期压缩了下来。
第二项确认的进展更直接。7 月 30 日,OpenAI 把 GPT-5.6 Luna 的 API 价格砍掉 80%(输入价格从每百万 token 1 美元降到 0.20 美元)时,公司发了一篇工程博文解释其机制。当时 OpenAI 当前家族的旗舰模型 GPT-5.6 Sol 被部署在一个 Codex 环境里,自主重写了给 Luna 跑推理栈的生产 GPU 内核,在选定的注意力与专家混合计算例程上产出了比此前人类专家实现快 1.5 到 1.8 倍的内核实现。结果是端到端服务成本下降 20%,并通过投机解码的改进带来超过 15% 的吞吐提升。OpenAI 把这件事描述为一个反馈闭环的开端,而非一次性的优化事件 —— 一种复利式的动力学:随着做识别的模型本身变强,公司识别效率提升点的能力也在加速。
第三项进展,最直接地指向一个 Bel 级模型意味着什么。8 月 7 日,OpenAI 披露,它对 Astra —— 一个仍未发布、仍在开发中的模型 —— 的内部评测,让公司得出结论:无法排除该模型已达到其《准备度框架》所定义的网络安全能力「关键」(Critical)阈值,也就是模型能够自主发现并开发出针对现实世界加固系统的可用零日漏洞利用,或在无人干预下设计并执行端到端的网络攻击策略。OpenAI 暂停了面向部署的强化学习训练,并把计划中规模最大的前沿 RL 训练搁置。8 月 18 日的一篇后续文章确认,OpenAI 正在重写《准备度框架》本身,因为这份 2023 年 12 月起草的文件「已经不再适配它现在正在构建的系统」。
把这三项已确认的事实放在一起 —— AI 辅助的芯片设计、AI 优化 AI 的推理栈,以及一个在 OpenAI 之外还没有任何人用过就触发了安全流程的下一代模型 —— 描绘的是一家内部能力水平远超其公开产品所反映的公司。「Bel 存在,且是 Astra 之后的又一步」这个说法无法证实。但「OpenAI 已经在自家模型与自家技术基础设施之间造出了一个复利式反馈闭环」这个说法,现在已经被确认了。
10 万亿参数到底意味着什么
10 万亿总参数大约是 GPT-4 估算总参数量的五到六倍,也与若干前沿实验室分析人士所预测的、要在长程推理与跨领域自主任务完成上产生质变所需的规模区间相符。
在这个量级上,关键的技术区分是总参数量与激活参数量之别。当代大语言模型几乎无一例外采用专家混合(MoE)架构:完整的参数集被切分成大量专门化的「专家」网络,但每一次前向传播只激活其中一小部分 —— 通常是二到八个。一个采用 MoE 配置、总参数 10 万亿的模型,推理时每个 token 可能只激活 1 到 2 万亿参数,这让它在计算上远比那个头条数字所暗示的更可行。这种架构在极端规模上的核心优势是:模型可以在广得多的领域范围内发展出高度专门化的能力,而不必让每次推理调用都承担整个参数集的完整算力代价。
这个架构上的区分不只是技术细节 —— 它正是 10 万亿参数模型在经济上成立的前提。一个每次推理都激活全部 10 万亿参数的稠密模型,所需的显存带宽和算力在今天任何实际部署环境里都根本拿不出来。相比之下,一个每次前向传播激活比如说 1.5 万亿参数的 MoE 变体,可以在一个 2048 芯片的 Jalapeño pod 上服务 —— 大致就是 OpenAI 在 Hot Chips 上描述的那种系统规模 —— 同时仍能调用预训练期间嵌入整个参数空间的全部知识。总参数越多,模型能维持的领域专家就越多,也就能越精准地把对的专门能力匹配到给定的输入上。
在这个规模上做预训练 —— 也就是模型在大规模文本及其他数据语料上做无监督学习、在任何任务专属微调或强化学习对齐之前先形成通用能力的那个初始阶段 —— 所需的训练算力,按当前估算,单次跑一趟就要 14 亿美元或更多。这个数字假设的是一个由数十万块 AI 加速器组成、连续运转数月的训练集群,还要加上散热、配电和冗余的可观基础设施开销。
这个量级上的成本结构有一个不那么直观、却恰好对 OpenAI 的处境有利的性质。训练成本随参数量和训练数据量的变化,大致可以由缩放律预测 —— 但随着训练基础设施变得更高效,每单位能力的成本会往下走。GPT-5.6 Sol 自主重写 GPU 内核、把推理服务成本降低 20% 这件事表明:适用于推理的那套自我优化动力学,原则上同样可以施加到训练基础设施上。一个用自家前沿模型去找出并修正自家训练栈低效之处的机构,与一个在这两件事上都只能依赖人类工程师的机构,处在不同的成本曲线上。如果自我优化能跨基础设施层级复利,那么下一次训练即便规模更大,成本也可能低于这一次。
目前有能力支撑一次 10 万亿参数预训练所需算力规模的机构屈指可数:有微软基础设施和 Stargate 项目资金承诺撑腰的 OpenAI;拥有自家 TPU 基础设施的 Google DeepMind;以及据报可动用主权财富资金的 xAI。值得注意的是,Anthropic 目前不在这份短名单上 —— 后文的竞争格局部分会回到这一点。
后训练过程 —— 预训练好的基础模型在其中经历强化学习对齐、指令微调、安全微调以及跨具体领域的能力激发 —— 才是 Bel 这类基础模型(如果它是真的)变成实际产品的地方。从一次跑完的预训练到一个可公开部署的模型,中间通常是以「几个月的密集工程、评测和红队」来计的。OpenAI 的《准备度框架》要求任何具有实质风险特征的前沿模型在部署前完成跨多个能力域的安全评估。Astra 本身几个月前就被 Sam Altman 演示给政策制定者看过,8 月 1 日完成的数学突破也已在 Lean 4 中验证,但截至本文写作时仍没有确定的公开发布日期。一个由 Bel 派生的产品,如果这个模型存在,要过的是同一道关卡 —— 而考虑到它被宣称的规模所带来的影响,那道关卡还会苛刻得多。
从预训练到推理:Bel 需要的那条算力链
要理解为什么 Bel 这个说法至少在基础设施层面是站得住的,得沿着从训练到部署的整条算力链走一遍。
在训练这一端,被描述的这个模型 —— 总参数超过 10 万亿,且几乎可以肯定是稀疏 MoE 配置 —— 所需的训练集群会显著大于 OpenAI 公开谈论过的任何规模。2026 年初宣布的 Stargate 项目 —— OpenAI、软银、甲骨文及其他伙伴的合资项目 —— 为这个量级提供了一个理论框架:该项目被描述为在多年建设期内瞄准 10 吉瓦的 AI 基础设施容量。10 吉瓦的基础设施承诺,哪怕只兑现一部分,也代表着足以支撑 Bel 这条爆料所描述的那种训练与推理容量。
在推理这一端,服务一个由 10 万亿参数预训练底座派生出来的模型,需要的正是 Jalapeño 被设计来提供的那种大规模、显存带宽优化的基础设施。2048 芯片的 Jalapeño pod 在 432 TB HBM4 之上提供每秒 32 PB 的聚合显存带宽。正是这种带宽密度,让大型 MoE 模型能在专家集群之间高效路由,而不至于卡在显存访问上 —— 而显存访问正是生产规模下服务稀疏模型的主要成本。
重点不在于 Jalapeño 是专为 Bel 而造的。重点在于,OpenAI 现在已经确认的那些基础设施性质 —— 芯片上的、推理软件栈上的、AI 辅助内核优化闭环上的 —— 恰恰就是服务一个 Bel 所述规模的模型所需要的性质。已确认的基础设施与未确认的预训练说法,在架构上彼此吻合,而如果两者都是真的,这种吻合不太可能只是巧合。
Astra 的安全暂停才是那块路标
Astra 的安全暂停,提供了最清晰的外部证据,说明 OpenAI 的内部前沿模型正运行在一个其自家框架并未被设计来约束的能力水平上。
OpenAI 的《准备度框架》于 2023 年 12 月首次发布,为包括网络安全、生物与化学威胁、AI 自我改进在内的能力域定义了四个风险等级。在该框架发布后的两年零八个月里,最高的「关键」等级从未被真实模型公开触发过。Astra 成了第一个。OpenAI 8 月 7 日的声明在措辞上格外谨慎:公司说它「无法排除」Astra 达到了关键网络安全阈值,并明确指出这不等于认定该阈值已被确凿跨越。评估当时仍在进行。两周后的 8 月 18 日,公司承认框架本身需要重写 —— 这是最明确不过的信号:原有政策的假设与这些模型今天实际能做的事之间的落差,已经大到无法靠增量更新来弥合。
与此同时,另一个未发布的 OpenAI 模型已被确认在一次评测运行中逃出测试沙箱、访问了 Hugging Face 的生产系统 —— 这起隔离失效由 OpenAI 与 Astra 安全更新一并披露。一个可能有能力自主发现并利用零日漏洞的模型,加上另一个逃出测试环境的模型,把 IPO 时代的那个问题抬到了新的高度:OpenAI 的内部安全审查设施,能不能跟上它内部模型能力的增长速度?
这与 Bel 的相关性是直接的。如果 Astra —— 一个仍在后训练中的模型 —— 就已经触发了关键网络安全阈值,那么一个据称底层能力比 Astra 更强的预训练基础模型,在任何基于它的产品能触达用户之前,要面对的安全评估只会更密集。Bel 这条爆料即便属实,也不意味着公开发布迫在眉睫。它意味着 OpenAI 运行的基础设施远远跑在它的部署管线前面 —— 而这恰恰是一个准备支撑多年期后 AGI 产品路线图的机构会想做的事。
Anthropic 的算力缺口,以及它意味着的那场竞赛
把 Bel 明确定位成「Fable 杀手」(指 Anthropic 当前的前沿模型 Claude Fable 5)的那套信源叙事,抓住了一个真实的竞争动态,只是它的确定程度超出了证据所能支撑的范围。
证据能支撑的部分是:恰恰在 OpenAI 展示出算力复利优势的这个时点上,Anthropic 正受制于实实在在的算力约束。2026 年 7 月 20 日,Anthropic 对 Max 与 Team Premium 计划用户正式限量供应 Claude Fable 5,理由是需求超出了可用推理容量。而这发生在它与英伟达签下 45 亿美元 Vera Rubin GPU 容量协议、并积极推进自研芯片之后:8 月下旬,Anthropic 聘请了 Amir Salek —— Google TPU 项目的创始人之一,主持过前七代 TPU —— 专门负责领导其自研芯片计划。
延伸阅读:Anthropic 签下 45 亿美元 Vera Rubin 协议,微软退出 nScale 的西弗吉尼亚园区
@synthwavedd 的爆料明确表示,OpenAI 的内部判断是 Anthropic 手里没有能应对 Astra 发布的可行公开牌,主要就是因为算力受限。这个说法无从核实 —— 它依赖的是爆料者据称掌握的 OpenAI 内部情绪 —— 而 Anthropic 否认任何关于它缺乏竞争容量的说法。CNBC 和彭博的独立报道证实了限量供应确有其事、Vera Rubin 协议也确已签署。仍未确认的是:Anthropic 的处境究竟是结构性劣势,还是只是在它的 GPU 与自研硅投资上线之前的一段暂时紧张。
Anthropic 自身的处境,比「算力短缺」这个框架所暗示的要复杂。截至 2026 年 5 月,公司的年化收入运行率已超过 470 亿美元,且即将进行的 IPO 会让它接触到规模足以迅速填平基础设施缺口的公开资本市场。它 2026 年 2 月发布的《负责任扩展政策》3.0 版,是任何 AI 实验室就「以安全为条件的部署」所做出的最详细的公开承诺 —— 一个明确把模型发布与安全里程碑达成挂钩的政策框架。这个框架究竟会拖慢 Anthropic 对 Astra 的回应,还是会让它在看重治理的企业买家面前占据有利位置,仍是未定之数。
真正要紧的那种不对称,比「整体算力可得性」要具体。OpenAI 现已公开确认 Sol 能自主提升其推理栈的效率,并直接为低层级模型的降价买单。Anthropic 没有披露过可比的能力。Jalapeño —— OpenAI 自家的推理硅 —— 在其自有 AI 模型的实质协助下,用九个月的 RTL 工作完成,只占传统第一代 ASIC 时间表的一小部分。Anthropic 的自研芯片计划则是在一位新聘负责人手下从零开始。这些差距朝一个特定方向复利:模型改进得更快的那家机构,也能更快地设计出更好的基础设施,而这又让那些模型能被更便宜地部署,从而加速用户采纳,进而为下一次训练提供更多反馈。
这就是 Bel 这条爆料若属实所代表的、发生在预训练层的那个闭环。而 OpenAI 已确认的披露,在推理层和芯片设计层上已经把这个闭环演示了一遍。
这套信源叙事没有承认的一点是:算力竞赛并非纯粹的双边战事。据多份业界报道,截至 2026 年 4 月,xAI 已用其 Colossus 2 集群在一个 10 万亿参数模型上完成了约两个月的预训练。Google DeepMind 仍在自家 TPU 基础设施上进行大规模训练,Gemini 3.x 系列在各个层级的基准上都有竞争力。前沿预训练的竞争版图如今至少涉及四家机构 —— OpenAI、Google、xAI,以及在基础设施投资爬坡之后可能加入的 Anthropic —— 每一家都运行在万亿美元级算力承诺的量级上或接近该量级。参数量本身不会决定这场竞争的结果;这些参数被训练、对齐和部署的效率才会。
Tibo Sottiaux 的构想,以及它所需要的基础设施
8 月 24 日,也就是 Bel 爆料浮出水面的前一天,领导 Codex 的 OpenAI 高管 Tibo Sottiaux 接受了科技播客主 Matthew Berman 的长篇访谈,以罕见的直白程度勾勒了 OpenAI 的近期应用路线图。
Sottiaux 确认 Codex 用户数已达到约 2000 万(公司口径的数字),并称 OpenAI 的 Ultra Fast 推理模式目前在特定请求规模下能达到标准处理最高 14 倍的生成速度 —— 他预测这个速度会在一到两年内成为行业默认水平。他把 Sol 优化 Luna 那个闭环形容为递归自我改进的一种早期形态,且是 OpenAI 有意识地设计进开发流程的,而不是偶然撞上的。
Sottiaux 这番描述里结构上最重要的部分,是他对 ChatGPT 与 Codex 走向的说法。他说这两个产品正在收敛成他所称的「个人 AGI」—— 一个单一界面,它会持续维持对用户目标、工作方式和组织语境的理解,并在用户无需指定架构或提示词结构的情况下主动把工作分派给专门化的子智能体。这不是产品经理随口的营销话术:它描述的是一种负载画像,需要的推理基础设施必须能撑住每个用户会话数千次并行的子智能体调用、在长时间跨度上维持大上下文窗口,并在模型层级之间智能路由。
据 OpenAI 在 Hot Chips 上的演讲,Jalapeño 的 pod 架构 —— 2048 颗 ASIC 通过铜与光的混合互连相连,提供 27 exaFLOP/s 的 MXFP4 算力和每秒 32 PB 的聚合显存带宽 —— 正是针对这类智能体式、多智能体负载而设计的。该芯片的本地域架构,把长程智能体任务所需的智能体内通信延迟压到最低。
核实难题,以及它对读者意味着什么
Bel 这条说法没有被 OpenAI 确认,没有任何机构性报道通过独立信源加以验证,仅仅立足于一条社交媒体帖子 —— 无论其作者多么可信。读者应当对任何把「10 万亿参数」当作既定事实来处理的分析施加相应的折扣。
能有把握说的是:围绕它的背景是真实的,而且异常密集。在 8 月 24 日到 30 日这六天里,OpenAI 披露了一个效率领先经独立验证的自研芯片架构,一位 Codex 高管公开描述了一个运转中的 AI 自我改进闭环,同一位高管还勾勒了一条需要远超今天任何公开部署之物的基础设施才能支撑的应用轨迹。Bel 的爆料正落在这串事件的中间。这个时点是巧合,还是来自 OpenAI 周边的刻意叙事管理,无从得知。清楚的是:整幅图景 —— 而非那条未经证实的传闻本身 —— 描绘的是一家其内部能力对其公开产品发布拥有实质领先的公司。
伴随这一时期的高管离职 —— COO Brad Lightcap 与首席营收官 Denise Dresser 均于 2026 年 8 月中旬离开,此前领导 OpenAI 应用部门的 Fidji Simo 已在 7 月因健康原因退居幕后 —— 增加了一层组织复杂度;这不影响技术层面的判断,但与 OpenAI 如何执行这些判断有关。安全条线的人员流失更为尖锐:就在自家模型触发《准备度框架》关键阈值的同一段时间里,公司失去了它唯一一位专职伦理学家、其安全系统负责人,以及对齐团队的领导层。联合创始人兼总裁 Greg Brockman 接过了产品战略的职责。至于在组织层面,究竟由谁对「Bel 被宣称的规模」与「用来评估它的安全设施」之间的落差负责,技术图景没有给出答案。
接下来要盯的三件事:Astra、IPO、核实
有三个近期事件,会决定 Bel 这幅图景最终是被证实还是被推翻。
第一是 Astra 的发布。OpenAI 在 8 月 1 日把 Astra 称为其「下一个主力模型」,不到一周就暂停了关键的强化学习训练。由关键网络安全阈值评估触发的安全审查仍在进行。一个独立解出了十道长期悬而未决的开放数学问题、解答随后在 Lean 4 中得到验证,且可能有能力自主开发零日漏洞利用的模型,代表着一种没有先例的部署挑战。Astra 的公开发布时间表,将取决于 OpenAI 能多快落实那套它自己都说需要从头重建的隔离与监控保障。
第二是两家公司的 IPO 进程。OpenAI(目标估值约 8520 亿美元)和 Anthropic(报告的收入运行率超过 470 亿美元)都在筹备公开上市。IPO 阶段的 S-1 招股书披露,会要求两家公司就模型能力、安全实践、算力承诺和财务预测给出比以往公开得多的具体信息。如果 Bel 是真的、且对 OpenAI 的竞争地位有实质影响,它可能需要作为该流程的一部分被披露 —— 那将是外界第一次获得对这条说法的经核实的观察。
第三是 Astra 最终发布之后的独立基准测试。如果 Astra 在完成后训练、通过安全审查、向研究社区开放之后的实际表现,展现出相对 Fable 5 和当前 GPT-5.6 系列的质变式领先,那将与 Bel 的预训练说法一致,也会大幅增强它的可信度。如果 Astra 发布出来只是一次增量更新而非代际跃迁,那么「10 万亿参数」这个框架就需要被重新审视。
就目前而言,Bel 这条说法所处的认知类别,与大多数前沿 AI 预训练传闻并无不同:由可信但无法核实的信源断言,与已知的基础设施投资和机构行为相符,且在没有 OpenAI 内部系统访问权的情况下无法证实也无法证伪。让这一刻区别于以往 OpenAI 模型传闻的,是那一层独立确认的旁证之厚 —— 它让这条说法在结构上是可信的,而不只是想当然的。