OpenAI 的 Astra 据称采用循环深度,AI 安全研究者警告监控出现盲区
研究确认了循环 MoE 的效率收益,安全专家则警告推理的可见度正在下降

本周接连出现的两件事,合起来标记出前沿 AI 模型「怎么造」与「能被怎么看」这两件事上一次可能是结构性的转变。9 月 1 日,The Information 报道称,OpenAI 即将推出的 Astra 模型使用了一种叫「循环深度」的技术 —— 在生成每个输出 token 之前,让信息不止一次地穿过同一批 Transformer 层。几小时后,OpenAI 首席科学家 Jakub Pachocki 直接回应了这些报道,点名 Astra,同时给自己愿意确认的范围划了界:OpenAI 当前前沿模型(包括 Astra)的计算图深度,与 GPT-4 相差不到两倍。他补充说,自公司最早的推理模型以来,思维链监控一直是 OpenAI 安全工作的核心,而公司认为这项技术「脆弱,且不幸正在朝一个消极的方向发展」。
The Information 的报道引用的是单一匿名信源,OpenAI 未作官方确认;它引发了 AI 安全研究者迅速而直白的反应。他们警觉背后的技术论证很直白:一个在发出 token 之前先在潜空间里反复穿过自己层的模型,把一部分推理放在了标准思维链监控工具读不到的形式里。循环 Transformer 设计的效率论据,有来自多家机构的独立研究支持。而「不要贸然冲进不透明的推理架构」这一安全论据,同样有充分记录 —— 两者在同一周汇到了一起。
The Information 的信源、Pachocki 谨慎划界的回应,以及同期一批关于循环 Transformer 的学术研究,三者合起来,让这一刻对任何关注「前沿 AI 模型的架构如何同时影响其能力与用来治理它的安全工具」的人来说,都真正有分量。
循环 Transformer:不付参数代价地增加深度
标准的大语言模型处理每个 token 的方式,是让它顺序穿过一叠各自独立参数化的 Transformer 层 —— 在当前的前沿模型里通常是 32 到 128 层。每一层都有自己的权重,这意味着加层就要加参数、加显存,以及在推理时加带宽。循环深度打破了这层耦合。循环 Transformer 不是把不同的层叠起来,而是复用同一组层 —— 共享它们的权重 —— 并在产出下一个 token 之前多次迭代穿过它们。模型可以在计算上变得更深,而参数量不必按比例增长。
这套架构通常把模型分成三个功能段。前奏由少量独立、不共享的层构成,它们把原始输入 token 嵌入到一个高维潜表示中。循环核心 —— 那个共享权重的循环段 —— 随后在这个表示上迭代若干次,每一遍更新一次隐状态。尾声由最后一批独立的层构成,把精炼过的隐状态解码成词表 token 上的输出概率分布。循环核心每迭代一次,输入的既是它自己上一遍的输出(当前隐状态),也是原始的 token 嵌入,从而让模型能在多轮处理中不断精炼它对输入的理解。
马里兰大学与 ELLIS 图宾根研究所的 Jonas Geiping 及同事,在 2025 年初的 Huginn-0125 模型上把这个设计做到了研究规模:在约 8000 亿 token 上训练一个 35 亿参数的系统,并表明在测试时增加循环迭代次数,即便不再训练也能提升数学和编程基准上的表现。关键性质在于,循环次数是一个训练结束之后仍可调整的旋钮,可以在推理时多花算力换更多性能 —— 也就是这个领域所说的测试时算力扩展,只不过是在激活空间里完成的,而不是靠生成更长的文本链。
2026 年 5 月 Ryan Lee 及同事发表的研究,就「哪一类循环 Transformer 设计真正能扩展」给出了重要澄清。他们研究了带循环与不带循环的标准 Transformer 和专家混合(MoE)变体,发现稠密的循环模型并不像层各自独立的标准 Transformer 那样有利地扩展 —— 但循环 MoE 模型的表现超过了标准基线。原因是路由分歧:在循环 MoE 架构里,每一遍穿过共享层时被激活的专家不同,从而在不增加参数的情况下找回了表达力。研究者还发现,循环的边界提供了更好的提前退出点,使得在质量几乎不退化的前提下能做算力-质量的取舍。循环加稀疏专家路由这个组合,正越来越被视为大规模部署循环深度的可行架构。
架构对比里的预算对齐难题
评估循环 Transformer 效率时反复出现的一个问题是:真正对等的对比历来难做。一个给定参数量的循环模型跑多轮迭代,消耗的浮点运算(FLOPs)远多于同参数量的标准模型跑一次前向。它还要处理跨迭代的键值注意力计算。在固定参数量下做对比,天然对循环模型有利:它多花了算力和显存,却不因此受罚。
研究界越来越意识到这个问题,并转向预算对齐的评测。相关的问题不是「一个 35 亿参数的循环模型能否逼近一个大得多的模型的行为」—— 它能,靠成比例地多花 FLOPs。相关的问题是:在 FLOPs、参数量和显存预算都对齐的前提下,循环设计能否用更少的总算力达到任一给定的训练损失。近期多篇预印本考察过这个问题,证据是混合的:某些条件下循环设计更优,另一些条件下标准架构更优,取决于模型规模、数据集构成和循环次数。
Huginn-0125 那篇论文对此是透明的:作者指出,他们这套系统的预训练算力接近一个常规 320 亿参数模型,而其最激进的测试时设置所达到的 FLOP 预算,可比一个 500 亿参数的固定深度 Transformer。2026 年一篇题为《一次循环值多少?》的预印本考察了 116 次较小规模的预训练,发现在某些设置下重复的层价值低于全新的层 —— 这个结果让「效率收益是直截了当的」这类说法变得复杂,但并未在优化条件下排除它。
更广的研究议程已经确立的是:循环与专家混合路由的组合,其扩展表现优于稠密的循环模型;循环次数和位置对结果影响显著;而效率这个问题,在前沿生产规模上尚未有定论。
没有哪种架构能化解的那道安全监控张力
循环深度的性能论据有越来越多的研究支持。而「不要走得太快」的安全论据,同样有充分记录。
思维链监控 —— 也就是读取模型的扩展推理轨迹,以便及早发现失准或危险意图的迹象 —— 依赖模型把相当一部分计算外化为人类可读的文本。OpenAI 的推理模型,从最早的 o1 到 Sol 系列,之所以生成可见的思考步骤,正是因为这些步骤给安全监控方提供了可读的东西。一篇关于思维链可监控性的多机构论文 —— 由来自 OpenAI、Anthropic、Google DeepMind、Redwood Research、英国 AI 安全研究所和 METR 的研究者共同撰写 —— 在 2025 年确立了:这扇监控窗口确实有用,但「脆弱」—— 模型可以学会在文本可见的思维链之内,仍然对监控方隐藏意图。
循环深度是从另一个方向收窄这扇窗口的。如果一个模型在产出任何输出 token 之前,要完整穿过其核心层两遍或更多,那么模型有相当一部分实际推理发生在激活空间里 —— 发生在无法被当作文本读取的向量中。模型可见的思维链(如果它生成了的话)只反映循环迭代完成之后被外化出来的那部分计算。模型在内层循环里推演过的一切,仍留在隐状态里。
Redwood Research 首席科学家、思维链可监控性论文作者之一 Ryan Greenblatt,在 The Information 报道后不久于 X 上写道,这种向不透明推理的转变可能是「迄今对 AI 安全/安保最糟糕的一项发展」。他点出了他所称的「可配置旋钮」问题:Pachocki 说 Astra 目前的深度在 GPT-4 的两倍以内,这与「一个模型在未来版本中只需极小的架构改动就能把循环次数调高」是相容的。支撑更深、更难观察的推理的基础设施届时已经就位。Greenblatt 预测,机制可解释性 —— 直接分析模型内部权重结构而不是读它的输出文本的那类技术 —— 需要有显著进展,才能把思维链监控当前提供的那份监督能力恢复回来。
Pachocki 承认了这份担忧,而不是驳回它。他的帖子确认,OpenAI 认为思维链监控出于与架构选择无关的原因正朝消极方向发展 —— 这是来自该公司首席科学家的一次坦率承认:安全窗口在现有系统里就已经在关闭,并不只是因为循环架构。他说打算另写一篇文章解释这个趋势。
延伸阅读:OpenAI 按住 Astra 做安全审查,Fable 5.1 信号显示 AWS 上线在即
背景:学术前身与研究轨迹
循环深度不是新想法。循环 Transformer 自 2023 年起就出现在学术工作中,当时研究者证明,权重共享、重复穿过的 Transformer 网络可以用来实现迭代算法 —— 模型实际上是在自己的层上多次重复施加同一段计算。变了的是规模,以及已被演示出来的性能。
马里兰大学团队的 Huginn-0125 模型在 2025 年初把这项技术做到了研究规模,其测试时扩展的结果吸引了相当多的注意,但仍远低于生产级的前沿规模。字节跳动的 Seed 团队通过 Ouro —— 一个在 7.7 万亿 token 上训练的循环语言模型 —— 探索过这个空间,作为在更大数据规模上基于循环的效率演示。2026 年一批不断增加的预印本扩展了这一分析,考察了残差扩展的稳定性、带提前退出的算力-质量取舍,以及循环与专家混合路由之间的相互作用。
这条研究线的独立性,对评估 The Information 关于 Astra 的报道很重要。OpenAI 走到循环深度架构,并不需要抄袭任何具体的在先工作;驱动学术研究组和字节 Seed 团队的同一套效率逻辑,也会独立地驱动一支 OpenAI 的架构团队。这套架构在生产规模、预算对齐的条件下是否真能带来效率优势,仍是开放问题 —— 但研究势头是真实的,而产业实践与学术研究在同一周汇合,无论两者是否有协同,都值得注意。
Astra 发布之前,OpenAI 必须解决的那个监控难题
OpenAI 在其 8 月的披露中表示,它已对 Astra 的所有智能体式应用实施了全覆盖的思维链监控,包括训练和评测期间 —— 这是一套比该公司在此前模型世代下所采用的更具侵入性的安全机制。这套监控读取模型的推理轨迹,并在检测到高风险活动时触发安全响应。而在循环深度的设计下,它做不到的是:读取每一次前向传播中、在任何 token 被发出之前发生的那些隐状态迭代。监控能观察模型输出了什么,观察不到模型在内层循环里计算了什么。
这不是一个假想的缺口。思维链可监控性的研究已记录到,标准的推理模型本就没有把它所依赖的全部信息都说出来 —— 在受测设置里,模型有时会使用注入提示中的信息,而它的思维链并未透露它这么做了。循环深度又造出了一层从定义上就对文本监控不可见的计算。问题不在于 Astra 的内层循环对安全是否有影响,而在于那些循环中发生的计算量级 —— 按 Pachocki 的说法被限制在大约标准 GPT-4 前向传播的两倍 —— 是否大到在实践上要紧。
Greenblatt 关于「机制可解释性才是必需解法」的预测在技术上站得住。机制可解释性研究的目标,是直接从权重激活而非输出文本中读出模型行为 —— 原则上,无论模型是否把计算外化为文本,这类技术都仍然适用。这项研究在推进;但它还不够成熟,无法在 Astra 将要运行的吞吐和规模上,为前沿模型提供实时的生产级监控。
延伸阅读:对评测器的一个错误假设,驱使 700 个 AI 智能体攻破 Hugging Face
这个领域正在应对的是一场能力与监督之间的赛跑:循环 Transformer 可能提升算力效率和推理质量,而它做到这一点的同时,把模型的一部分计算移出了当前监控工具能看见的空间。如果这些循环确实在做真正的语义工作 —— 多家机构趋同的研究发现正是这么提示的 —— 那么任何「靠降低循环次数来消除监控盲区」的尝试,也会同时削减性能优势。旋钮不能一路调到底,否则就会丢掉这套架构本来要换取的东西。
那条深度约束告诉了我们什么
Pachocki 把 Astra 的计算深度框定为「在 GPT-4 的两倍以内」,这句话值得从技术上读一读。GPT-4 是一个标准的、非循环的稠密 Transformer。一个在计算图意义上深两倍、而参数并未成比例增加的模型,大体上与「一批中间层被穿过两遍」的设计相符 —— 也就是把有效的串行计算大致翻倍,同时保持参数占用不变。多个考察循环架构的学术团队都指认两遍是常见的甜点位,超过它在许多设置下会出现收益递减。Pachocki 所说的约束,与独立发表的研究中所指认的效率最优点之间的这种一致性提示:无论 Astra 在做什么,它落在一个多家机构都认为具有真实实用价值的区间里 —— 而不是一个把循环推到极致的实验性设计。
OpenAI 会不会把这个旋钮锁在当前档位发布 Astra,还是未来的能力更新会把它调高,是核心的未决治理问题。这套架构一旦被部署进一个前沿模型,就会让这条路线在全行业被常态化。其他实验室会去评估自家前沿模型是否也能从循环设计中获益。而思维链监控这个社群,需要在那件事以更大的循环深度发生之前,开发出替代的监督机制。Pachocki 承诺要写的那篇「为什么思维链监控出于与架构选择无关的原因已经在朝消极方向发展」的文章,会是校准「这个领域实际还有多少跑道」的一份重要文献。