MIT 证明:1/3 缩放定律源于注意力集中
训练的瓶颈在注意力头,而不是语言建模输出层

多年来,大语言模型训练损失大致按训练时间的负三分之一次幂衰减 —— L ~ τ^(−1/3) —— 这一经验观察左右了数十亿美元的算力投资,却始终没有一个令人满意的理论解释。麻省理工学院研究者的一篇新预印本主张,这个指数不是巧合,也不是训练数据的统计特征,而是 softmax 注意力头学会专门化这一过程的结构性后果。关键在于,团队指认了标准 Transformer 里究竟是哪一部分造成的:不是此前理论所暗示的最终的语言建模输出层,而是网络更深处的注意力头。
这项工作于 2026 年 9 月 26 日发布在 arXiv 上,编号 arXiv:2609.32100,是 Yizhou Liu、Sara Kangaslahti 和 MIT 物理学教授 Jeff Gore 一个系列里的第四篇论文,该系列从架构而非训练数据的性质出发推导神经缩放定律。
为什么 1/3 这个指数一直解释不了
缩放定律社群自 Kaplan 等人(2020) 以及 Chinchilla 论文(Hoffmann 等人,2022)起就知道,大语言模型的训练损失大致按幂律随算力、模型规模和数据集规模缩放,指数接近三分之一。Chinchilla 测得数据集规模缩放的指数约为 0.28、参数规模缩放约为 0.34 —— 接近三分之一,但从未由第一性原理推导出来。
占主导地位的解释指向训练数据:自然语言服从齐普夫频率分布,而幂律形式的输入,据说会产生幂律形式的学习曲线。问题在于,这种说法把指数变成了数据集统计的偶然产物,而不是一个可预测的架构性后果 —— 而且它没有给出如何改变这个指数、或者它是否被模型设计所固定的任何指引。
Liu 等人的这个系列走了一条不同的路,从训练目标的几何和网络非线性运算出发推导缩放定律,不对数据分布做任何特定假设。
一个 softmax 头如何生成 1/3 幂律
核心的数学洞见适用于任何通过交叉熵训练、要产生一个尖峰输出分布的 softmax 函数 —— 也就是概率质量集中在一个或少数几个选项上的分布。
在 Transformer 的注意力头里,这是学习的正常终点。一个已经专门化去检测 —— 比如说 —— 特定 token 之间句法依赖的头,对相关输入必须把几乎全部注意力权重路由到那些 token 上。产生这样一个尖峰分布,要求 softmax 之前的 logit —— 也就是查询向量与键向量之间的原始点积分数 —— 在量级上变大。反直觉的是,除非底层的 logit 很大,softmax 分布无法变得很尖,因为 softmax 的指数归一化会压平中等大小 logit 之间的差异。
研究者从数学上证明,softmax 的指数归一化与交叉熵的对数梯度之间的相互作用,使得 logit 量级在训练过程中按 τ^(1/3) 增长,其中 τ 是训练时间。他们称之为 logit 冷度的一个量 —— 衡量注意力分布的尖锐程度 —— 沿着同一条轨迹增长。与这个头相关的损失因此按其倒数衰减:L ~ τ^(−1/3)。这一结果在该系列的一篇早期论文里针对单个 softmax 头得到过证明,该论文已被 ICML 2026 接收。2026 年 9 月的这篇新论文处理的是真实 Transformer 里会发生什么:其中含有许多 softmax 运算 —— 横跨多层的几十到几百个注意力头,外加把隐状态映射为词表概率的最终语言建模头。
起约束作用的瓶颈:为什么是注意力头,而不是语言建模头
在含有多个 softmax 的系统里,整体训练损失由收敛最慢的那个 softmax 组件主导 —— 起约束作用的瓶颈。如果所有组件都以同样的 τ^(−1/3) 速率收敛,整体损失也遵循 τ^(−1/3)。但如果不同组件的收敛速率不同,最慢的那个决定了经验训练曲线中出现的指数。
新论文要回答的问题是:在一个真实的 LLM 里,哪一个 softmax 是瓶颈 —— 注意力头,还是最终的语言建模头?
直觉上的答案可能偏向语言建模头,因为它必须在数以万计的词表 token 上产生正确的概率分布。但研究者主张,并利用 EleutherAI 的 Pythia 开源 LLM 家族 作了经验展示,这种直觉是错的。语言建模头的输出分布在训练中往往不会变得像注意力头的分布那样尖 —— 或者它的 logit 量级以不同的速率增长 —— 这让注意力头成为收敛更慢的、占主导地位的瓶颈。
团队在许多训练检查点上测量了各类头的 logit 冷度,这些检查点可通过 Pythia 公开发布的中间状态获得。经验拟合证实了理论预测:注意力头的 logit 冷度按 τ^(1/3) 增长,并主导了整个模型的收敛速率。
一个从第一性原理解释宽度、深度和时间的系列
这篇论文是一项系统性研究计划中的第四篇,这项计划或许是深度学习理论近来最有野心的成就。第一篇在 NeurIPS 2025 获最佳论文亚军,它从 表示叠加 推导出宽度缩放(损失 ~ m^(−1))—— 过参数化的网络把多个特征塞进共享的激活方向。第二篇(2026 年 2 月)从跨层的集成平均推导出深度缩放(损失 ~ ℓ^(−1))。被 ICML 2026 接收的第三篇,则针对单个 softmax 系统证明了 τ^(−1/3) 时间缩放。
四篇论文合起来主张:Chinchilla 的缩放指数 —— 在三条坐标轴上都接近三分之一 —— 不是各自独立的经验巧合,而是同一套架构力学的不同印记,不需要对数据统计做任何假设。
这对算力策略和架构设计意味着什么
把原因归到架构上,带来一个具体的含义:要改变训练时间的缩放指数,就得改变注意力头形成集中分布的方式。注意力效率研究中探索过的那些干预 —— 比如用熵正则鼓励平坦的注意力分布、用 logit 封顶防止 logit 量级失控增长,或者用 sigmoid、线性注意力之类的替代品取代 softmax —— 原则上可能改变这个指数,尽管论文并不包含干预实验。
研究者还指出,如果专家混合路由门的门控网络产生的是尖峰路由分布 —— 也就是大多数 token 被路由到一小部分专家 —— 那么它们与注意力头属于同一个理论类别。若是如此,MoE 训练曲线将表现出同样的 τ^(−1/3) 时间缩放,这个预测仍有待在大规模 MoE 系统上经验检验。
对使用 Chinchilla 算力最优训练策略的从业者,这篇论文为一个此前仅靠曲线拟合的实用数字提供了理论支撑。三分之一这个指数现在可以从架构推导出来;如果你的模型含有在训练中专门化的标准 softmax 注意力头,就应当预期这个指数。
局限,以及独立验证需要什么
截至发稿,这篇论文是预印本,尚未完成正式同行评审,不过该系列此前三篇都通过了 NeurIPS 和 ICML。经验验证依赖 Pythia 套件 —— 一个口碑很好的开放基准 —— 但 Pythia 覆盖的是特定的模型规模范围和一种训练数据分布(The Pile)。这一瓶颈的指认在其他主要 LLM 家族中是否成立 —— 带分组查询注意力的 GPT 式纯解码器模型、用 RoPE 位置编码的 Llama 式架构,或者头配置异构的模型 —— 尚未得到独立确认。
理论框架还做了一个干净的假设:收敛最慢的头决定整体指数,这在各头的收敛速率足够分开时成立。在多个头竞争充当瓶颈的架构里,结果可能是一个加权或复合的指数,而不是干净的三分之一。
在其他模型家族上对 logit 冷度测量做独立复现,将大幅加强论文的主张。鉴于该系列的过往记录,这样的复现看来很可能在发表后的几个月内出现。
如果这个框架得到证实,这一发现将标志出一条概念上的界线:Transformer 里的神经缩放定律,反映的不是世界的统计结构,而是架构在求解它自己的优化问题时留下的印记 —— 一种从第一次前向传播起就写进 softmax 函数与注意力机制里的数学必然。