Meta FAIR 研究预测:随着算力扩大,字节级蒸馏将胜过 token 模型
End-Of-Token 训练方法把 logit 存储压缩到五分之一,只用六分之一的数据就能达到 token 模型的准确率

Meta FAIR 与华盛顿大学的研究人员于 9 月 11 日发布了一篇论文,显示把大语言模型的知识蒸馏到字节级学生模型(而非 token 级学生模型)中,预测的性能上限比基于 token 的蒸馏高出 4 个百分点,同时只需六分之一的训练数据就能达到同等准确率。这项研究题为《Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models》(意为「打破 token 天花板:蒸馏出更小、更强的字节模型」),是首个在相同架构、万亿字节训练数据下对字节与 token 学生模型进行的大规模超量训练(overtraining)对比,并揭示了标准离线蒸馏流程中一个很少受到关注的结构性低效问题。
分词给知识蒸馏设下了一道隐形天花板
小语言模型的标准知识蒸馏,是训练一个紧凑的学生模型去模仿更大的教师模型在其词表上的概率分布。教师模型(本研究中为 Llama 3-8B)会在文本的每个位置上,对词表中的每一个 token 预测一个似然分数。Llama 3-8B 的词表包含 128256 个 token。
为每个训练位置存下覆盖 128256 个候选的完整分布是不现实的。一个高质量数据集跑一遍教师模型,如果完整存储,会产生数百 TB 的 logit 数据。业界的标准变通办法是 top-k 截断:只保存概率最高的那些候选(论文采用的阈值是 top-600),其余全部丢弃。学生模型永远看不到教师分布的尾部。
字节级模型预测的是文本的下一个原始字节,而不是下一个子词 token。由于一个字节是 8 位的单位,可能的取值恰好有 256 个。即使再加上几个特殊字符,字节词表也不到 260 项。每个预测位置的完整概率分布大约占 256 个浮点数 —— 不到 top-600 截断 token 分布存储量的一半。论文报告称,在一次万亿字节规模的训练中,字节蒸馏把 logit 存储降到了同等 token 蒸馏所需的约五分之一。
这种存储上的差异并非表面文章。当 token 级学生模型用截断后的 logit 训练时,它得到的只是教师不确定性的一个近似。token 分布的尾部往往编码着有意义的区分 —— 比如「tiramisu」也可能合理地写作「tiramisi」或「tiramisù」。字节蒸馏在小得多的预测空间里就能捕捉到这些区分,而且无需任何截断。
End-Of-Token 对比 Marginalize-It:转换教师知识的两种方法
论文的核心技术贡献是一对方法,用来把以 token 训练的教师模型的概率分布转换成字节级训练目标。两种方法都必须解决同一个根本性的错位:教师在多字节的 token 上做预测,而学生一次只预测一个字节。
较简单的方法叫 Marginalize-It,其做法是沿着真实的字节序列逐个位置推进,在每个位置上汇总所有共享相同字节前缀的教师候选的概率。如果某个训练样本中下一个真实字节是「i」,该方法就把所有以「i」开头的候选 token(isu、isk、is 等)的教师概率加总。当某个候选 token 在序列中途结束时(也就是说,候选「is」已经终止,而真实文本还在继续),Marginalize-It 就不再追踪它,并在仍共享当前前缀的候选之间重新归一化剩余的概率质量。这种方法每个位置只需一次教师前向传播,计算效率很高。它的局限在于丢弃了提前结束的候选 token 所占的概率质量,从而给字节级目标引入了近似。
第二种方法 End-Of-Token 走的是另一条路。它不在候选 token 结束时丢弃概率质量,而是在词表中插入一个特殊的 token 结束标记字节。这样,学生模型就能把「当前 token 在这里结束」作为 257 种可能输出之一明确预测出来。当教师给「is」这样较短的候选分配了概率,而真实文本越过它继续时,End-Of-Token 会把这部分概率质量导向 token 结束符号,而不是扔掉。由此得到的字节级目标在所有位置上都完整保留了教师分布,没有近似。与 Marginalize-It 一样,End-Of-Token 也只需要一次教师前向传播。由于每个 token 边界都会多出一个预测步骤,这个额外的标记字节使训练计算量比普通字节模型增加约 30.94%。
算力越高,缩放定律越偏向字节学生模型
论文的实验设计让六种模型配置彼此对比:三种分词方案(token、普通字节、带 token 结束标记的字节),每种都分别以标准交叉熵监督和从 Llama 3-8B 蒸馏两种方式训练。所有学生模型的 Transformer 主干层数相同,层参数约 12.8 亿;token 学生模型多出一张嵌入表,使其总参数量达到约 18.1 亿。训练最多进行到约一万亿字节。
在算力较低的早期阶段,token 模型学得更快。它们更大的词表能把每句话压缩成更少的预测步骤,这意味着模型每消耗一个训练 FLOP 能看到更多语义内容。字节模型起步较慢,因为它们必须一个字节一个字节地预测每个字符。
随着算力增加,趋势发生了逆转:token 模型率先进入平台期。论文的缩放分析拟合了从每字节比特数(bits-per-byte)损失到下游任务准确率的曲线 —— 前者是一种与分词方式无关的预测指标,把性能统一归一到字节级单位 —— 下游任务涵盖多项选择问答、语言生成和机器翻译等八项基准。把这些曲线外推到更高算力,缩放定律预测的渐近准确率上限如下:token 蒸馏为 48.4%;Marginalize-It 蒸馏为 50.5%;End-Of-Token 蒸馏为 52.4%。普通字节监督模型为 51.2%。这些是作者报告的缩放外推值,并非在相应算力水平上经实证验证的结果。
这些数字中有三点值得细看。第一,End-Of-Token 蒸馏比 Marginalize-It 高出近 2 个百分点,论文将其归因于 Marginalize-It 在 token 边界丢弃概率质量时损失的信息。第二,尽管有蒸馏信号,Marginalize-It 的上限实际上还低于普通字节监督模型 —— 这一结果与如下假设相符:Marginalize-It 中的近似误差抵消了拥有教师模型的优势。第三,End-Of-Token 比 token 蒸馏高出 4 个百分点:对于 20 亿参数以下这一级别的模型来说,这是有意义的差距,因为 Meta、谷歌等公司在这一级别的竞品彼此只相差几个百分点。
论文还报告了数据效率上的优势。据预测,End-Of-Token 蒸馏只需约六分之一的训练数据,就能达到与 token 蒸馏相同的下游性能。对于离线蒸馏流程(在学生模型训练开始之前,先预计算并存储教师的 logit 输出)而言,这意味着即便算力优势尚未显现,字节方法在存储和数据方面的运行成本也已经更低。
这项研究在 Meta FAIR 更大的字节建模计划中处于什么位置
研究团队与 Byte Latent Transformer(BLT)的作者有大量重合 —— BLT 出自 Meta FAIR 与华盛顿大学的一篇论文,于 2024 年 12 月发布,采用了另一种方式来消除分词。BLT 直接在原始字节序列上训练模型,以下一个字节的熵作为切分信号,把字节动态组合成长度可变的块(patch)。在 80 亿参数、4 万亿训练字节的规模上,BLT 首次追平了采用 BPE 分词的 Llama 模型的性能,证明了大规模无分词器预训练是可行的。
这篇新论文针对的是另一个实际问题。以生产规模从零预训练一个字节模型代价高昂 —— BLT 的实验消耗了 4 万亿字节,并需要大量 GPU 基础设施。从现有 token 模型蒸馏则便宜得多:它复用教师模型已经训练好的表示,而不是从零学起。Bao、Leng 等人 2026 年 2 月的一篇论文也探索过通过两阶段课程,把预训练好的 token 大语言模型转换为字节级模型,结果表明 Llama、Qwen 和 OLMo 只需约 1250 亿字节的蒸馏就能保留大部分能力 —— 远少于从零预训练。
2026 年 9 月的这篇论文并不转换预训练模型;它是在从 Llama 3-8B 教师模型蒸馏的同时,从零开始训练字节学生模型。它的贡献在于首次确立了这种训练范式下缩放定律的形态 —— 并表明这些定律预测:随着算力增加,字节蒸馏的能力上限高于 token 蒸馏。
性能差距尚未解决的地方
这项研究最重要的悬而未决的问题是推理成本。训练时,End-Of-Token 把每个 token 边界当作一次额外的字节预测来处理,使单位文本的计算量比普通字节模型增加约 31%。推理时,字节级自回归模型同样必须一次生成一个字节,而 token 模型平均每个预测步骤能生成约四个字节的文本。这意味着字节模型目前需要更多次前向传播才能生成同样多的文本。
论文明确承认,它没有在同等生成吞吐量下对字节模型和 token 模型的推理成本做过公平比较。End-Of-Token 蒸馏的渐近性能优势,是在同等训练算力下的预测,而不是在同等推理延迟或同等推理 FLOP 预算下。一个在下游任务上准确率高 4 个百分点的字节模型,在计入更高的推理成本之后是否仍有竞争力,是这项研究留下的核心未解问题。
第二个局限是,外推得到的准确率数字(End-Of-Token 为 52.4%,token 蒸馏为 48.4%)并未在曲线交叉处的算力水平上经过实证验证。交叉点预计出现在 6.33×10²² FLOPs。这种外推依赖幂律拟合,而幂律在已观测范围内吻合良好,到了更大规模却可能出现偏离。科学评审服务 Pith 的一份独立评审肯定了论文的技术贡献,同时指出,标题性的 4 个百分点渐近优势这一说法建立在外推之上,而作者自己在附录 E 中也标注了这种外推并不稳固。
论文的缩放定律还预测,End-Of-Token-1B 将在渐近意义上分别以最多 6.5、8.1 和 2.1 个百分点的优势超过 Llama 3.2-1B、Gemma-3-1B-pt 和 Gemma 2B。这些预测带有同样的前提:它们基于缩放曲线,而不是在匹配推理预算下的并排评测。
缩小推理差距意味着什么
如果未来的工作能够解决推理开销问题 —— 借助投机解码、多字节预测头,或能批量处理字节预测的分层架构等技术 —— 字节蒸馏方法可能会重塑从业者对小模型设计空间的思考方式。
目前构建有能力的 20 亿参数以下模型,范式无非两种:要么投入大量算力训练(如 Llama 3.2-1B 和 Gemma-3-1B-pt),要么从同一分词体系的更大模型蒸馏。两条路径都受制于同一个 logit 截断问题。一套字节蒸馏流程,以五分之一的成本存储完整的教师分布,只需六分之一的训练数据就能追平,并预测拥有 4 个百分点的上限优势,这提供了一种结构上不同的权衡 —— 它有利于数据和存储预算受限的机构,而非那些 GPU 时长不受限制的机构。
论文作者承认,在把字节蒸馏推荐为生产策略之前,这个领域还需要一次控制了推理成本的比较。在这样的基准发布之前,End-Of-Token 仍是现有方案中预测上限最高的方法,也是目前最有力的论据,说明分词不只是一份工程遗产,而是在实实在在地限制蒸馏出来的小模型能吸收哪些知识。