跨分词器蒸馏失效,元凶是梯度冲突
阿里云研究:严格位置加前 16 反向 KL,胜过复杂的对齐方法

阿里云计算的研究人员发表的研究结果,挑战了过去两年推动跨分词器同策略蒸馏研究的一个核心假设:从分词器不匹配的位置找回监督信号,会让训练更好。在 2026 年 10 月 6 日提交到 arXiv 的一篇预印本中,该团队报告称事实恰恰相反 —— 在不匹配的 token 组上加入基于跨度(span)的监督,会持续降低准确率,而原因是梯度冲突,不是对齐策略本身有什么缺陷。这篇论文「Rethinking Cross-Tokenizer On-Policy Distillation」(重新思考跨分词器的同策略蒸馏)已在 arXiv 上公开。
这个结果对在互不兼容的模型家族之间构建蒸馏流水线的从业者和研究者有直接影响 —— 随着 Qwen、Phi、Llama、Gemma 和 IBM 的 Granite 各用各的专有分词器,无法用常规的词表匹配方法配对蒸馏,这种场景在运营上已经无法回避。实际的利害关系不小:把推理能力从一个大型前沿教师模型迁移到一个更小的、领域适配的学生模型,支撑着企业模型部署中相当大的一部分,而教师和学生越来越多地来自不同的组织谱系,词表完全不兼容。
跨分词器 OPD 必须解决的问题
同策略蒸馏(OPD)让学生模型在自己采样的输出上训练,同时由更大的教师模型逐 token 提供反馈,通常以 KL 散度信号的形式。这种做法由 2023 年的 MiniLLM 确立,避开了标准知识蒸馏的一个核心问题:学生在教师生成的文本上训练时,学会的是从教师的错误中恢复,而不是从自己的错误中恢复,这种会累积的失败叫作暴露偏差,大致随序列长度的平方增长。OPD 始终把监督建立在学生自己的 rollout 上,从而消除了这种不对称。
困难出现在教师和学生使用不同分词器的时候。分词器不只是一张查找表 —— 它决定了任何一段文本如何被切分成离散的 token,这意味着同一个句子在不同模型下可能产生完全不同的预测步骤序列。Granite 教师处理「calculation」这个词时可能产生一个 token;Phi-4-mini 学生可能把同一个词拆成两三个。在那个边界上,教师的下一 token 分布和学生的下一 token 分布描述的已经不是同一个预测问题。教师的概率质量分布在学生词表里根本不存在的补全上,反之亦然。
从数量上看,主要模型家族之间的词表交集往往小得出人意料。静态 Jaccard 重叠度 —— 同时出现在两个词表中的 token 所占比例 —— 在这篇核心论文研究的模型对中大约在 39% 到 65% 之间。原则上,这使得在朴素的共享词表匹配下,每个生成序列中有相当一部分得不到教师的直接监督。阿里的研究者要回答的问题是:找回这部分缺失的监督值不值得增加的复杂度 —— 以及过去两年发表的那些找回方法是否真的有帮助。
自 2024 年以来,这个领域的主流回应是:想办法找回那些丢失的监督。在字节级对齐。构建投影矩阵。使用最优传输。找到两个分词器都认同的最细粒度。每一种后续方法都提高了到达学生的教师信号比例。
阿里的研究实际发现了什么
阿里云团队在三对异构的教师-学生组合上 —— 包括以 IBM Granite 为教师,蒸馏到微软的 Phi 和阿里自己的 Qwen —— 做了数学推理和代码生成基准的实验。他们的第一个发现与这个领域的前提相悖:严格的 1:1 对齐组,即单个教师 token 和单个学生 token 恰好覆盖同一段文本区间的位置,已经覆盖了学生生成序列中的绝大多数 token,尽管模型家族之间的静态词表 Jaccard 重叠度只有大约 39% 到 65%。原因在于,推理时的实际输出严重偏向两个分词器处理方式相同的那些 token。常见的数字、标点、高频英文子词,以及换行符和代码分隔符这类结构性 token,都在共享交集里,并且主导着真实生成的文本。论文的表 1 在所有测试的模型对上都显示了这一严格覆盖的发现。理论上的不匹配率很高;rollout 期间的实际不匹配率很低。
论文随后测试了蒸馏损失的两种变体。严格损失只在严格对齐的位置上,对共享词表计算反向 KL 散度。跨度损失则在不匹配组中,对观测到的 token 路径的对数概率加一项均方误差。组合目标按 L₁:₁ + λ · L_span 加权,λ 控制不匹配监督的贡献大小。
在数学和代码基准上测得的准确率结果,始终呈现同一个模式:λ 取任何正值,性能都低于只用严格损失的蒸馏(λ = 0)。跨度损失不只是没帮上忙 —— 它主动让训练变差了。
作为机制的梯度冲突
论文最重要的贡献不是性能比较,而是在梯度层面诊断出跨度损失为什么有害。作者计算了训练过程中各检查点上,跨度损失产生的梯度与严格损失产生的梯度之间的方向一致性。这里的方向一致性指两个梯度向量是否大致指向同一方向 —— 也就是加入跨度监督对模型参数的推动,是否与严格损失已经在做的事情一致。
跨度损失的梯度在整个训练过程中,与严格损失的梯度表现出微弱或负向的方向一致性。更麻烦的是,跨度梯度的相对幅度随训练推进而增大,这意味着随着学生在严格位置目标上进步,冲突信号在比例上变得更响亮。这不是跨度监督提供了有噪声但相容的信号的情况;它提供的是在结构上与可靠的严格位置学习相对抗的信号。
这一发现与 梯度手术(gradient surgery)文献 中指出的一个更广泛的多目标训练问题相联系:当两个损失分量产生相互冲突的梯度时,加入第二个分量可能主动恶化优化轨迹,即便该分量单独来看有充分理由的损失函数。跨度对数概率的均方误差原则上是一个合理的最小化对象;但在实践中,教师的跨度级概率估计是在教师分词与学生分词出现分歧的文本区间上计算的,这使得该监督的噪声大到足以与严格位置上可用的更紧的信号相冲突。
一种更简单的方法,比肩当前最好的方法
论文提出了一种实用的简化,性能优于四种跨分词器基线:在严格位置上,把反向 KL 限制在学生在共享词表中概率最高的前 16 个 token 上,而不是对所有共享 token 计算。这种 top-k 限制有自然的动机 —— 教师信号中的大部分信息来自可能的下一 token 的分布,而概率极低的共享 token 贡献的梯度噪声,与它们对所学分布的贡献不成比例。在 k = 16 时,性能与严格的全词表蒸馏持平,并且在三对模型的数学推理准确率上都优于基线。
这种方法的经济性对部署很重要。像 SimCT 这样从两个分词器都能表达的最细文本粒度构建最小对齐单元的方法,以及 ESCD 这样对部分进入教师 token 组之后的事件集补全建模的方法,每个训练步都需要额外的数据结构和推理时计算。阿里的方法只需要标准的共享词表查找加一次 top-k 排序 —— 这些工作轻松落在与单分词器 OPD 相同的计算预算之内。
2026 年更广泛的竞争背景
过去两年里,跨分词器蒸馏问题吸引了至少六种不同的研究路线,每一种对「对齐」应当意味着什么都有不同的直觉。
MultiLevelOT(2024)和 Universal Logit Distillation 这类最优传输方法,把问题框定为在不要求逐 token 对应的情况下匹配概率分布,把对齐当作一个全局优化问题。这些方法在问答和摘要上表现出色,但主要是在同策略训练范式之外测试的。近似似然匹配(ALM,2025 年 3 月)把跨分词器场景形式化为任意一对分词器之间的似然对齐,并在分词器迁移任务上展示了有竞争力的表现,包括从数学专用模型蒸馏到通用小模型。
字节级蒸馏方法(BLD,2026 年 4 月)走了另一条路:不在子词层面对齐,而是给学生附加一个轻量的字节级解码头,让知识迁移经由一个共享的字节级接口。作者报告了有竞争力的结果,但承认在各基准上的增益并不一致。X-Token(2026 年 5 月)引入了一个稀疏投影矩阵,把每个学生 token 映射到加权的教师 token,并根据关键 token 类型是否落在公共词表之外,在两种损失形式 —— 全投影模式和混合的近似等价匹配模式 —— 之间做选择。
延伸阅读:Meta FAIR 研究预测:随着算力扩大,字节级蒸馏将胜过 token 模型
SimCT 和 ESCD 代表了这篇核心论文之前最新的一代方法。SimCT 认为,严格的共享 token 匹配在不匹配位置丢弃了很大一部分教师信号,并提出在最小对齐的多 token 单元层面做监督 —— 即两个分词器都能表达的最细共享文本续写。ESCD 更进一步,认为事件补全缺口 —— 学生 token 只部分实现教师 token 组时发生的情况 —— 需要对有效补全集合做显式建模,并按教师概率质量加权。ESCD 报告称,使用 Qwen3-32B 教师在代码生成基准上取得了可观的增益,包括 LiveCodeBench 的 pass@2 从 18.1% 跃升到 42.9%。
阿里论文与 ESCD 的关系尤其有启发性。ESCD 用一个梯度一致性指标(COUF)来验证其方法,该指标衡量补全监督与基础蒸馏信号的对齐程度 —— 并报告称,保留事件补全损失使 Qwen 模型对的 COUF 从 0.7383 提高到 0.8495。这篇核心论文从另一个方向运用了同样的逻辑:它的跨度损失梯度与严格损失梯度的方向一致性很差。两篇论文在底层原则上是一致的。分歧在于,是否有任何不匹配组监督能够做到与梯度相容。ESCD 认为可以,办法是在合适的粒度上仔细地对补全概率建模。阿里的论文则认为,领域中常用的 MSE 跨度监督达不到这个标准,而且梯度冲突严重到只用严格训练反而优于增强后的方法。
该方法的不足之处
在论文报告的结果中,代码生成准确率的图景比数学推理更为混杂。严格的全词表 OPD 在代码任务上保持在最佳结果或接近最佳,但没有取得数学基准上那种对基线的一致优势。作者没有把这归因于某个具体机制。一个说得通的解释是,代码生成对不匹配位置的词表覆盖要求更高 —— 对于变量名、缩进和符号运算符,代码的 token 边界在模型家族之间的差异比自然语言文本更系统。如果不匹配组的 token 在代码中比在数学中承载更多语义权重,那么只用严格的方法,可能正在放弃一种在该领域更重要的覆盖。
论文也没有提供改进不匹配组监督的方法 —— 只有证据表明当前的 MSE 跨度损失适得其反。测试的三对模型(都以 IBM Granite 为教师)留下了一个未解问题:这些发现如何迁移到其他架构组合。Granite 到 Phi 和 Granite 到 Qwen 共有特定的结构属性,而一篇考察比如 Llama 到 Gemma 或 Mistral 到 DeepSeek 的论文,会提供更广泛的验证。截至 2026 年 10 月 8 日,arXiv 条目中没有链接代码仓库,独立复现只能依赖论文的方法描述。
这个领域正在收敛的设计原则
在六种相互竞争的路线之间,一个模式正在浮现,而阿里的论文把它说明了:蒸馏中监督分量的正确评价标准是梯度质量,而不是监督广度。ESCD 的 COUF 指标和这篇核心论文的方向一致性分析,衡量的是同一个底层属性 —— 一个辅助损失分量是在强化还是在对抗主要的学习信号。能够证明梯度对齐的方法,像 ESCD 对补全监督所做的那样,才有资格增加覆盖。无法证明的方法,像这篇核心论文对 MSE 跨度监督所展示的那样,不管动机看起来多么直观,都不应增加覆盖。
这一原则的含义超出了跨分词器 OPD。后训练流水线越来越多地组合多个损失分量 —— 监督微调、基于可验证奖励的强化学习、OPD,以及辅助的正则化项 —— 却往往不检查它们之间的梯度方向一致性。最近关于后训练阶段顺序的工作已经表明,这些分量施加的先后顺序会极大地改变性能。梯度质量这个视角表明,组合问题有一个可测量的诊断手段:如果两个损失分量产生持续不一致的梯度,其中一个要么重新设计,要么去掉。
对于目前正在为生产用途权衡跨分词器蒸馏方法的从业者来说,直接的结论很具体:只用严格位置、前 16 反向 KL 的方法实现更简单,计算量与标准 OPD 相当,并且据报道在数学推理任务上与更精巧的对齐方案持平或更好。这种方法不需要辅助数据结构、不需要学习投影矩阵、不需要字节级解码头,也不需要多步的对齐预处理 —— 按作者的说法,它是最小可行的跨分词器 OPD 实现,而他们的主张是:它一直在打败更复杂的替代方案,只是研究者们没有意识到。它在工程团队最在意的代码基准上是否成立,以及能否推广到特定的 Granite 教师架构之外,仍是这篇论文留给领域去解决的开放经验问题。