SFT、RLVR、OPD 顺序错了,数学少 14 分
SFT 预热加教师适配,把在线策略蒸馏的准确率相对提升 50%

Salesforce AI Research、伊利诺伊大学厄巴纳-香槟分校(UIUC)和南洋理工大学的一篇新预印本发现:对语言模型施加后训练各阶段的先后顺序不可互换 —— 而且顺序搞错,可能在不增加任何一步训练算力的前提下,让数学推理准确率损失超过 14 个百分点。这篇题为《理解 LLM 后训练中 SFT、RLVR 与 OPD 之间的协同》的论文于 2026 年 9 月 25 日提交到 arXiv,是第一项系统性的受控研究,考察监督微调、可验证奖励强化学习和在线策略蒸馏在顺序组合时如何相互作用。
为什么阶段顺序会改变模型能学到什么
所涉的三个阶段,各自都已有充分研究。SFT 在精选的(提示词,回答)对上用交叉熵损失训练模型,输出是固定的。RLVR 使用从可验证结果中得到的二元或标量奖励 —— 此处即数学答案是否正确 —— 通过组相对策略优化(GRPO)来优化模型的策略。在线策略蒸馏(OPD)是一种知识迁移方法:学生模型生成自己的回放轨迹,并从教师模型的完整概率分布获得逐 token 的监督,而不是像标准 SFT 那样来自一组固定的采样回答。
论文指出的核心问题是:每个阶段都会实质性地改变学生与教师之间的统计关系 —— 作者称之为学生-教师兼容性。关键指标是反向 KL 散度:学生的输出分布离教师的分布有多远。当学生的策略落在教师给出极低概率的区域时,OPD 期间教师的软标签监督在信息量上就变弱了。OPD 要求蒸馏开始时的反向 KL 散度较低,才能传递可靠的学习信号。SFT 和 RLVR 各自对这道差距做了什么,就是论文的核心发现。
SFT 预热合上了 RLVR 拉开的差距
研究者在九组学生-教师模型对上做了实验,参数量之差从两倍到 53 倍不等,主要学生模型是 Qwen3-4B-Base、主要教师模型是 Qwen3-14B,训练数据集用的是 DAPO-Math-17K。评测用了一批成熟的数学与科学推理基准:AIME 2024、AIME 2025、AMC 2023、MATH-500、Minerva Math、OlympiadBench 和 GPQA-Diamond。
结果在两个方面毫不含糊。第一,在 OPD 之前做一个简短的 SFT 预热,把反向 KL 散度从约 0.40(未经修改的基座模型)降到约 0.10–0.14。这道收窄的差距,让教师的概率分布能够沿着学生的实际轨迹持续给出有用的学习信号。第二,用 RLVR 适配教师模型会提升它的能力,而把这种教师适配与学生的 SFT 预热结合起来,产生了头条结果:基准准确率从普通 OPD 的 29.2% 升到 43.8% —— 据论文作者称,这是在同一份蒸馏算力预算内取得的 50% 相对提升。
完整的收益并非只来自 SFT 预热;真正驱动 29.2% 到 43.8% 这条轨迹的,是「通过 RLVR 提升教师能力」与「通过 SFT 改善学生的学习接口」两者的结合。在论文的主要实验设置里,单独一个简短的 SFT 预热,把 OPD 准确率从 33.6% 提高到 35.4% —— 仍是一个有意义的改进,但要拿到那个戏剧性的完整收益,两项干预缺一不可。
当 RLVR 在 OPD 之前施加于学生时,效应急剧反转。RLVR 把策略推向高奖励的解,使输出熵塌缩,并把概率质量集中在奖励偏好的答案上。这让学生经 RLVR 之后的轨迹偏离教师的分布,把反向 KL 散度重新推回 0.40 附近。研究者发现,先 RLVR 再进入 OPD 的流水线不进反退:学生会忘掉一部分 RLVR 教给它的东西,因为 OPD 把它拉向一个它已经偏离的教师。SFT 造就学生与教师分布之间的对齐;当教师没有被同样地更新时,对学生做 RLVR 会摧毁这种对齐。
在下游强化学习中,OPD 初始化的模型胜过 SFT 起点
延伸阅读:TrimSFT 聚焦中等置信度 token,在 MATH500 上提升 26.9 分
论文的第三个主要发现关乎蒸馏之后模型继续进入更多 RLVR 运行时会发生什么。研究者比较了两种初始化策略:一个经 SFT 为 RLVR 做好准备的模型,和一个经 OPD 做好准备的模型,起点的准确率基线相互匹配。经过 260 步 RLVR 后,OPD 初始化的模型在整个基准套件上达到 38.5–43.1% 的准确率,而 SFT 初始化的模型是 33.4–36.8% —— 论文作者指出,在观察的时间范围内这道分离还在扩大。
机制在于策略熵。OPD 拿学生对着教师的完整逐 token 概率分布来训练,传达的不只是正确答案,还有教师对备选 token 的不确定性。这比 SFT 保留了更高的策略熵 —— SFT 在硬标签的回答上训练,把策略压平到教师的主导模式上。RLVR 开始时更高的熵给了优化器更多的探索空间:RLVR 强化的是来自一个多样分布的正确奖励回放,而一个狭窄、低熵的起点会拉低 RL 能发现的上限。论文指出,这道差距随 RL 算力增加而扩大 —— 也就是说,OPD 的优势不是一次性的偏移,而是随各实验室扩大其 RL 后训练预算而不断累积的。
这些发现如何与前沿后训练流水线对接
2026 年每一家主要的前沿 AI 实验室都在跑多阶段后训练流水线,论文的发现与其中若干在用的架构直接对话。
阿里的 Qwen3 使用四阶段流水线:先 SFT,再 RLVR,然后用蒸馏把经 RL 训练的专家模型合并进一个通用模型。这个合并步骤在结构上与论文的建议一致:蒸馏之前先做 SFT 预热。
DeepSeek-R1 先在思维链推理轨迹上做冷启动 SFT,接着 RLVR,再用拒绝采样的数据做一步二次的、SFT 式的蒸馏。冷启动 SFT 恰好就是论文主张的那种预热。它随后的蒸馏阶段采用 SFT 式做法 —— 在固定的采样输出上训练,而不是在带教师软标签的在线策略回放上训练 —— 这意味着,与完整的 OPD 等价物相比,这个合并阶段作为下游 RL 的初始化可能不够理想。
英伟达的 Nemotron-Cascade 2 采用一个 SFT 阶段接级联 RL,并在整个 RL 过程中插入多领域 OPD,以在模型经过不同训练领域时修复基准上的回退。这种在 RL 内部穿插使用 OPD 的做法,在结构上与论文的发现一致 —— OPD 在学生-教师兼容性得到维持时效果最好 —— 级联架构试图确保这种兼容性永远不会完全丢失。
多教师 OPD(MOPD)模式 —— 多个经 RL 专门化的模型蒸馏进同一个学生 —— 正在成为一种受青睐的合并架构。论文的分析意味着:不论教师数量多少,MOPD 的效果都关键取决于学生在蒸馏开始前是否做了充分的 SFT 预热。
延伸阅读:Meta FAIR 研究预测:随着算力扩大,字节级蒸馏将胜过 token 模型
还有什么没被检验,哪里要谨慎
这项研究是预印本,尚未经过同行评审。它的发现完全建立在 Qwen3 模型家族在数学与科学推理基准上的评测之上。同样的阶段顺序效应,在其他模型家族的架构上、在编程任务上、在多模态流水线里,或者用论文所测的那个具体 OPD 变体之外的蒸馏方法时,是否也会出现,尚未确立。
这套基准 —— 包括 AIME、MATH-500 和 GPQA-Diamond 等 —— 在推理模型评测中可信且被广泛使用,但完全集中在形式化的定量推理上。语言任务、指令遵循和通用知识基准都不在论文的实验范围之内。
论文测试的模型对,参数比从两倍到 53 倍。53 倍是个极端场景,不太反映典型的部署决策 —— 那里学生和教师模型通常相差在 5–10 倍之内。论文没有区分哪些发现在不同参数比范围内都稳健,哪些只属于特定的比例区间。
所有数值结果 —— 包括 50% 的相对提升这个数字 —— 都由论文作者报告,截至发稿尚未被外部研究者独立复现。要让这些阶段顺序的建议被当作一般的工程原则,独立复现,特别是在非 Qwen 模型家族和数学之外的任务上,是不可或缺的。
后训练工程师接下来该盯什么
论文最有实践意义的贡献,或许是这个框架本身:后训练阶段的组合不是一个中性的工程选择,而是一个可以被研究、测量和优化的性能变化来源。此前的工作把 SFT、RLVR 和 OPD 当作相互独立的工具;这项分析确立的是它们相互依存,每个阶段都会改变下一个阶段运行的条件。
如果独立复现证实了 OPD 初始化的优势 —— 特别是这份优势随 RL 算力增加而扩大的发现 —— 对前沿 AI 开发的含义将是可观的。目前在多阶段流水线里使用基于 SFT 的合并的实验室,就有了一个有机制依据的理由去评估把 OPD 作为合并方法,不是因为它在概念上有吸引力,而是因为它保留了后续 RL 轮次所需要的策略熵。同样的熵保留优势能否延伸到偏好优化流水线,或者延伸到在 RL 之外还并用合成数据蒸馏的系统,将是这项工作的一个自然延伸。