TrimSFT 聚焦中等置信度 token,在 MATH500 上提升 26.9 分
增益在 Llama、Qwen 和 DeepSeekMath 系列、1.5B 到 8B 参数规模上都成立

达特茅斯学院的一支研究团队推出了 TrimSFT —— 一种改进的监督微调方法,把学习信号集中在对模型真正有教益的 token 上:那些它还没掌握、但有望学会的 token。通过有选择地压制难度谱两端的梯度更新,这一方法(已被 EMNLP 2026 接收)在 MATH500 上相对标准监督微调最高提升了 26.9 分。这一提升既不需要参考模型,也不需要额外的前向传播 —— 开销远低于与之竞争的各种后训练方法。
这篇论文题为《SFT 究竟该学哪些 token?数学推理的 token 裁剪视角》,于 2026 年 9 月 9 日提交至 arXiv,作者为 Yaning Jia、Chunhui Zhang、Wenxuan Xu、Xingjian Diao、Xiaoyuan Wang,以及资深作者 Soroush Vosoughi —— 达特茅斯计算机科学副教授,MIT 博士,曾获谷歌和亚马逊的研究奖项。
标准监督微调的结构性缺陷
要理解 TrimSFT 为什么重要,得先弄清标准 SFT 在 token 层面实际在做什么。语言模型做监督微调时,训练目标是交叉熵损失:对每个训练样本中的每个 token 位置,模型对正确 token 的预测概率离 1.0 有多远,就受到多大的惩罚。关键在于,这个损失对每个 token 一视同仁地施加,不管模型在训练开始前是否已经预测对了。
这种一视同仁造成了两种不同的低效。第一,对于模型已经掌握的 token —— 对正确 token 的预测概率已经很高的那些 —— 持续的训练压力会推向过度锐化,让模型对自己早已捕捉到的模式过度自信,并可能损害泛化。第二,对于超出模型当前能力的 token —— 在模型当前表示下,正确 token 出乎意料到梯度几乎提供不了可用学习信号的情形 —— 损失仍然施加全部权重,于是嘈杂或幅度过大的更新主导了训练,却并没有真正改善模型在这些位置上的表现。
这在数学推理中尤其要紧:一段思维链解答里,既混着模型能轻松预测的结构性 token(记号、运算符、格式),也混着处在模型可学前沿上的真正困难的推理步骤。标准交叉熵对一个平平无奇的右括号和一次关键的代数代换一视同仁。
TrimSFT 的 logit 差高斯权重究竟怎么起作用
TrimSFT 的方案围绕 logit 差(logit gap)这个概念构建 —— 即模型对正确目标 token 的原始分数(logit)与最强的那个竞争候选 token 的原始分数之差。当 logit 差大且为正时,模型已经强烈偏好正确 token;这个位置实际上已被掌握。当 logit 差接近零或为负时,模型不确定,或者干脆预测错了 token。
这篇论文的核心贡献,是在 logit 差这一维度上施加一个高斯形状的权重函数。权重在一个中间间隔值 m 处达到峰值 —— 代表中等置信度区间 —— 并按照带宽参数为 τ 的正态分布形状向两侧衰减。具体来说:logit 差很大的 token 获得很小的权重(容易、已掌握,跳过);logit 差接近零或为负的 token 也获得很小的权重(困难、当前学不会,跳过);logit 差落在中间那片有效区间的 token 获得很大的权重(集中在这里学)。
这种双向裁剪,正是 TrimSFT 与最接近的前人方法的区别所在。焦点损失(focal loss)—— 一种借自计算机视觉的技术,最初为处理密集目标检测中的类别不平衡而提出 —— 是单向的:它降低已分类良好样本的权重,却提高困难样本的权重,放在 SFT 语境下就意味着对那些已经学不会的 token 施加更大的梯度压力。动态微调(DFT)是 Wu 等人近期提出、在后训练圈颇受关注的方法,它用 token 的预测概率而非 logit 差来重新加权 SFT 损失,而且这种重加权是单调的 —— 始终朝一个方向。两种方法都没有同时裁掉两端。
一个关键的实用优势:TrimSFT 不需要参考模型(不像由 RLHF 或 DPO 派生的方法,需要一份冻结的策略副本来做 KL 正则化),也不需要额外的前向传播(不像需要跨多次传播计算比率的重要性采样方法)。高斯权重由标准前向传播中本就可得的当前步 logit 值计算出来。这使它成为对标准训练循环的一处单超参数改动 —— 把高斯权重加进逐 token 的损失缩放,设定 τ,然后训练。
消融实验揭示了一个反直觉的敏感度模式
作者的消融实验揭示了一个值得停下来想想的发现:高斯权重的带宽 τ,远比中心间隔 m 的精确位置重要。在实践中,这意味着一个把有效学习窗口的宽度大致设对的从业者 —— 不太窄、也不太宽 —— 可以容忍窗口中心位置上更多的不精确。直观上也说得通:任何合理的中心都会落在「中等难度」区域;真正要紧的是这条钟形曲线是否足够陡,能真正把两端排除在外。
作者还测试了半裁剪变体:只压制容易的一端(已掌握 token)或只压制困难的一端(当前学不会的 token)、另一端照常训练的配置。与完整的双向裁剪相比,两种半裁剪变体的性能取舍都更差。这一发现表明,两类浪费的梯度更新都会实质性地损害训练动态 —— 只去掉其中一类,只能拿到一部分收益。
六个模型上的基准结果:这些数字意味着什么
MATH500 是 TrimSFT 报告其 26.9 分标题级提升所用的主要基准,它是 Dan Hendrycks 等人开发的 MATH 数据集中精选出的 500 题子集,题目取自美国数学竞赛 —— AMC 10、AMC 12、AIME 等 —— 涵盖代数、几何、数论、组合和微积分预备知识。这些题目要求以 LaTeX 格式逐步推理,被认为比 GSM8K 这类小学水平基准难得多。独立评测平台 Artificial Analysis 会跟踪前沿模型在 MATH500 上的表现,这一基准已成为在推理维度上比较后训练方法的标准信号。
达特茅斯团队在六个基座模型上,把 TrimSFT 与未经修改的预训练基座(不做 SFT)以及三种基线 —— 标准 SFT、焦点损失 SFT(FSFT)和 DFT —— 进行了对比,六个模型分别是 Llama3.2-3B、Llama3.1-8B、DeepSeekMath-7B、Qwen2.5-Math-1.5B、Qwen2.5-Math-7B 和 Qwen3-4B-Base。只测试基座模型、而不测指令微调或对话变体,是一个刻意的实验设计:它降低了先前指令微调带来的混杂影响,让各 SFT 目标能在更干净的条件下单独比较。作者在论文中报告,TrimSFT 在全部六个模型上都是 MATH500 上表现最好的方法;若把评测的五个基准合起来看,它在六个模型中的五个上取得了最佳平均表现。
所有基准结果均为论文作者自报,尚未被外部评测方独立复现。论文被 EMNLP 2026 Findings 接收意味着经过了同行评审,但独立复现通常要在会议发表之后才会跟上。
TrimSFT 在拥挤的后训练版图中的位置
2025–2026 年间涌现出一批异常密集的论文,都在质疑「所有 SFT token 都应同等训练」这一假设。2026 年提出的 InfoSFT 用一条基于熵的加权规则,强调作者所称的「中等置信度」token,从另一个数学起点得出了性质上相似的结论:学习与遗忘之间的取舍,偏向那些有信息量、但并非轻而易举的 token。PEAR 方法(Zhang 等,2026)则换了个角度 —— 优化 SFT 的目标不是 SFT 本身的表现,而是由此得到的 RL 初始化的质量 —— 并证明 SFT 之后的 RL 阶段会显著受到所用 SFT 目标的影响。
这些独立研究方向的汇合,是理解 TrimSFT 的相关背景。它表明,标准 SFT 范式被普遍认为并非最优,这个领域正在积极探索 SFT 目标的哪些性质最为关键。TrimSFT 的具体贡献 —— 以 logit 差作为难度信号,并施加对称的高斯裁剪 —— 为这一方向增添了一个独特且在实证上有竞争力的选项。它与 DFT 的对比尤其有针对性,因为 DFT 在后训练文献中被引用得越来越多:在六个模型中的五个上,TrimSFT 的双向高斯裁剪胜过 DFT 基于概率的单调重加权。
论文没有讨论的流水线含义
当前推理模型的开发实践,把 SFT 当作第一阶段,把强化学习 —— 通常使用 GRPO 或其变体 —— 当作独立的第二阶段。关于 SFT-RL 流水线的研究已经确立:SFT 检查点的质量对后续 RL 表现影响很大。从更强的 SFT 检查点初始化的模型并不总能胜过从较弱检查点初始化的模型,因为过拟合或校准不佳的 SFT 检查点会削弱研究者所称的「RL 可塑性」—— 即模型在基于奖励的训练下进一步提升的能力。
TrimSFT 的论文没有报告「先 SFT 再 RL」流水线的结果,它的实验只单独评估 SFT 的表现。但鉴于 SFT 校准与 RL 可塑性之间已被记录的关系,存在一个合理但尚未检验的假设:TrimSFT 校准得更好的置信度分布,可能比表面准确率相当的标准 SFT 检查点,在下游 RL 中转化出更大的收益。这是一个直接从 TrimSFT 核心主张引出的开放研究问题:它对置信度的重塑更均衡,而不只是更准确。
局限与开放问题
这篇论文只限于数学推理。TrimSFT 在 MATH500 及相关基准上的收益,还不能证明双向 logit 差裁剪在代码生成、指令遵循或其他微调目标上同样有效 —— 那些领域的 token 难度分布可能长得不一样。想把 TrimSFT 用到数学以外领域的从业者,需要自己做验证实验。
论文中列出的代码仓库 —— github.com/karpning/TrimSFT —— 在本文发布时返回 404 错误,说明该仓库尚未公开。它能否进入生产流水线,取决于代码在 EMNLP 2026 终稿流程之后是否放出。
评测也只停留在 1.5B 到 8B 的参数范围内。在 70B 以上的参数规模,梯度动态和 token 难度分布都可能发生变化,双向裁剪原则是否依然成立,论文没有涉及。同样,论文测试的是基座模型而非指令微调或对话格式的变体;logit 差信号在那些设定下的表现可能不同。
唯一的超参数 τ 需要调。尽管作者发现 τ 比 m 更重要,这简化了搜索,但并没有免去搜索。不同的模型家族和训练数据集可能需要不同的 τ 值,这意味着从业者应把这个超参数当作确实需要验证的东西,而不是一个固定常数。
这个领域接下来该关注什么
最近的里程碑,是 TrimSFT 代码的公开发布,以及 EMNLP 2026 的论文终稿,预计在今年秋天稍晚时候。社区复现 —— 在共享基准集上把 TrimSFT 与现有公开基线对跑 —— 将是最重要的验证步骤。如果独立评测方哪怕大致确认了 MATH500 上的收益,TrimSFT 就有一条可信的路径,成为数学推理微调流水线的标准组件。
更大的问题是,logit 差信号能否作为一个有用的难度代理,推广到数学以外。同期关于 token 级重加权的文献 —— InfoSFT、DFT、PEAR 等 —— 各自为「这个 token 应该对训练贡献多少」提出了不同的代理指标。这个领域对哪种信号在跨领域时最有信息量还没有共识。TrimSFT 的双向高斯裁剪,是「有效学习区间两侧都有边界」这一直觉最明确的实现;而这一结果经过了同行评审、在六个模型中的五个上站住了脚,为这一直觉提供了比多数前人工作更坚实的实证基础。