SEAD:三层熵引导在线蒸馏,跳过50%Token,数学准确率提升4.8!

SEAD: Competence-Aware On-Policy Distillation via Entropy-Guided Supervision

SEAD:三层熵引导在线蒸馏,跳过50%Token,数学准确率提升4.8! 论文图示

在大型推理模型的部署中,知识蒸馏(Knowledge Distillation)是将数百亿参数模型的强大能力压缩至轻量级模型的核心手段。长期以来,离线策略(Off-policy)蒸馏占据主导地位,即让学生模型在教师模型预先生成的静态数据上进行训练。然而,这种范式不可避免地遭遇了“暴露偏差”问题:学生在推理时一旦犯错,错误便会随着自回归生成不断累积放大。

ArXiv URL:https://arxiv.org/abs/2606.28562v1

为了解决这一问题,在线策略蒸馏(On-policy Distillation, OPD)应运而生。OPD 允许学生模型自主生成回答(Rollouts),再由教师模型对这些回答进行打分和纠正。这种方式甚至能媲美或超越 GRPO 等强化学习方法。

然而,当前的 OPD 方法普遍存在一个致命的结构性缺陷:它们实施的是无差别监督。无论学生处于什么训练阶段,无论面对何种难度的 Prompt,也无论当前生成的是哪个 Token,系统都在机械地计算同样的散度损失。

这忽略了一个常识:教师的监督质量,本质上取决于学生的当前能力(Competence)。如果学生生成的内容支离破碎(能力极差),教师给出的逐词修正往往是无意义的噪声;如果学生对某个词的预测已经十分确信且准确(能力极强),教师再进行指导就是计算资源的纯粹浪费。

为了解决这一三维尺度的算力浪费,一种名为 SEAD(Competence-Aware On-Policy Distillation via Entropy-Guided Supervision)的新型框架被提出。该研究巧妙地将熵(Entropy)作为统一的探针,在 Token、训练阶段和 Prompt 三个层面上动态分配计算资源。通过这一机制,SEAD 不仅安全跳过了约 50% 的 Token 计算,还在 OLMo-3(7B 到 32B)的六个严苛数学基准上,实现了平均 4.8 分的准确率跃升。

核心痛点:无视能力差异带来的三重浪费

在深入 SEAD 的机制之前,我们需要明确为什么“无差别监督”会在 OPD 中造成如此大的代价。本文提出了一个核心假设(Assumption 1:调制 PL 条件),直观来说,梯度的有效信号大小是与学生的能力成正比的。

这种随能力变化的质量衰减,具体表现在三个尺度上:

  1. Token 层面:在生成过程中,大约 50% 的 Token 对于教师和学生模型来说都是确定性的(例如基础语法、连词或极其显然的计算步骤)。对这些 Token 计算梯度毫无信息增益。而在剩余的 Token 中,有些需要锐化(向教师的高概率收敛),有些则需要保持多样性(在推理分叉点探索多种可能)。

  2. 时间层面:在训练初期,学生能力较弱,需要探索更多的高质量解法(需要 Mode-covering 的行为);在训练后期,学生应当集中精力巩固最优解(需要 Mode-seeking 的行为)。现有的方法往往只能靠人工设定生硬的切换节点。

  3. Prompt 层面:如果一道题目远远超出了学生当前的解题能力,其生成的推理轨迹将毫无逻辑可言。在这样的乱码上强制要求教师进行纠偏,产生的梯度不仅无效,甚至有害。

这些看似独立的挑战,实际上都是“忽视监督质量随能力变化”这一根本问题的症状。SEAD 的破局之道在于发现,信息熵能够完美且统一地量化这种“能力”。

SEAD框架总览

SEAD 的三层协同机制

SEAD(稀疏熵自适应散度)通过一套环环相扣的机制,将计算资源精准投放到最需要指导的区域。

第一层:Token 级别的联合熵分区(Sparse Entropy-Adaptive Divergence)

SEAD 抛弃了仅依赖教师或仅依赖学生的单一视角,而是引入了师生联合熵(Joint Teacher-Student Entropy)。通过评估教师熵 $H_{\text{te}}$ 和学生熵 $H_{\theta}$,系统将所有 Token 实时划分为三个区域:

为什么跳过 50% 的 Token 是安全的?

理论分析(Theorem 1)给出了强有力的保证:只要 Zone A 中的 Token 确实满足低熵条件,忽略它们所带来的梯度偏差是极其微小的,完全在可控边界内。这使得模型能在不损失任何有效信息的前提下,省下了一半的反向传播开销。

第二层:能力驱动的时间退火(Competence-Driven Annealing)

随着训练的推进,学生掌握的知识越来越多,Token 的分布也会自然发生偏移。早期,模型经常遇到大家都不确定的情况(Zone C 庞大),需要大量的 FKL 引导探索;而到了后期,学生逐渐追平基础,更多处于“老师懂、学生还有点模糊”的状态(Zone B 占据主导),此时应加大 RKL 的力度以实现收敛。

SEAD 设计了一个基于余弦策略的连续退火调度。散度权重从偏向 FKL 平滑过渡到全面依赖 RKL。这种调度不是盲目的时间衰减,而是建立在学生能力单调增长的假设之上。

第三层:能力门控的课程学习(Competence-Gated Curriculum)

要让上述两层机制生效,必须满足一个硬性前提:学生生成的轨迹必须具备基本的连贯性。如果输入了一道“天书”级别的题目,导致联合熵计算完全错乱,Zone A 的划分就会失效,退火调度也会失去意义。

为此,SEAD 引入了 OPD 领域首个 Prompt 级别的课程学习机制。

在训练前,系统通过让初始学生模型进行多次采样,计算出一个难度系数(即错误率)。在训练过程中,系统设置了一个单调增长的能力阈值。模型只能接触到当前能力阈值范围内的 Prompt。换句话说,SEAD 强制模型从易到难进行学习,确保每一次 Rollout 都具备足够的连贯性,从而为教师提供有价值的评判空间。

机制的共生性(Symbiotic Necessity)

需要特别强调的是,这三个组件并非简单的拼凑,而是互相依存的共生关系

如果没有课程学习(从易到难),毫无逻辑的乱码生成会彻底污染信息熵的计算,导致 Token 级别分区失效;

如果没有 Token 级别分区,单纯的时间退火会因为大量已掌握 Token 的干扰而失准;

如果没有时间退火,固定的散度比例要么导致早期模式过早崩溃,要么导致后期过度探索无法收敛。

这三者形成了一个完美的闭环,层层递进地放大了监督信号的信噪比。

实验结果:以小博大,跨越巨大的能力鸿沟

为了验证 SEAD 的极限,研究团队在两个能力差距显著的模型家族上进行了测试。最核心的实验基于 OLMo 系列:用能力较弱的 OLMo-7B-Instruct-SFT 作为学生,去蒸馏强大的 OLMo-32B-Instruct 教师。

两者在基础能力上存在高达 17.2 分的巨大鸿沟(在多个数学基准上的平均通过率分别为 58.2 和 75.4)。这对任何蒸馏算法都是极大的挑战。

显著的性能跃升

在包含 MATH-500、Minerva-Math、AIME 2024/2025、AMC 2023 和 OlympiadBench 的严苛数学测试矩阵中,常规方法表现得相当挣扎:

SEAD 的完整框架将学生模型的平均准确率拔高到了 64.0 分,相较于基线 OPD 实现了 +4.8 分的绝对提升

这一提升在最困难的竞赛级数据集上尤为耀眼:在 AIME 2024 和 AIME 2025 上,SEAD 分别取得了 +7.7 和 +7.5 分的惊人增长,证明了其在复杂逻辑推理场景下极高的知识转化率。

真正发生作用的是“乘数效应”

消融实验(Ablation Study)彻底揭示了 SEAD 机制的威力。如果剥离这三个核心模块,结果会怎样?

  1. 单打独斗的局限:仅仅加入“时间退火(A)”,性能提升微乎其微(+0.22)。仅仅使用“Token 分区(T)”,也只带来 +0.3 的边际收益。这是因为没有时间表配合的稀疏化,会导致模型无法把握收敛时机。

  2. 1+1 远大于 2:当“Token 分区(T)”与“时间退火(A)”结合时,平均准确率瞬间飙升至 63.7,这是单独使用 A 时收益的 20倍放大。这证明了基于熵的稀疏化必须配合动态散度调整才能发挥威力。

  3. 课程学习的兜底作用:当加入“课程学习(C)”后,模型应对高难度任务(如 AIME)时的崩溃现象得到了根本控制,最终达到了 64.0 的最优状态。这完美印证了前文所述的“共生关系”——三个组件解决了不同的瓶颈:分区决定了哪些 Token 接受梯度,退火决定了稀疏化何时激活,课程决定了以何种顺序呈现样本。

微观视角:为什么跳过一半计算依然高效?

为了解释 SEAD 是如何在节约算力的同时提升效果的,论文对 Token 级别的损失分布进行了深入透视。

按区域排序的单Token FKL损失

上图清晰地展示了 FKL 损失在不同 Token 上的分布具有极强的长尾效应。

更有意思的是具体 Token 的语义分类。数据表明,Zone A 绝大部分由标点符号、固定句式连接词和简单的确定性数学运算组成;而 Zone C 几乎完美覆盖了“策略分叉点(Strategy fork)”。在 SEAD 的 50/40/10 默认配置下,没有任何一个推理关键分叉点会被错误地分入 Zone A 而被忽略

Token区域着色与分布分析

可视化模型输出也能印证这一点。在实际的推理生成中,代表 Zone C 的高熵区域(红色部分)精准地出现在逻辑推演需要做出选择的十字路口。在这些关键节点上,SEAD 通过 FKL 保留了探索空间;而在常规的叙述和计算中,SEAD 直接将其判定为绿色(Zone A)并切断梯度计算,从而让模型将有限的拟合能力集中在真正卡脖子的推理难点上。

此外,对比单方面的熵指标,联合熵的必要性也得到了证实。教师模型熵最高的前 20% 位置,与学生模型熵最高的前 20% 位置,其 Jaccard 重合度仅为 63.7%。这意味着如果只看老师或只看学生,会有超过三分之一的关键信息被漏掉。教师的熵指明了“哪里需要指导”,而学生的熵反映了“哪里尚未掌握”,两者结合才构成了完整的监督质量地图。

总结与启示:算力不应被平均主义消耗

在大语言模型的训练进入精细化时代的今天,SEAD 提供了一个极其重要的研究视角:在数据侧和模型结构侧的优化之外,监督信号的投放策略本身就是一个巨大的宝藏。

传统的 OPD 方法就像是填鸭式教育,无论题目难易,无论知识点是否已经滚瓜烂熟,都在用同样的力量去纠正每一个字。这不仅导致了计算资源的严重浪费,更引发了模型在复杂推理任务上的模式崩溃和性能停滞。

SEAD 框架通过将“联合信息熵”这一纯粹的数学指标,巧妙地转化为衡量“监督质量”的探针,实现了一场漂亮的减法。通过跳过 50% 的冗余 Token,引入顺应能力发展的退火机制,以及确保底层逻辑连贯的课程学习,SEAD 以更小的计算代价,跨越了 7B 到 32B 之间巨大的能力鸿沟。

这一工作对于未来推理大模型(如类 o1 模型)的高效对齐和蒸馏具有深远的启发意义。它告诉我们,最高效的进步往往不是源于无死角的死记硬背,而是知道在什么时候、在哪个问题上、对哪个关键节点进行精准的发力。