RG-OPD:拒绝盲从教师模型!MIT提出奖励门控蒸馏,推理提升8.2分

Reward-Gated On-Policy Distillation

RG-OPD:拒绝盲从教师模型!MIT提出奖励门控蒸馏,推理提升8.2分 论文图示

在大型语言模型的后训练(Post-training)阶段,如何将强大的闭源或超大参数模型(Teacher)的推理能力,高效地迁移到参数量较小的模型(Student)身上,一直是工业界和学术界死磕的核心命题。目前主流的路线主要有两条:一条是基于验证器反馈的强化学习(RLVR),另一条是知识蒸馏(Knowledge Distillation)。

ArXiv URL:https://arxiv.org/abs/2607.04037v1

然而,这两条路线各自存在明显的局限性。RLVR 能够利用明确的对错信号(如代码是否编译通过、数学最终答案是否正确)来引导模型,但这种奖励往往是极其稀疏的轨迹级别反馈。当你让模型生成长达数千个 Token 的推理过程时,仅仅在最后告诉它“对了”或“错了”,很难让它知道具体是哪一步走得好、哪一步走偏了。这种“信用分配”问题在复杂推理任务中尤为致命。为了解决这个问题,研究人员引入了在线策略蒸馏(On-policy Distillation, OPD)。在 OPD 中,学生模型自己探索生成轨迹,而教师模型在学生实际访问的每一个状态(Token)上提供密集的概率监督。

但这引出了一个更深层的问题:教师模型的指导总是绝对正确的吗?

来自麻省理工学院(MIT)、亚马逊云科技(AWS)、科隆大学和德克萨斯大学奥斯汀分校的研究团队,在最新的一项研究中犀利地指出了传统在线蒸馏的致命缺陷——盲目信任教师模型会毒害学生模型的推理能力。 教师模型可能会对似是而非的错误答案给出高置信度,也可能会因为学生采用了非正统但完全正确的推理路径而给出极低的概率。如果无条件地将这种监督信号全盘灌输给学生,不仅会固化错误的模式,还会抹杀学生模型本身探索出的有效行为。

为了破局,研究团队提出了一种名为 RG-OPD(Reward-Gated On-Policy Distillation)的全新蒸馏框架。该方法不再将教师模型奉为神明,而是引入了一个巧妙的“奖励门控”机制,利用验证器的稀疏奖励来决定何时该信任教师的密集信号。实验表明,RG-OPD 彻底改变了蒸馏的效率与质量,在长文本生成推理任务上,相比未经微调的学生模型实现了惊人的 8.2 分提升。

传统在线蒸馏的“信任危机”

要理解 RG-OPD 为什么重要,我们首先需要深刻解剖现有在线策略蒸馏(On-policy Distillation)在推理任务中遭遇的困境。

传统的知识蒸馏往往发生在教师模型生成的离线数据集上。但在推理任务中,这种离线蒸馏极易引发“暴露偏差”(Exposure Bias)。因为学生模型在推理阶段面对的状态分布,与训练阶段单纯模仿教师生成轨迹的状态分布大相径庭。一旦学生在早期生成中走错了一小步,后续面对的陌生状态将让它彻底崩溃。

为了缓解这一问题,基于学生中心视角的在线策略蒸馏应运而生。其核心逻辑是:让学生模型 $\pi_{\theta}$ 根据当前给定的 Prompt 自己生成一系列轨迹,然后把这些轨迹喂给固定的教师模型 $\pi_T$。教师模型不需要自己生成完整的回答,只需要针对学生走出的每一步,评估其在当前状态下的 Token 概率分布,并通过诸如反向 KL 散度(reverse-KL)等损失函数,强迫学生模型的概率分布向教师靠拢。

这种做法确实为强化学习带来了梦寐以求的 Token 级别密集监督。然而,研究团队敏锐地发现,这种无条件的蒸馏(Unconditional Distillation)建立在一个极其脆弱的假设之上:即教师模型在任何轨迹的任何状态下,都能提供绝对权威且有益的指导。

但在复杂的推理和代码生成任务中,事实绝非如此。作者明确指出了两种传统蒸馏会失效的典型场景:

第一,幻觉与看似合理的谬误。即使是参数量巨大的顶尖教师模型,也可能在面对某些复杂逻辑陷阱时“一本正经地胡说八道”。如果学生模型在探索中也走向了这条错误的死胡同,而教师模型却给这个错误的 Token 序列分配了极高的似然概率(High likelihood),那么无条件蒸馏就会直接强化这种“看似合理实则错误”的模式。

第二,不同推理路径的排斥。通往正确答案的道路往往不止一条。在写代码或解数学题时,学生模型可能通过自己的探索,发现了一种独特、轻量甚至比教师模型更巧妙的解法。此时,因为这种解法不在教师模型自身的“舒适区”或偏好分布内,教师模型会对其分配极低的概率。如果强行应用蒸馏损失,学生模型就会因为“不符合老师的写作风格”而受到惩罚,进而导致这些有用的、能带来正确结果的探索行为被生生抹除。

基于上述观察,研究团队提出了一个直击灵魂的问题:在在线策略蒸馏的过程中,教师的监督到底何时是在帮忙,何时是在帮倒忙?

RG-OPD:用奖励门控过滤教师信号

为了回答这个问题,研究团队设计了 RG-OPD。其核心洞见非常优雅:稀疏的验证器奖励和密集的教师对数概率(logits)实际上回答了两个不同层面的问题。奖励(Reward)负责回答“这条轨迹到底好不好(对不对)”;而概率差距(Likelihood gap)则回答了“教师模型对这个状态的判断是否比学生更有把握”。

RG-OPD 的做法是,不再把所有的学生生成轨迹都扔给蒸馏损失函数,而是建立一个“门控”(Gate),只有当验证器的奖励方向与教师-学生模型的概率差距方向保持一致时,才允许进行蒸馏更新。

RG-OPD:拒绝盲从教师模型!MIT提出奖励门控蒸馏,推理提升8.2分 论文图示

具体而言,在每个训练步骤中,学生模型对某个问题 $x$ 采样出多条轨迹,验证器对每条轨迹给出一个标量奖励 $r_i$(或者优势函数 Advantage $A_i$)。对于每个采样的 Token,系统会同时计算三个对数概率:当前学生模型的概率、采样时旧学生模型的概率、以及教师模型的概率。

随后,RG-OPD 计算整条轨迹上教师模型的总对数概率 $L_T$ 和学生模型的总对数概率 $L_S$:

\[L_T^{(i)} \;=\; \sum_t m_t^{(i)} \log\pi_T\!\left(y_t^{(i)}\,|\,s_t^{(i)}\right),\qquad L_S^{(i)} \;=\; \sum_t m_t^{(i)} \log\pi_{\theta}\!\left(y_t^{(i)}\,|\,s_t^{(i)}\right)\]

这里最关键的创新在于指示函数 $g_i$ 的设计。这个函数决定了当前轨迹是否被纳入最终的蒸馏计算:

\[g_i \;=\; \mathbf{1}\!\left[\,{\color[rgb]{0.4140625,0.6015625,0.3046875}\big(A_i>0\,\wedge\,L_T^{(i)}>L_S^{(i)}+\delta\big)}\;\vee\;{\color[rgb]{0.76953125,0.26953125,0.2109375}\big(A_i\leq 0\,\wedge\,L_T^{(i)}<L_S^{(i)}-\delta\big)}\,\right]\]

从这个公式中,我们可以清晰地读出 RG-OPD 信任教师模型的两个严格条件:

  1. 正向一致(轨迹成功且教师更自信):当轨迹的优势函数 $A_i > 0$(即这是一条比平均水平更好、往往是答案正确的轨迹),并且教师给出的概率显著大于学生给出的概率($L_T > L_S + \delta$)。这意味着学生模型虽然蒙对了,或者走出了一条好路,但它自己还不够自信;而教师模型也高度认可这条路径。此时,教师的密集信号是非常有价值的正面指导,必须学习。

  2. 负向一致(轨迹失败且教师更抗拒):当轨迹的优势函数 $A_i \leq 0$(即这是一条错误或糟糕的轨迹),并且教师给出的概率显著低于学生给出的概率($L_T < L_S - \delta$)。这意味着学生模型走入歧途且自以为是,而教师模型准确地识别出这是一条烂路,给出了极低的置信度。此时,强迫学生模型向教师的低概率靠拢,可以有效地抑制这种错误模式。

除这两种情况之外的所有轨迹,RG-OPD 都会毫不留情地丢弃($g_i = 0$)。

这种设计的精妙之处在于它完美避开了前面提到的两大陷阱。假设学生生成了一个正确的答案,但用的是教师不熟悉的偏门方法(导致教师给出的 $L_T$ 很低)。在传统方法中,学生会被惩罚;但在 RG-OPD 中,因为 $A_i > 0$ 但 $L_T$ 并不大于 $L_S$,这个冲突会被直接过滤掉,学生的独创性得以保留。反之,如果学生生成了错误的幻觉($A_i \leq 0$),而教师模型也跟着犯傻给了高概率($L_T > L_S$),RG-OPD 同样会阻断这次更新,防止错误模式被教师的“权威”盖章确认。

最终的损失函数依然沿用反向 KL 散度,但仅仅在被门控保留下来的轨迹上进行计算:

\[\mathcal{L}_{\mathrm{RG\text{-}OPD}} \;=\; \frac{\sum_i g_i \sum_t m_t^{(i)}\,\mathrm{KL}\!\left(\pi_{\theta}(\cdot\,|\,s_t^{(i)})\,\|\,\pi_T(\cdot\,|\,s_t^{(i)})\right)}{\sum_i g_i \sum_t m_t^{(i)}}\]

通过这种方式,RG-OPD 在稀疏的验证器奖励和密集的教师概率之间架起了一座桥梁。它既没有像纯 RLVR 那样放弃 Token 级别的监督,也没有像传统 OPD 那样盲信教师。它通过显式的条件判定,保证了只有在教师信号具有“方向性益处”时,才发生知识传递。

实验论证:长生成推理的显著突破

为了验证 RG-OPD 的真实效能,研究团队在推理和代码基准上进行了严谨的实证分析。实验采用了 Qwen2.5 家族作为基础模型,其中 1.5B 版本的 Instruct 模型作为学生(Student),14B 版本的 Instruct 模型作为教师(Teacher)。训练数据则使用了 UltraInteract 数据集的一个子集,训练周期为 3 个 epoch。

在对比基线上,除了未经微调的初始学生模型(untuned student),研究还对比了基础的反向 KL 蒸馏(vanilla reverse-KL),以及近期提出的基于偏好的 Token 选择性蒸馏基线 TSD-KD。

实验结果展现了 RG-OPD 在推理任务上的压倒性优势。最值得关注的是模型在长序列生成下的表现。在 1K 生成长度限制下,RG-OPD 相比基础的反向 KL 蒸馏方法提升了 2.9 分,相比 TSD-KD 基线大幅提升了 4.9 分

而当放开生成长度限制,进入真正的长生成设置(Long-generation setting)时,RG-OPD 的潜力得到了彻底释放,相比未经微调的初始学生模型,实现了高达 8.2 分的绝对提升。这充分说明,在长链条逻辑推理中,错误累积的风险极高,此时能否过滤掉教师的“有害指导”,直接决定了学生模型最终推理能力的上限。

此外,研究人员还深入剖析了 RG-OPD 在训练过程中的动态变化,揭示了该机制之所以有效的一些底层特征。本文提供的训练动态图表清晰地展示了三个重要趋势:

  1. 门控保留率的下降:在训练初期,大量的 Token 被门控机制保留用于蒸馏;但随着训练的深入,被奖励-教师门控保留的 Token 比例呈现明显的下降趋势。这实际上是一个极其健康的信号,说明学生模型正在迅速吸收教师的正确知识。随着学生变得越来越强,它的概率分布开始与教师趋同,那些满足“教师比学生更有把握”条件的轨迹自然会减少。

  2. 生成长度的自然增长:在整个训练周期内,学生模型输出的平均响应长度在持续增长。传统蒸馏往往容易导致模型输出变短,因为教师模型更倾向于简洁安全的回复,从而压缩了学生探索更复杂逻辑链的空间。而 RG-OPD 因为保护了学生探索正确但冗长路径的权利,使得模型能够发展出更详尽的推理过程。

  3. 蒸馏损失的稳定收敛:在保留下来的那些轨迹上,门控反向 KL 蒸馏损失平稳下降。这表明尽管我们丢弃了大量发生冲突的轨迹,但剩余的数据依然提供了足够密集和高质量的梯度,支撑了学生模型的稳定优化,并没有因为数据过滤而引发训练的不稳定。

重塑“监督者”的角色认知

从更深层的视角来看,RG-OPD 这项工作超越了单纯的算法改进,它触及了当前大语言模型对齐与推理训练中的一个核心哲学:如何正确看待不同来源的监督信号。

在以往的混合训练框架(例如联合 RL 与 KD 目标的方法,如 KDRL 等)中,往往是将强化学习的目标与知识蒸馏的正则化项简单相加。这种做法本质上还是认为“多一个信号总是好的”,试图通过超参数来平衡两者的权重。然而,MIT 等机构的这项研究彻底打破了这种和稀泥的做法。

作者明确指出,验证器反馈和教师概率并非是可以简单叠加的同质化信号。Reward 是结果层面的“真理”,而 Likelihood 仅仅是教师模型的主观“信念”。 当信念与真理发生冲突时,任何形式的妥协或正则化都是有害的。RG-OPD 通过不可微分的硬门控(Hard Gate)机制,确立了 Reward 的绝对主导地位:只有当教师的信念符合真理的指引时,其提供的密集梯度细节才有资格参与对学生模型的改造。

这一思想对于后续致力于提升开源小模型推理能力的研究具有深远的指导意义。它告诉我们,与其花费巨大的算力去寻找一个“完美无缺”的教师模型,不如建立一套严密的校验机制,从现有的非完美教师那里“取其精华,去其糟粕”。在算力和数据都日益内卷的今天,这种基于逻辑一致性的精细化数据利用方式,无疑代表着未来模型后训练的重要演进方向。