Direct-OPD:不模仿小模型策略,而是转移隐式奖励,4小时提升Qwen3表现
Weak-to-Strong Generalization via Direct On-Policy Distillation

带有可验证奖励的强化学习(RLVR)是当前激活大型语言模型深层推理能力的核心密码。从各大顶尖机构的动作来看,让模型在数学、代码等逻辑严密领域通过自我纠错和多步推理来获取高分,已经成为一种标配。然而,这种后训练(post-training)范式极其昂贵。因为无论算法多么精妙,每一次策略更新都要求当前的大模型在环境中进行海量的采样(rollouts)。随着目标推理模型越来越庞大,生成这些训练轨迹的速度变得极其缓慢,最终使得强化学习本身成了整个模型迭代周期的最大算力瓶颈。
ArXiv URL:https://arxiv.org/abs/2607.05394v1
面对这一算力黑洞,字节跳动、北京大学和清华大学的研究团队提出了一条违背直觉但极其优雅的突围路线:既然在大模型上跑强化学习太贵,为什么不在算力开销微乎其微的小模型上跑完强化学习,然后把学到的“解题直觉”打包转移给大模型?在这篇工作中,研究人员正式提出了 Direct On-Policy Distillation(Direct-OPD)框架。依靠这种弱到强(weak-to-strong)的泛化范式,仅需 8 张 A100 显卡运行约 4 个小时,Qwen3-1.7B 模型在 AIME 2024 数学竞赛基准上的准确率便从 48.3% 跃升至 62.4%。这种效率在过去通常需要数十张顶级显卡连续运行一周以上才能达成。
最值得记住的结论在于,Direct-OPD 彻底改变了知识蒸馏中“模仿教师模型”的传统逻辑。它证明了小模型在经过强化学习后,其价值并不在于它最终变成了一个多聪明的“教师”,而在于它的参数变化中蕴含了精确的奖励反馈信号。直接提取这种相对变化,比强迫一个原本就非常聪明的大模型去模仿一个资质平庸的小模型,要有效得多。
为什么传统的在轨蒸馏会翻车?
要理解 Direct-OPD 的破局点,必须先看清传统知识蒸馏在“弱到强”设定下面临的致命陷阱。在常规的在轨蒸馏(On-Policy Distillation, OPD)中,大模型(学生)会在自己生成的轨迹上进行采样,然后去查询小模型(教师)在面对同样上下文时的绝对输出概率分布,并试图去匹配这个分布。
如果是大模型教小模型,这种逻辑毫无问题。但在弱到强的设定下,这就变成了一场灾难。论文一针见血地指出,经过强化学习后的小模型,其最终的策略输出其实是一个混合体:它既包含了强化学习带来的宝贵增益(比如学会了反思、学会了按步骤拆解),同时也深深烙印着小模型自身的固有缺陷(比如受限于参数量导致的词汇匮乏、语法僵化或常识错误)。
当大模型本身的初始能力已经超过了这个小模型时,强行要求大模型去拟合小模型的绝对输出,本质上是在用小模型的天花板来压抑大模型的潜力。实验数据清晰地展现了这一悲剧:在一个测试中,R1-Distill-7B 模型的初始准确率为 56.7,而作为教师的 post-RL JustRL-1.5B 模型准确率只有 51.3。如果使用传统的 OPD 让 7B 模型去向 1.5B 模型学习,7B 模型的表现会被硬生生拖拽到 50 左右。这说明,弱模型身上确实带着强化学习的宝贵经验,但它的绝对策略分布绝不是传递这些经验的合格载体。

核心机制:剥离缺陷,提取隐式奖励
既然绝对策略不能用,那该转移什么?研究团队将目光投向了“相对变化”。他们定义了一个全新的转移客体:教师策略偏移(Teacher Policy Shift)。
具体而言,框架会记录小模型在强化学习训练前(作为参考模型 $\pi_{T_{\mathrm{ref}}}$)和强化学习训练后(作为教师模型 $\pi_{T}$)的两个状态。对于任何给定的回答,Direct-OPD 会计算这两个模型输出概率的对数差值:
\[\Delta_{T}(y\mid x)=\log\pi_{T}(y\mid x)-\log\pi_{T_{\mathrm{ref}}}(y\mid x)\]这个看似简单的减法,在物理意义上极为巧妙。它完美剔除了小模型原本就倾向于生成的内容,只保留了强化学习过程“强行改变”的部分。如果这个差值为正,说明强化学习认为这个动作很好,迫使小模型增加了它的概率;如果差值为负,则说明这是一个会导致低分的动作,强化学习压制了它。
更深层的美妙之处在于数学层面的等价性。在标准的带有 KL 散度惩罚的强化学习目标下,上述算式计算出来的策略偏移,在严格的数学推导上就等价于训练小模型时所使用的环境奖励(加上一个缩放系数和一个常数)。这意味着,只要拿到一对小模型在强化学习前后的权重,实际上就拿到了一本密集的“奖励字典”。
大模型不需要再去和外部环境进行昂贵且低效的互动(即稀疏奖励 RL),也不需要单独训练一个极易产生过度优化的独立奖励模型(Reward Model)。它只需要像往常一样生成自己的解答步骤,然后拿着这些步骤去查这本“字典”,如果对应的策略偏移是正的,大模型就提升该动作的概率。这种机制将极度耗时的强化学习探索过程外包给了小模型,而大模型只负责最高效的梯度爬升。
低成本超越直接强化学习,且支持能力叠加
将强化学习的成果转化为隐式奖励信号后,Direct-OPD 展现出了极其强大的实战性能。
第一个关键事实是,这种弱到强的范式不仅是一种节约算力的退而求其次的选择,它在最终效果上甚至可以击败直接在大模型上死磕强化学习。研究团队进行了一场严格的对比测试:一条路线是直接在 R1-Distill-7B 模型上运行标准的强化学习;另一条路线是先用极小的开销在 1.5B 模型上跑完强化学习,然后通过 Direct-OPD 将策略偏移转移给 7B 模型。

测试结果证明了分步策略的巨大优势。直接在一个 7B 级别的大模型上启动强化学习,往往面临着严重的探索不稳定性和冷启动问题,算力在大量的无效试错中被白白燃烧。而小模型的参数量小,探索的迭代速度极快,更容易在复杂的解题空间中找到那条高分路径。随后 Direct-OPD 将这条路径转化为密集的信号指引大模型。这不仅大幅缩短了上分时间,其最终达到的性能天花板也比匹配步数的直接强化学习更高。
Direct-OPD 的另一个杀手锏是其绝佳的可组合性(Sequential composition)。因为转移的不再是模型的绝对输出,而是某种特定能力的“增量修改”,这就意味着你可以像堆叠系统补丁一样,将不同训练来源的策略偏移依次注入到同一个模型中。

在连续组合实验中,研究人员首先用一组基于特定数据源训练出来的小模型策略偏移(比如强化逻辑拆解能力)去训练大模型;随后,在保持该大模型当前状态的基础上,再引入另一组完全不同数据流派下产生的策略偏移(比如强化特定学科的运算能力)继续训练。轨迹清楚地表明,大模型能够平滑地吸收第二阶段的技能,使得各项能力得以线性累加,而不会引发严重的灾难性遗忘。这为未来打造全能型的超级推理模型提供了一种极其廉价且模块化的生产流水线。
打破重叠迷信:跨越思维模式的迁移
为了深入探究为什么 Direct-OPD 能够如此稳定地发挥作用,研究团队对蒸馏底层的动力学进行了细致剖析,并打破了一个长期笼罩在知识蒸馏领域的迷信:Top-$k$ 重叠假设。
以往的研究文献普遍认为,知识蒸馏要想取得成功,学生模型和教师模型必须共享相似的“思维模式”。在指标上的体现就是,当大模型生成一个特定的状态时,它预测概率最高的几个词(Top-$k$)必须和教师模型预测的几个词有很高的重合度。如果双方在用词习惯和思维思路上南辕北辙,蒸馏往往会崩溃。
但 Direct-OPD 用行动证明,当你不要求大模型去死板地模仿绝对概率时,这种限制将不复存在。因为 Direct-OPD 提供的是一种方向性的奖励引导,哪怕大模型用了一种极度高级、且小模型从未见过的表述方式或者解题切入点,只要这种状态投影到小模型的坐标系下能获得正向的对数比,大模型就能得到有效的鼓励。这种跨越思维模式的迁移能力,正是强模型不被弱模型拉下水的根本原因。
短视野训练与动态 KL 控制机制
在训练长序列推理模型时,上下文长度往往是算力消耗的重灾区。但论文通过实验揭示,不必强求对大模型进行超长序列的指导。研究刻意将 Direct-OPD 的训练视野限制在了短短的 2k token 之内。令人振奋的是,这种基于短周期视野塑造的微观思维习惯,能够极为完美地泛化到测试阶段的长篇大论中。这种短程监督信号足以建立起坚固的逻辑链条,避免了在超长截断中进行梯度回传时容易遭遇的信噪比衰减。
不过,将两个模型的对数差值直接当做奖励来用,并非没有风险。其最大的隐患在于尺度的不可控。这个密集的隐式奖励带有一个它自己无法决定的缩放系数——这取决于小模型在强化学习时的探索步长和它自身的 KL 惩罚预算。当大模型游荡到一些非常罕见的状态时,教师模型和参考模型给出的概率都极低,此时两者的对数差值可能会剧烈波动,产生极度嘈杂的伪信号。

为了把控这种局面,本文设计了一种基于奖励符号的自适应 KL 控制器。传统的 KL 控制通常是硬性要求模型之间的偏离度维持在一个固定数值;而这里的控制器则敏锐地根据当前密集奖励的局部平均符号进行动态涨跌。当大模型当前采样的轨迹在平均意义上获得了正向的策略偏移,说明大模型正在顺着正确的方向狂奔,此时系统会主动提高 KL 系数($\alpha$),如同勒紧缰绳,防止大模型对这片局部的优质信号过度拟合而走向极端;相反,如果大模型不慎掉入了一个充满负向偏移的糟糕区域,系统会迅速降低 KL 系数,松开缰绳,允许大模型打破与初始状态的锚定,以最快速度逃离这片惩罚泥潭。
正是这种刚柔并济的动态调节,确保了无论师生模型的参数量差距多大,隐式奖励的引导始终处于一个既能提供有效推力,又不会撕裂大模型原有分布的安全区间。
从更高维度的视角来看,Direct-OPD 的真正贡献超越了单纯的跑分提升。它重新定义了强化学习在这场大模型军备竞赛中的生态位。强化学习的产物不再仅仅是一个“供人使用的最终模型”,它所产生的那一对包含着无数试错经验的 Checkpoint 矩阵,本身就是一种极具价值的、可即插即用的数字资产。沿着这条路径,未来的大模型后训练,或许不再需要漫长而昂贵的集群硬抗,而是变成一场优雅的、从轻骑兵向重装甲平滑过渡的信息接力。