MOPD:小米等提出多教师同策略蒸馏,归一化得分提升5.5分!
MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training

在大语言模型(LLM)的后训练(Post-Training)阶段,强化学习(RL)已经成为提升模型特定领域能力的标准范式。无论是利用可验证奖励进行数学推理训练,还是在沙盒环境中进行代码能力的代理式强化学习,或者是基于规则反馈优化指令遵循能力,针对单一领域的强化学习管道往往能够稳定且大幅度地提升该领域的表现。然而,研究人员和工程团队最终想要的是一个能在所有领域都表现优异的全能模型。将多个领域的能力完美融合到单一模型中,至今仍是大模型后训练中的一个核心痛点。
ArXiv URL:https://arxiv.org/abs/2606.30406v1
北京大学、中国人民大学、香港大学与小米公司的联合研究团队近期提出了一种全新的能力融合范式——MOPD(Multi-Teacher On-Policy Distillation,多教师同策略蒸馏)。该方法放弃了在静态数据集或权重空间中生硬地合并模型,而是选择在策略空间中,通过同策略蒸馏的方式,将多个专门针对特定领域进行强化学习微调的“教师模型”的能力,致密地传授给单一的“学生模型”。
实验结果表明,在 Qwen3-30B-A3B 模型上,MOPD 在多域能力融合上的表现全面超越了现有的混合强化学习(Mix-RL)、级联强化学习(Cascade RL)、离策略微调(Off-Policy Finetune)以及参数合并(Param-Merge)等主流基线方案,其归一化得分比最强的基线方法高出 5.5 分。更重要的是,MOPD 不仅保留了各个教师模型绝大部分的巅峰能力,还成功部署在了拥有 3090 亿参数的工业级前沿模型 MiMo-V2-Flash 的后训练中,证实了其在极端算力和庞大规模下的可行性与实用价值。
现有能力融合方案的困境
在 MOPD 提出之前,业界在处理多领域能力融合时主要采用四种方案,但它们在学习效率、性能上限和训练稳定性之间总是存在难以调和的矛盾。
混合强化学习(Mix-RL)是最直观的思路。它将来自各个领域的提示词(Prompts)汇总到一个数据集中,并进行联合的强化学习。然而,由于不同领域的奖励信号和优化目标存在差异,跨领域的训练信号往往会产生相互干扰,导致“跷跷板效应”(See-saw effect)。这使得最终的联合模型在各个单项能力上,均难以达到单独训练的教师模型的水平。
级联强化学习(Cascade RL)则采取了流水线式的策略,依次在不同领域上进行强化学习。这种串行训练面临的最大问题是“灾难性遗忘”:早期阶段学习到的能力会随着后续阶段的推进而逐渐衰退。此外,整体战线过长也放大了模型在强化学习过程中的稳定性风险。
离策略微调(Off-Policy Finetune)的做法是,先训练好各个领域的强化学习教师模型,让它们生成大量的输出轨迹(Rollouts),然后再用监督微调(SFT)的方式让学生模型去学习这些固定轨迹。这种方案虽然工程上相对简单,但不可避免地引入了经典的“曝光偏差”(Exposure Bias)。因为学生模型在推理时面对的状态分布,往往会偏离教师模型生成训练数据时的分布,导致泛化能力下降。
参数合并(Param-Merge)主要是在权重空间进行操作,例如对多个教师模型的权重进行平均(Model Soups)或通过任务向量进行加减运算(Task Arithmetic)。尽管这种方法不需要额外的训练算力,但简单粗暴的权重融合往往会导致模型性能极不稳定,实际上很难完整继承所有教师的巅峰能力。
MOPD 的核心机制:在策略空间中进行致密蒸馏
针对上述方法的局限性,研究团队提出了 MOPD 框架。MOPD 认为,与其在权重空间冒险融合,或者在多目标强化学习的泥潭中挣扎,不如在策略空间(Policy Space)直接进行多教师的能力交接。
MOPD 将整个后训练管道划分为三个清晰的顺序阶段:
-
通用监督微调(General SFT):在一个涵盖所有目标领域的高质量语料库上对基础模型进行微调,获得一个拥有扎实通用基础的 SFT 模型。
-
领域专用强化学习(Domain-specialised RL):以上述 SFT 模型为起点,在数学、代码、指令遵循等各个领域分别独立开展专门的强化学习训练。这一步将产出一组在各自领域达到巅峰水平的“领域教师模型”。
-
多教师同策略蒸馏(MOPD 分发与融合):将这组独立的领域教师的能力,蒸馏回一个单一的学生模型(其初始权重同样来自第一阶段的 SFT 模型)。
在第三阶段的蒸馏过程中,MOPD 采用了“学生采样、教师评分”的同策略(On-Policy)范式。具体而言,学生模型首先根据输入的提示词自行生成轨迹(Rollouts)。随后,系统会根据该提示词所属的领域,将其路由并分发给对应的领域教师模型。教师模型在接收到学生的轨迹后,会计算并在每个 Token 级别上提供对其概率分布的评估。学生模型据此计算逆 KL 散度(Reverse KL),不断调整自身的策略以逼近教师在这些特定轨迹上的判断。
这种设计带来了三个显著的结构性优势:
首先,训练信号不仅极其致密,而且直接来源于领域专家教师。相比于强化学习中稀疏且方差极大的轨迹级奖励(Trajectory-level reward),教师模型提供的 Token 级别对数概率(Log-probability)能够为学生提供更丰富、更精确的梯度指导。
其次,整个蒸馏过程完全运行在学生模型自身的轨迹分布上。这种同策略的特性从根本上消除了离策略微调带来的曝光偏差问题,使得模型在推理时的行为与训练时的优化方向保持高度一致。
最后,能力的融合是通过提示词级别的路由在策略空间中实现的,而不是在权重空间进行机械相加,这使得整个优化过程表现出极高的稳定性。
两种高效的损失函数实现方案
为了将上述理论转化为可执行的算法,MOPD 提供了两种损失函数的实现方式,以适应不同的工程需求。
第一种是策略梯度实现(Policy-gradient implementation)。它将 MOPD 蒸馏直接转换为一个强化学习过程。在这种设定下,教师模型对学生生成的特定 Token 的概率评估,被直接用来替换传统 PPO 或 GRPO 算法中的优势函数(Advantage computation)。这意味着研究团队可以直接复用现有的强化学习训练框架,只需修改优势值的计算逻辑即可,工程侵入性极低。
第二种是Top-$k$ 蒸馏实现。由于策略梯度形式在每个生成位置只利用了单一采样的 Token,为了进一步降低方差并更充分地利用教师的分布信息,MOPD 引入了截断的局部概率分布对齐。具体来说,在每个 Token 位置,系统只要求教师模型输出其概率最高的 $k$ 个词的分布(例如 $k=64$),学生模型则在这一局部候选集上计算与教师的 KL 散度。这种方法不仅保证了优化的正确性,还大幅减轻了基础设施的压力:传输前 $k$ 个 Token 的 logits 就像传输一个轻量级的奖励信号一样高效,完全避免了全词表蒸馏带来的巨大通信开销。
实验结论与核心发现
为了全面验证 MOPD 的有效性,研究团队在不同规模和架构的基础模型上进行了严格的对比实验。
Qwen3-30B-A3B 上的全面超越与极高样本效率
在以 Qwen3-30B-A3B 为基座的实验中,研究团队横跨了数学(AIME)、指令遵循(IFBench/IFEval)和软件工程(SWE-bench Verified)三个领域。由于不同领域的绝对准确率天花板差异巨大,研究人员采用了一种归一化得分(Normalised Score)来进行公平比较。该得分将第一阶段 SFT 学生的基准能力设为 0,将第二阶段专门强化学习教师的巅峰能力设为 1。

对比结果显示,MOPD 显著击败了所有基线方案。在归一化得分上,MOPD 达到了 0.937,不仅比最强的基线方法(Mix-RL 的 0.882)高出 5.5 分,而且表明它成功继承了每个单一领域教师约 91% 到 95% 的巅峰能力,实现了几乎无损的能力大一统。
更令人瞩目的是 MOPD 展现出的极高样本效率。在指令遵循和软件工程领域,MOPD 分别仅需消耗约 2.5 万和 3 万条样本,其性能就迅速达到了教师水平的平台期。相比之下,传统的混合强化学习(Mix-RL)在每个领域都需要消耗完整的 15 万到 18 万条样本,才能勉强接近类似的水平。这种数倍的效率提升,直接归功于教师模型提供的致密 Token 级监督信号,它比传统强化学习中基于整条轨迹返回的单一奖励,包含了多得多的有效梯度信息。
规模化至 3090 亿参数的 MiMo-V2-Flash
如果一种方法只能在百亿规模模型上奏效,其工业价值将大打折扣。因此,研究团队将 MOPD 部署到了拥有 3090 亿参数的工业级前沿模型 MiMo-V2-Flash 的后训练管道中。
即使在如此庞大的参数规模和极高的任务复杂度下,MOPD 依然表现出卓越的鲁棒性。在多数核心基准测试中,经过 MOPD 融合的最终模型,其表现甚至追平或小幅超越了专门为其训练的单一领域教师模型。而在少数出现波动的基准(如 IFBench 和 SWE-Bench Verified)上,性能回撤的幅度也被控制在极小的范围内(仅分别下降 2.2 和 0.8),相对于在其他能力上的全面整合与提升,这一代价完全在工程可接受的范围内。
关键分析:同源教师与多轮演进的潜力
在深入探讨 MOPD 的作用机制时,研究团队通过两项关键消融实验揭示了该方法的护城河所在。
同源教师是维持蒸馏稳定性的基石。 既然是要向教师学习,是否可以找一个参数量更大、绝对能力更强的外部模型作为教师呢?研究人员尝试在数学领域,将 MOPD 的教师从原本的 Qwen3-30B 强化学习变体,替换为能力强得多的 235B 参数规模的 Qwen3 外部模型。结果却出人意料:学生模型的数学性能不仅没有提升,反而出现了严重的崩塌。
底层逻辑在于,原本的 MOPD 教师由于是从与学生模型相同的 SFT 检查点通过强化学习微调而来(即“同源”),两者在初始状态下共享着高度相似的策略分布。这使得初始的逆 KL 散度极低,优化过程非常平滑。而引入外部模型后,由于两者概率分布差异巨大,初始 KL 散度激增至同源设定的 5 倍以上。学生模型的输出轨迹在外部教师看来往往充满了“低概率的错误”,导致学生在训练中接收到大量惩罚性的梯度信号,最终导致策略熵急剧收缩甚至训练发散。这一发现明确了同源策略分布对于同策略蒸馏稳定性的不可替代作用。
支持多轮学生-教师演进闭环。 MOPD 并非只能执行一次。由于单次 MOPD 能够继承教师 90% 以上的能力,研究人员发现,可以将经过 MOPD 融合后的全新统一模型作为下一轮的“初始学生”。以此为起点,重新在各个领域进行新一轮的强化学习训练,能够得到能力上限更高的第二代领域教师。随后再次执行 MOPD,第二代融合模型的归一化得分从 0.937 进一步攀升至 0.986。这表明,MOPD 构建了一个可持续吸收强教师能力的演进飞轮。
工程解耦的深远意义
MOPD 对大模型后训练带来的不仅仅是分数上的提升,更重要的是,它在工程架构上彻底解耦了多领域训练的串行依赖。
在过去,如果我们采用混合强化学习,只要某一个领域(例如代码)的数据配比或超参数出现问题导致训练崩溃,整个包含数学、文本等所有领域的多目标联合训练任务就必须整体推倒重来,试错成本极其高昂。
而 MOPD 将“能力生产”和“能力融合”清晰地剥离开来。各个领域的强化学习教师完全可以由不同的小组独立、并行地进行开发和调优。数学组可以自由测试各种验证器策略,代码组可以安心调试沙盒环境,它们互不干扰。当所有领域的单项冠军出炉后,MOPD 只需要作为最后一道集成工序,将它们的能力汇总。这种“风险隔离”的特性,为超大规模团队协作开发前沿大模型提供了一条极其可靠的工业化路径。