直降17%!普林斯顿揭示特权自蒸馏为何反噬思考模型?
Rethinking On-Policy Self-Distillation for Thinking Models

在大型语言模型的自我进化路线中,带有特权上下文的同策略自蒸馏(On-Policy Self-Distillation, OPSD)一直被视为一种极具潜力的范式。这种方法让模型互为师生,同时给予“教师”模型额外的特权信息(例如标准答案或完整解题步骤),从而引导“学生”模型更高效地学习。对于依赖测试时计算(Test-Time Compute)的思考模型(Thinking Models)而言,这原本似乎是一个完美的自我提升工具——因为思考模型有能力在漫长的推理轨迹中充分吸收这些特权信息。
ArXiv URL:https://arxiv.org/abs/2607.05184v1
然而,普林斯顿大学的一项最新研究得出了一个出人意料的负面结论:特权自蒸馏不仅没有让思考模型变得更强,反而严重破坏了它们在长推理轨迹上的表现。在对 Qwen3 和 OLMo 系列的五个思考模型进行的 AIME 和 HMMT 基准测试中,特权上下文蒸馏导致 avg@16 准确率出现了高达 17% 的相对下降。
更关键的是,研究团队深入微观 Token 层面,揭示了这一现象的根本机制——“分叉抑制”(Fork Suppression)。特权信息的介入,使得教师模型在面对高度不确定的推理分叉点时,过早地给出了确定性的信号,从而在训练中惩罚了学生模型进行试错、自我纠正和不确定性表达的行为。对于依赖试错探索的思考模型而言,这无异于抽干了其测试时推理的基石。
本文将深入拆解这项研究的核心实验与分析,探讨为何曾经在指令微调模型上屡试不爽的蒸馏策略,会在更为复杂的思考模型上遭遇滑铁卢。
当自蒸馏遇到思考模型:一种隐秘的冲突
同策略自蒸馏(OPSD)的核心逻辑非常直观:给定一个输入问题,学生模型首先根据自身的当前策略生成一条回答轨迹(Rollout)。随后,教师模型(通常与学生模型具有相同的架构,甚至共享初始权重)通过对这条轨迹进行评分或生成下一个 Token 的分布,来计算散度损失(如 KL 散度或 JSD 散度),以此指导学生模型更新参数。
在这个过程中,如果给教师模型注入只有它能看到的特权信息(Privileged Context,如黄金推导过程或最终答案),理论上教师就能站在“上帝视角”,对学生生成的轨迹给出极其精准的纠偏信号。此前的大量研究表明,这种方法能够有效提升指令微调模型的性能。
然而,思考模型与普通的指令微调模型有着本质的区别。以 DeepSeek-R1 或 OpenThoughts 训练出的模型为例,它们的核心能力在于“深思熟虑”:在给出最终答案之前,它们会在测试时生成极长的推理轨迹,包含大量的分支探索、自我质疑(如使用“wait”、“hmm”等词汇)、回溯和纠错。这种动态的搜索过程,构成了思考模型性能随计算量扩展(Test-Time Scaling)的基础。
普林斯顿大学的研究团队敏锐地捕捉到了一个潜在的冲突:现有的特权自蒸馏方法大多是在生成长度较短的指令模型上验证的。当监督的目标本身是一条漫长且充满波折的探索轨迹时,特权上下文还会发挥正向作用吗?
为了回答这个问题,研究人员设计了严密的对照实验,涵盖了 Qwen3(1.7B、4B、8B)和 OLMo-3-7B 系列中的五个思考模型,并在 AIME 2024、AIME 2025 以及 HMMT 2025 等高难度数学基准上进行了详尽的评估。评估采用了极端长预算的设定——每个问题生成 16 个样本,最大生成长度放宽至 38,912 个 Token。
核心现象:特权上下文带来的“反向优化”
实验结果展现出了一系列高度一致且令人警醒的现象。这些现象逐层递进,彻底排除了偶尔波动的可能,坐实了特权自蒸馏对思考模型的实质性伤害。
第一重对比:指令模型受益,思考模型受损
首先,研究人员观察到了一种有趣的二分现象。当对普通的指令微调模型(Instruct Models)应用带有特权上下文的 OPSD 时,模型的表现通常会得到提升;但当同样的配方被应用到思考模型上时,结果却截然相反。
进一步的控制变量实验证实了这一点。如果在使用 OPSD 训练思考模型时,强行关闭其生成过程中的“思考”行为(即监督的是非思考轨迹),那么模型在后续评估中的性能能够基本保持不退化。但如果训练时监督的是包含大量试错的思考轨迹,模型的性能就会出现显著的滑坡。这意味着,退化并非源于模型本身的基础能力,而是源于蒸馏过程与“思考轨迹”这种特定数据分布的冲突。
第二重对比:毒性源自“特权”,而非“蒸馏”
为了确定性能下降的罪魁祸首究竟是同策略蒸馏(OPD)这种范式本身,还是其中的特权上下文(Privileged Context),研究人员进行了解耦测试。
对于 Qwen3-1.7B 思考模型,如果不给教师模型任何特权信息(即 Vanilla OPD),仅仅让一个更大的 Qwen3-8B 教师模型对学生的轨迹进行打分,学生的 avg@16 准确率实际上从 0.372 提升到了 0.392。这说明同策略蒸馏本身是有效的。
然而,一旦给这个强大的教师模型喂入包含标准答案的特权上下文,同样的蒸馏过程立刻变成了“毒药”,学生的性能暴跌至 0.350。如果使用自身作为教师并引入特权上下文(即完整的 OPSD 设定),性能更是进一步跌至 0.308。由此可见,真正破坏思考模型能力的,正是教师模型所依赖的那些学生在测试时无法获取的额外信息。
第三重对比:长生成预算下的致命暴露
研究人员还发现,这种退化现象具有很强的隐蔽性,尤其是在较短的生成预算下。

如上图所示,当在 4,000 到 8,000 Token 的短生成预算下进行评估时,经过黄金演示(Gold Demonstration)特权自蒸馏的模型,其表现甚至偶尔优于基础模型。这是因为特权蒸馏起到了一种“推理压缩”的作用,迫使模型更直接地走向答案。
但思考模型的真正威力在于 32K 甚至更长的生成预算。当放开生成长度限制时,基础模型能够通过更长时间的试错来提升准确率,而经过特权 OPSD 训练的学生模型却过早地停止了思考。它们的回答长度大幅缩减,原本属于长预算的性能红利消失殆尽,最终在 38K Token 的预算下被基础模型远远甩在身后。
第四重对比:学生只学到了“短”,没学到“准”
一个自然的问题是:如果在测试时,直接把特权上下文也喂给基础模型(这就模拟了训练时教师模型的状态),它会表现得差吗?

实验给出了否定的答案。如上图对比所示,当基础模型获得黄金演示作为上下文时,它自身生成的回复长度确实大幅缩短了,但这并没有损害它的 pass@k 指标,甚至还有所提升。这在逻辑上是说得通的,因为答案就在上下文里,模型不需要绕弯子。
但悲剧发生在了被蒸馏的学生模型身上。学生模型“东施效颦”般地继承了教师模型回答简短的特点,却没有学到教师模型高准确率的精髓(因为测试时学生并没有那个黄金上下文)。这导致在长预算评估中,学生模型既失去了探索能力,又无法依靠捷径得出正确答案。
第五重对比:特权信息越密集,伤害越深
研究进一步对比了不同类型的特权上下文。如果仅仅给教师模型提供稀疏的“最终答案”(Final-answer-only),退化现象会相对温和;但如果提供极其密集的“完整解题过程”(Full-solution),性能下降就会极其显著。

从上图可以清晰地看到,带有密集黄金演示的模型在长预算下的性能变化幅度(红线)深深跌入负值区域,且生成长度被极其严重地压缩。这暗示了教师模型在获得完整解题路径后,对学生探索行为的惩罚更为严厉。
深度归因:“分叉抑制”(Fork Suppression)机制
为了彻底解释为何特权上下文会摧毁思考模型的长推理能力,普林斯顿的研究团队将目光下探到了 Token 级别的微观机制,并提出了“分叉抑制”(Fork Suppression)这一核心解释。
这一解释建立在对模型推理轨迹的结构拆解之上。在思考模型的生成过程中,并非所有的 Token 都具有同等的决策重量。研究人员引入了“分叉(Fork)”与“锁定(Lock)”的概念:
-
分叉点(Fork positions):这是高熵的决策点。在这些位置上,存在多个合理且概率可观的后续输出(例如最高概率候选者的置信度低于 0.25),它们可能引导模型走向完全不同的推理路径或分支。
-
锁定点(Lock positions):这是低熵的局部约束点,当前语境强烈限定了接下来的输出(例如最高概率候选者的置信度高于 0.65)。
思考模型之所以能纠错,正是因为它在分叉点能够进行多样的探索。

上图揭示了特权上下文对这一微观结构产生的深远影响。当教师模型获得了特权信息后,其概率分布发生了根本性的重塑。对于思考模型而言,特权信息显著降低了其输出分布中的分叉率(Fork Rates),同时大幅提升了锁定率(Lock Rates)。换句话说,对于站在“上帝视角”的教师而言,前方的道路一目了然,那些原本充满不确定性的分叉点,在它眼中变成了单行道。
这种分布结构的改变,直接导致了在蒸馏计算散度损失时,训练信号发生了致命的反转。
在真实的推理轨迹中,分叉点往往伴随着特定的词汇标记(Lexical Markers),也就是所谓的“认识论标记”或审慎标记,例如“wait(等等)”、“hmm(嗯)”、“but(但是)”、“maybe(也许)”或“alternatively(或者)”。这些词是模型正在进行探索、自我怀疑或准备开启自我纠错分支的强烈信号。

如上图的 Token 级别信号分析所示,在没有特权上下文的普通蒸馏(Vanilla OPD)中,教师模型对这些审慎标记赋予了正向的优势(Positive Advantage),这意味着教师鼓励学生在不确定时进行这类表达。
然而,一旦教师获得了特权上下文,信号就发生了可怕的反转。由于教师已经知道了最终答案或正确的捷径,当学生模型在某个节点生成“wait”试图回头检查时,教师的概率分布会认为这是一个多此一举甚至错误的举动。因此,对于这些审慎和纠错标记,特权蒸馏赋予了强烈的负向优势(Negative Advantage)。特权教师用惩罚的方式告诉学生:“不要犹豫,不要回头,直接走这条路。”
这种微观层面的惩罚在训练结束后留下了深深的烙印。经过特权 OPSD 训练的学生模型,在最终的评估生成中,其输出的验证、回溯和自我怀疑标记数量出现了断崖式的下跌。即便是进行了长度归一化处理,这种审慎标记的减少也依然极其显著。
至此,退化的逻辑链条已经完整:特权上下文让教师失去了对不确定性的包容——在面对分叉点时,教师给出了极其确定的单向引导——学生模型在损失函数的驱使下,学会了抑制试错和自我纠正的倾向(分叉抑制)——在最终长预算评估中,学生模型失去了动态搜索能力,性能暴跌。
总结与对大模型自进化的启示
普林斯顿大学的这项研究,为当前狂飙突进的大模型合成数据与自强化学习热潮敲响了警钟。它揭示了一个深刻的悖论:在追求更高智能的过程中,过早或过度地引入外部的高级认知(特权上下文),反而可能扼杀模型自主探索复杂问题空间的能力。
这一发现对未来 AI 模型的自进化路径具有几点关键的启示:
第一,认知路径的不可压缩性。对于真正的推理任务而言,得出答案的“过程”与“答案”本身同样重要。指令微调模型只需学会遵循既定的模式,因此特权信息带来的“捷径”是有效的;但思考模型的能力在于“搜索算法”本身,如果用已知结果去强行裁剪搜索空间,实际上是在破坏这种算法。特权教师教给学生的并不是“如何思考”,而是“如何背下这个特定的答案”。
第二,重新审视 Token 级别的反馈机制。未来的自蒸馏方法不能仅仅停留在轨迹级别的模仿,而必须更加精细地处理分叉点。如果要在不破坏模型探索能力的前提下利用特权信息,或许需要设计一种能够区分“有效探索”和“无意义发散”的损失函数,确保教师在提供解题方向的同时,不会粗暴地折叠模型在合理范围内的分支搜索。
第三,对长周期智能体(Long-horizon Agents)训练的指导意义。正如研究中提到的,稀疏的特权提示(如仅仅给出最后答案)对长预算行为的破坏较小。这与业界目前在训练长序列代码智能体(例如 Composer 2.5)时采用的“注入简短目标反馈”策略不谋而合。在训练复杂的智能体时,如何克制地、以最低限度干预的方式提供环境反馈,将成为自强化学习能否成功的核心命题。
从“人类反馈”到“AI 自身反馈”,大模型的迭代正步入深水区。面对越来越黑盒的思考模型,这篇论文提醒我们,通往超级智能的道路或许没有捷径可走。保留对不确定性的敬畏,允许模型在迷宫中反复试错,才是真正孕育强大逻辑推理能力的温床。