SSPO:步级自蒸馏机制,仅5%开销超越双倍训练步数GRPO

Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents

SSPO:步级自蒸馏机制,仅5%开销超越双倍训练步数GRPO 论文图示

大型语言模型在处理现实世界任务时,正越来越依赖于多步推理与外部工具调用的结合。尤其是面对模糊、信息不全的用户查询,深度搜索智能体(Deep Search Agents)需要在广阔的开放网络中主动探索,其交互轨迹往往会跨越数十个步骤。然而,在训练这类复杂智能体时,当前主流的强化学习范式遭遇了一个极为致命的瓶颈:信用分配(Credit Assignment)极度稀疏。一条包含二十多个步骤的长轨迹,往往只能在最终结束时获得一个单一的二元结果奖励。面对这种极其稀疏的监督信号,模型根本无法分辨在这漫长的探索过程中,究竟是哪一步直接导致了最终的成功,又是哪一步酿成了彻底的失败。

ArXiv URL:https://arxiv.org/abs/2608.12764v1

为了引入更密集的监督信号,同策略自蒸馏(On-Policy Self-Distillation,OPSD)成为了一种备受瞩目的方案。它通过引入包含正确答案等特权信息,让模型自己作为“教师”,为探索中的“学生”提供词元级别的密集反馈。但在多轮搜索场景中,这种直接的自蒸馏引发了严重的结构性矛盾:拥有特权信息的教师模型因为“开了天眼”,会表现出极度精简的分布(平均仅需3.5个步骤即可完成),而学生模型在未知的网络中需要试错和推理(平均需要17.7个步骤)。如果强行让学生去拟合教师的分布,学生模型非但学不到更好的搜索策略,反而会过早放弃探索,导致能力退化。

针对这一困境,华为与香港科技大学的研究团队提出了一种全新的解决方案——步级自蒸馏策略优化(Step-Level Self-Distilled Policy Optimization,SSPO)。该方法包含两大核心创新:首先,构建了名为 Evidence Anchors 的特权信息结构,它将提取自网络的关键证据片段作为步级引导,既能捕捉关键推理节点,又避免了直接泄露完整答案路径;其次,SSPO 巧妙地将教师与学生在步级上的分布分歧,转化为 GRPO 算法中的优势权重(Advantage Weights),并仅对错误的轨迹生效。这一设计成功实现了“更新方向”与“更新幅度”的解耦。实验表明,在 Qwen3-8B 模型上,SSPO 在 BrowseComp、GAIA 和 FRAMES 三大基准测试中全面优于传统的 GRPO,在仅增加约 5% 前向传播计算开销的情况下,其效果甚至超越了经过双倍梯度步数训练的 GRPO 模型。

深度搜索智能体的信度分配危机

要深刻理解 SSPO 为什么有效,我们需要先拆解当前搜索智能体训练中的底层痛点。现代搜索智能体通常基于 ReAct 范式构建,模型在给出最终答案之前,需要交替生成思考过程(Thought)和执行动作(Action,例如调用搜索或浏览工具),并接收环境反馈的观察结果(Observation)。这种模式使得搜索不仅是对内部知识的检索,更是一个动态的、依赖外部信息反馈的序列决策过程。

在传统的基于可验证奖励的强化学习(RLVR)设定中,训练往往依赖于一个最终的结果奖励。只有当智能体生成的最终答案与真实标准答案在语义上完全一致时,才能获得一个正向的正确性奖励。为了让模型遵循特定的工具调用格式,通常还会辅以少量的格式奖励。当前最流行的优化算法是 GRPO(Group Relative Policy Optimization),它通过对同一个问题采样多条轨迹,计算它们之间的相对优势,并以此来更新策略。

然而,GRPO 的一个核心机制成为了多步深度搜索的致命伤:在同一条轨迹中,所有的动作词元共享同一个序列级别的优势估计。这意味着,如果智能体在前面十九步进行了非常精彩的逻辑推理和精准的信息检索,却仅仅在第二十步得出了错误的结论,那么前面十九步所有卓越的探索行为,都会和最后一步的错误一样,受到无差别的惩罚。这种一刀切的策略更新方式,使得模型极其难以在漫长的试错中保留下有价值的局部探索策略。

自蒸馏在多轮搜索中的水土不服

为了打破这种稀疏奖励的僵局,研究者们自然而然地想到了引入过程监督。但构建高质量的过程奖励模型(PRM)不仅需要海量的人工标注数据,泛化能力也往往不尽如人意。因此,同策略自蒸馏(OPSD)提供了一条更具性价比的路径:无需外部教师,直接将参考答案或环境反馈作为特权信息输入给模型自身,利用其在特权信息加持下输出的词元概率分布,来指导没有任何特权信息的“学生状态”模型。

在数学推理或代码生成等单轮任务中,这种方法取得了显著成功。但在多轮开放域搜索中,直接套用 OPSD 却遭遇了灾难性的失败。这是因为多轮搜索打破了单轮自蒸馏赖以生存的两个隐含假设:

第一,教师与学生行为差距可控的假设被打破。在数学题中,知道答案和不知道答案的推理过程在结构上往往是相似的;但在网络搜索中,如果教师模型已经看到了标准答案和高度浓缩的参考证据,它的最优策略就是直接输出答案,或者只进行象征性的验证检索。研究团队发现,带有特权信息的教师模型平均单条轨迹仅产生 3.5 次工具调用,而面对真实未知环境的学生模型则需要 17.7 次。如果采用传统的直接蒸馏方法,最小化两者之间的 KL 散度,学生模型就会盲目模仿教师这种“跳步”的短视行为,导致在遇到真实难题时过早放弃工具调用,从而引发搜索策略的彻底崩盘。

第二,天然特权信息存在的假设被打破。在代码任务中,编译器报错就是最天然的特权信息;在数学任务中,标准解题步骤也是现成的。但在开放式的网络提问面前,“正确的搜索路径”往往是不唯一的,甚至是不存在的。没有任何一种天然的监督信号既能给教师提供充足的信息量,又能安全地蒸馏给学生而不引发捷径依赖。

破局点一:Evidence Anchors 重塑特权信息

面对上述挑战,研究团队认识到,搜索行为的监督信号必须建立在“信息搜寻动作”的层面上,而不是简单的词元生成层面上。为了构造出既能有效指导搜索,又不会让模型产生依赖的特权信息,他们提出了一种名为 Evidence Anchors(证据锚点)的创新结构。

在多轮搜索中,智能体可能需要阅读数十万字的网页内容。如果直接将表现最好的历史轨迹作为特权信息,不仅会导致上下文窗口爆炸,而且对于指导当前的具体动作往往是不充分的。Evidence Anchors 是一种紧凑的、基于步级的证据片段。它们是从广阔的网络信息中提取出来的,包含了回答问题所需的关键事实或中间推理节点,但刻意保留了信息的碎片化,没有串联成一条完整的答案路径。

Teacher prompt template incorporating evidence anchors

如上图所示,教师模型在接收提示词时,除了原始的用户问题,还会额外接收到这些 Evidence Anchors,以及学生模型之前生成的错误答案。这些锚点就像是在黑暗迷宫中点亮的关键路灯,它们并不直接画出从入口到出口的完整地图,但能让教师模型清楚地判断出,当前学生模型所处的这一个步骤,是否正朝着正确的路灯靠近。通过这种方式,Evidence Anchors 成功地将特权信息与搜索动作的自然粒度对齐,使得教师模型能够对学生的每一步检索行为给出准确的价值判断。

破局点二:解耦方向与幅度的步级优势权重

有了合适的特权信息,更关键的问题是如何将教师的指导信号安全地注入到 GRPO 的更新过程中。强行覆盖学生分布已被证明不可行,SSPO 提出了一种极为优雅的处理方式:将教师与学生在概率分布上的分歧,转化为 GRPO 算法中的优势权重乘子(Advantage Weights),并且仅应用于那些最终结果错误的轨迹

在强化学习的策略更新中,更新的“方向”(即鼓励还是抑制)与更新的“幅度”(即参数改变的多少)通常是高度耦合的。但在 SSPO 的设计中,这两者被彻底解耦:

具体而言,SSPO 计算了一个步级的分歧指标 $\Delta_{\tau}^{step}$,它反映了在某个信息搜寻步骤上,教师分布相对于学生分布的对数概率差异。基于这个差异,SSPO 构造了一个权重因子 $w$ 来调制原本的优势函数值。这个权重因子发挥作用的机制堪称精妙,我们不妨通过两个典型的错误轨迹场景来深入解析:

场景一:学生过度自信,但教师极不认同。

在一条最终失败的探索轨迹中,学生模型在某一步非常确信地调用了一个完全偏离主题的搜索词。此时,学生认为该动作概率极高(接近1),但看到了 Evidence Anchors 的教师模型清楚这与关键证据毫不相干,认为该动作概率极低(接近0)。这种情况下,$\Delta_{\tau}^{step}$ 为负。由于这条轨迹本身就是失败的(整体优势为负),SSPO 的数学形式会让最终的权重乘子 $w > 1$。这意味着,对于这种“盲目自信且确实带偏了最终结果”的错误步骤,系统将成倍放大它的惩罚力度,有效遏制了模型在无效路径上的资源浪费。

场景二:学生充满不确定,但教师高度认可。

同样是在一条失败的轨迹中,学生在早期可能误打误撞或者通过初步推理,提出了一个非常关键的查询请求(例如提取出了某个核心实体的名字)。但由于后续步骤的失误,导致整条轨迹依然被判定为错误。在这极其关键的正确步骤上,学生可能因为环境信息的模棱两可而显得不够自信(概率较低);然而,拥有上帝视角的教师模型通过比对 Evidence Anchors,发现这正是破局的关键,因此给出极高的认可概率。此时,$\Delta_{\tau}^{step}$ 为正。按照 SSPO 的机制,此时的权重乘子 $w < 1$。这就意味着,即便整个轨迹失败了,系统对于这个被教师认可的“好步骤”也会极大地减轻惩罚力度

通过这种“赏罚分明”的动态缩放,SSPO 能够在失败的轨迹中精确剥离出有价值的局部探索,同时重锤打击那些造成失败的真正元凶。更重要的是,SSPO 刻意避开了对正确轨迹的干预。那些最终能够得出正确结论的探索轨迹,本身就代表了模型在未知环境中的多样化解题能力。如果不加区分地对正确轨迹也施加教师模型的约束,必然会扼杀这种宝贵的多样性。SSPO 选择“只修剪枯枝,不干涉花朵”,最大程度保留了智能体在开放域的探索活力。

实验验证:双倍效率与稳健的训练动态

为了全面验证 SSPO 的有效性,研究团队选择了具有 80 亿参数的 Qwen3-8B 作为基础模型,并在 BrowseComp、GAIA 和 FRAMES 这三个极具挑战性的信息检索与推理基准上进行了详尽的评估。

实验结果展现出了惊人的效率跃升。在三个基准测试的平均得分上,经过冷启动初始化的基线模型表现平平,而使用常规 GRPO 训练带来的提升为 +2.4。相比之下,采用 SSPO 训练的模型实现了 +4.8 的大幅提升,性能增益直接翻倍。值得注意的是,这种性能的飞跃并没有以牺牲推理效率为代价,SSPO 训练的模型在平均交互轮数上(20.5 轮)与 GRPO(20.0 轮)几乎持平。

更为关键的是 SSPO 展现出的极其卓越的样本效率(Sample Efficiency)。研究团队做了一个极具说服力的对比实验:将 GRPO 的训练步数拉长至 200 步,而 SSPO 依然只训练 100 步。结果表明,仅训练 100 步的 SSPO,其最终性能不仅追平甚至在多项指标上反超了训练了 200 步的 GRPO 模型。而实现这一双倍样本效率的代价微乎其微——仅仅是由于需要在训练期间额外运行一次教师模型的前向传播,使得每步的计算开销增加了约 5%。用 5% 的算力成本换取 100% 的训练效率提升,这在当前算力极其昂贵的大模型训练背景下,具有巨大的工程应用价值。

如果进一步剖析训练过程中的动态曲线,我们可以发现 SSPO 在深层优化逻辑上的优越性。在传统的 GRPO 训练中,梯度范数往往会在训练初期迅速衰减,这意味着模型很快就陷入了局部最优,无法从稀疏的结果奖励中榨取更多有用的更新信号。而 SSPO 的梯度范数在整个训练周期内始终保持在一个相对较高的水平,这表明教师模型提供的密集步级分歧信号,在源源不断地为模型注入高质量的纠偏梯度。与此同时,两种方法的策略熵曲线保持着高度一致。这排除了一个潜在的假象,即 SSPO 的提升并不是因为它促使模型进行了无序的随机探索(高熵),而是确确实实地依靠更精准的参数更新,在同样的探索空间内找到了更优的决策边界。

剥离分析与案例洞察:为什么必须是“步级”?

在消融实验(Ablation Study)中,研究团队深入探讨了 SSPO 各个机制模块的不可替代性,其中最引人深思的是关于监督粒度(Token-level vs Step-level)的对比。

在许多针对数学逻辑的自蒸馏研究中,监督信号通常细化到每一个词元。然而,当研究团队尝试在搜索任务中将 SSPO 的优势权重强行拆解到词元级别时,模型的准确率出现了明显的下滑。深究其背后的原因,这涉及对“搜索”这一行为本质的理解。

在深度搜索智能体中,一个完整的动作(Action)是由连贯的思考、特定的工具名称以及具体的查询参数共同组成的。如果在词元级别进行打分,就有可能出现极其荒谬的现象:例如在调用搜索工具输入“量子计算发展史”时,“量子”这个词元被教师判定为低分并受到惩罚,而“计算”这个词元却被判定为高分。这种割裂的信号会彻底破坏智能体对工具调用语义的整体认知。SSPO 聪明地选择在整个推理和动作生成的完整步骤内,共享基于联合概率计算出的单一权重。这不仅稳定了策略熵的演变,更确保了监督信号与信息搜寻行动的自然基本单元保持完美对齐。

此外,研究人员还对特权信息的两大来源——Evidence Anchors 和“错误答案反馈”——进行了剥离分析。结果显示,如果仅给教师提供模型之前犯错的答案,对准确率的提升微乎其微;而如果仅提供 Evidence Anchors,则能带来可观的增益。当两者结合时,效果达到最优。这确凿地证明了,在开放式搜索中,提供结构化的中间证据片段,是提供高质量过程监督的核心关键。

最后,通过对模型受惩罚步骤的案例分析,研究者揭示了 SSPO 塑造智能体行为的具体方式。数据显示,教师模型并不是机械地根据动作文本与 Evidence Anchors 的字面重合度来分配惩罚。相反,它高度具备语义判别力:对于那些高度聚焦、能够精确定位并验证事实的检索动作,哪怕没有命中正确结果,SSPO 也会显著减轻对其的惩罚;而对于那些大水漫灌式、查询条件极为发散且定位模糊的低效多重查询,哪怕其中包含了一些与核心证据字面重合的关键词,SSPO 依然会给予严厉的惩罚缩放。这种倾向性正是深度搜索最需要的:引导智能体学会精准提问,而非盲目发散。

结语

在大型语言模型从单纯的对话助手向自主解决复杂任务的 Agent 演进的过程中,多步决策的信用分配始终是一块难啃的硬骨头。华为与香港科技大学提出的 SSPO 算法,不仅为深度搜索智能体提供了一种极具性价比的训练范式,更在强化学习与自蒸馏的结合点上做出了极具启发性的理论探索。

通过引入 Evidence Anchors 作为步级锚点,并创造性地将蒸馏信号降维为不对称的优势权重乘子,SSPO 成功跳出了“直接拟合引发能力坍塌”的陷阱。它以区区 5% 的额外算力开销,就换来了超越双倍训练步数的优化效率。这项工作不仅证明了即使在没有天然环境反馈的开放域搜索中,高质量的过程监督依然可以通过模型自举来获得,也为未来在更广泛的复杂工具调用、多模态自主操作等长周期 Agent 任务中解决奖励稀疏问题,指明了一条极具潜力的演进路线。