SEED:自我进化同策略蒸馏,40%数据即可匹敌全量强化学习

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

SEED:自我进化同策略蒸馏,40%数据即可匹敌全量强化学习 论文图示

随着大语言模型逐渐从单轮问答转向需要长期规划、多轮交互以及工具调用的智能体(Agent)任务,强化学习(RL)正成为大模型后训练阶段的核心范式。然而,在面对复杂的长周期任务时,传统的基于结果的强化学习面临着极其严重的监督信号稀疏问题。针对这一困境,清华大学、南洋理工大学等机构的研究团队提出了一种全新的自我进化同策略蒸馏框架 SEEDSElf-Evolving On-Policy Distillation)。该方法巧妙地将智能体完成任务后的“后见之明”转化为密集的词元(Token)级监督信号。

ArXiv URL:https://arxiv.org/abs/2607.14777v1

最值得关注的结论是,SEED 在不增加推理时任何额外提示负担的前提下,不仅在多个复杂智能体基准测试中展现出断层式的性能优势,其样本效率更是实现了质的飞跃。实验表明,SEED 仅需使用 40% 的训练数据,就能达到甚至超越使用 100% 数据进行全量 GRPO 强化学习的性能水平。这一成果为解决大模型在长视野任务中的决策信用分配问题提供了一条极具价值的新路径。

长周期任务中的“监督鸿沟”

在探讨 SEED 的核心机制之前,我们必须先理清当前大模型智能体在强化学习中遭遇的根本性痛点。当我们在训练一个能够在虚拟环境中导航、在网页上购物或者进行复杂逻辑检索的智能体时,我们通常采用基于结果的强化学习优化范式。这种范式的逻辑非常直观:智能体在环境中进行一系列探索,如果最终成功完成了任务,环境给予正向奖励;如果失败,则给予低分或零分。

这种轨迹级别的标量奖励在短任务中行之有效,但在长周期环境里却显得捉襟见肘。一个典型的失败轨迹可能包含了数十步精彩的中间推理和正确的局部操作,仅仅因为最后一步工具调用失败而导致全盘皆输;反之,一个成功的轨迹中也可能包含着大量可以被复用、泛化的高效策略,但单一的最终得分根本无法告诉模型“你到底是在哪一步做对了,哪一步做错了”。

这就造成了所谓的“监督鸿沟”(Supervision Gap)。基于结果的奖励是轨迹级别的,而策略模型的学习和参数更新却是词元级别的。缺乏细粒度的、决策级别的信用分配,导致模型在漫长的交互历史中只能盲目摸索,极大地降低了样本效率和最终的收敛上限。

研究人员敏锐地捕捉到了一个关键现象:当一次完整的交互轨迹结束时,无论成功与否,这段完整的历史记录都蕴含着在线决策时无法获取的“后见之明”(Hindsight)。在轨迹结束后,我们可以清晰地看到哪些子目标被实现了,模型在哪个节点偏离了正确的策略,哪些环境观察是决定性的,以及哪些避坑规则可以转移到未来的尝试中。尽管先前的许多研究也尝试利用这种后验知识,但它们往往将其作为静态的经验回放、推理时的外部上下文或者是需要额外检索的记忆模块。这些做法不仅增加了模型部署时的计算开销,更无法让模型真正将这些高维的策略内化到自身的参数中。

针对这一问题,SEED 给出的答案是:将模型自身生成的后验轨迹动态转化为参数化的监督信号,让策略模型在不断进化的过程中自我吸收这些“后见之明”。

整体性能概览

突破静态束缚的自我进化循环

为了将后验信息无缝注入到决策级别的学习中,SEED 框架采用了同策略蒸馏(On-Policy Distillation)机制。经典的知识蒸馏通常依赖一个强大的外部教师模型来指导学生模型,但这在智能体强化学习中存在明显的局限性。随着策略的不断优化,模型会遇到全新的状态空间、全新的有效策略以及全新的失败模式。如果指导信号来自于一个固定的静态数据集或一个不会自我更新的外部教师,那么这种监督不仅会过时,甚至会因为分布偏移(Distribution Mismatch)对模型的进一步提升产生负面干扰。

因此,有效的后验监督必须满足三个硬性条件:第一,必须是同策略的(On-policy),因为有价值的纠正信号必须基于当前策略所诱导出的真实状态和错误;第二,必须是密集的(Dense),能够为每一个决策词元提供指导;第三,必须是自我进化的(Self-evolving),轨迹分析能力需要与策略模型的决策能力同步成长。

基于上述理念,SEED 框架被设计为两个渐进的训练阶段。

SEED框架概览

第一阶段:后见技能的监督微调(SFT)

第一阶段的目标是赋予策略模型分析完整交互历史并生成自然语言“后见技能”(Hindsight Skills)的能力。研究团队首先使用未经过技能增强的基础策略模型在环境中进行离线轨迹收集。由于这些轨迹是在没有任何额外技能提示的常规上下文中生成的,它们完美保留了普通智能体在环境中的真实交互分布。

随后,研究团队引入一个外部的轨迹分析器,对这些已完成的轨迹进行分析,提取出后见技能注释。这些注释本质上是对可复用工作流、决定性观察结果或失败规避规则的自然语言总结。在这个阶段,基础模型通过标准的监督微调(SFT)学习从完整的交互轨迹中预测对应的后见技能。

这一阶段的精妙之处在于,经过微调后,同一个自回归语言模型同时具备了两个身份:它既能在常规环境中扮演执行任务的“行动者”,又能在任务结束后扮演审视全局的“分析者”。这为第二阶段摆脱外部依赖、实现自我进化奠定了模型基础。

第二阶段:自我进化同策略蒸馏

这是 SEED 框架的核心引擎。在强化学习过程中的每一次更新迭代之初,SEED 会冻结当前策略的一份快照。这份快照模型在这一轮迭代中将同时承担两项重任:它既负责在环境中通过采样收集当前策略下的交互轨迹,又负责分析这些刚刚收集到的完整轨迹,从中提取出高质量的自然语言后见技能。

由于这两个角色共享同一套参数快照,当策略模型在强化学习的驱动下不断迭代更新时,它所采样的轨迹质量在提升,同时它分析轨迹、提取后见技能的能力也在同步进化。这就彻底打破了传统蒸馏方法中“死板教师”的瓶颈,让指导信号能够始终紧贴模型当前的探索边界。

在获取了后见技能之后,SEED 需要将这些高维的语言指导转化为底层的梯度信号。具体操作是:保持智能体在原始轨迹中采样的真实动作不变,然后分别在“普通上下文”和“注入了后见技能增强的上下文”下,让模型对这些固定动作重新进行打分。

这种打分过程在数学上被严格定义为概率偏移的计算。当模型在拥有了后见技能的“上帝视角”后,它会对某些真正正确的动作赋予更高的对数概率,而对那些错误尝试的概率评价则会降低。SEED 敏锐地捕捉到了这种由技能引入的概率偏移,并将其转化为一个密集型的词元级同策略蒸馏信号。

在联合训练目标中,SEED 将传统的基于结果的 GRPO(组相对策略优化)目标与这种密集的蒸馏目标进行了深度的联合优化。一方面,全局的轨迹奖励确保了模型始终朝着解决最终任务的大方向迈进;另一方面,通过重新打分构建的门控负对数似然损失,迫使普通策略在不接触技能提示的情况下,自发地提高那些被后见视角所认可的优质词元的生成概率。通过这种双管齐下的优化,模型在训练期间内化了技能的行为逻辑,而在推理部署时,由于不需要挂载任何额外的技能提取模块或长篇提示,模型的执行效率和纯粹度得到了最大程度的保障。

实验论证:以少胜多的数据效率

为了全面验证 SEED 的有效性,研究团队在涵盖了具体物理世界具身控制、开放域网页导航以及基于搜索的复杂问答三大核心场景的基准测试(ALFWorldWebShopSearch-based QA)上进行了广泛的大规模实验。实验覆盖了 Qwen2.5-3BQwen2.5-7B 以及参数量更小的 Qwen3-1.7B 多个量级的开源指令微调基座。

实验结果揭示了几个具有行业指导意义的核心现象。

首先,自我进化的后验蒸馏展现出对静态自我蒸馏的绝对压制力。在所有的聚合对比中,SEED 在绝大多数指标上都取得了最优表现。这种优势在极度考验长序列执行与状态跟踪的 ALFWorld 基准上表现得尤为明显。对于参数量较小的 Qwen3-1.7B 模型,SEED 甚至比最强的静态基线方法高出了惊人的 38.1 个百分点。这一数据强有力地证明,当模型的试错空间巨大且容易陷入策略死胡同时,让监督信号随模型当前遇到的具体困境动态调整,能够极大程度地激发小参数模型的内在逻辑潜力。

样本效率与泛化对比图

更为炸裂的发现来自于对样本效率(Sample Efficiency)的深度剖析。强化学习在训练大语言模型时最令人头疼的成本往往来自于环境交互和轨迹采样的大量数据需求。上图展示了不同数据留存比例下的性能变化轨迹。数据清晰地表明,SEED 能够在极少的数据喂养下,迅速逼近甚至超越传统方法的上限。

具体而言,在使用 100% 完整训练集的情况下,传统的 GRPO 方法能够将模型的成功率推升至 75.0 左右。而 SEED 仅仅使用了 60% 的训练实例,其性能评分就已经达到了 80.7,实现了对满血 GRPO 的强势反超。当数据量进一步被缩减至 40% 时,SEED 依然能够维持 58.9 的成绩,这与 GRPO 在消耗了其两倍(80%)数据量时所取得的 58.6 的成绩几乎完全持平。

这种以 40% 数据匹敌全量数据的能力,从根本上改变了智能体强化学习的成本核算逻辑。它证明了在每一个漫长的失败或成功轨迹中,实际上隐藏着海量未被充分利用的决策指导。传统的标量结果就像是只看考试最终成绩而不看解题过程,而 SEED 则是让模型在做完每套卷子后,自己写一份详尽的错题本和思路总结,并把这些反思直接烙印在神经元的权重连接中。因此,模型从单条轨迹中榨取的有效信息密度呈指数级上升,极大地加速了策略向最优解收敛的速度。

泛化与消融对比图

除了训练阶段的高效,SEED 还赋予了模型极强的跨域泛化韧性。为了验证模型是否只是通过死记硬背训练集里的轨迹来刷高分数,研究团队在 ALFWorld 的未见测试集(Unseen split)上对 3B 规模的检查点进行了严苛的测试。如上图所示,与单纯依靠环境反馈盲目摸索的 GRPO 相比,经过 SEED 联合优化的策略将宏观平均成功率从 70.9 大幅拉升至 86.2,提升幅度高达 15.3 个百分点。

尤其在诸如加热物品(Heat,提升 35.0 点)和寻找物品(Look,提升 18.3 点)等高度依赖常识推理和环境试错调整的任务族中,SEED 展现出了降维打击般的适应能力。这说明,通过后见技能的密集词元级蒸馏,模型学到的不再是“在地图坐标 A 点击按钮 B”这样脆弱的机械记忆,而是真正内化了“如果找不到物品,应该优先排查视线盲区并重新规划搜索路径”这种高阶的行为模式。

结语

从技术演进的宏观视角来看,SEED 提供了一种优雅而深刻的破局思路。面对复杂智能体任务中结果反馈极度稀疏的困境,研究者没有选择在奖励工程(Reward Engineering)上进行繁琐的人工设计,也没有倒退回依赖人类专家提供密集标注的传统老路。相反,他们充分挖掘了当前大语言模型已经具备的强大的自然语言归纳与逻辑反思能力。

通过精心设计的两阶段训练和“自我进化同策略蒸馏”的闭环,SEED 让大模型成为了自己的高级战术教练。这种在保持推断期极致轻量化的同时,在训练期无限制地榨取后验信息并转化为密集参数级监督信号的方法论,不仅为提升大模型智能体的任务成功率和样本效率树立了新的标杆,也为未来通向完全自主、能够持续自我改进的高级强化学习智能体系统,提供了一块坚实的基石。