SkillRise:单一策略边解题边进化技能,智能体RL性能提升达8.5%

SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

SkillRise:单一策略边解题边进化技能,智能体RL性能提升达8.5% 论文图示

在大语言模型(LLM)驱动的智能体(Agent)研究中,强化学习(RL)正在经历从“对话对齐”到“复杂环境交互决策”的关键跃迁。在真实的复杂应用场景里,智能体面对的往往不是孤立、单调的问题,而是一连串既有相通规律又各有差异的任务流。比如在家庭环境中,清扫桌面与清洗碗碟虽然操作对象不同,但感知、寻找工具、导航和防错重试的底层行为逻辑高度重合;在电商检索中,不同品类商品的参数筛选也共享着类似的决策套路。

ArXiv URL:https://arxiv.org/abs/2607.26784v1

然而,现有的智能体强化学习范式大多将每个任务视为完全独立的交互回合(Independent Episodes)。智能体在完成当前任务后,积累的所有试错轨迹被直接丢弃,进入新任务时依然只能从零开始探索。另一类致力于“经验积累”的方法则走向了两种极端:要么让模型在同一个任务上反复尝试、自我反思(如 Reflexion 或 LaMer),但学到的策略极度特化于该实例,难以跨任务迁移;要么构建包含外部技能池、向量检索与执行模块的多阶段流水线,导致系统过于臃肿,下游任务的成败很难清晰归因于技能提取本身的质量。

针对这一困境,来自美团、新加坡国立大学(NUS)、上海交通大学与浙江大学的研究团队提出了一套端到端强化学习框架——SkillRise。这项工作摒弃了复杂的外部记忆库与检索中介,仅用单一策略在连续递进的任务序列中交替执行“任务求解”与“技能文档提炼”,并提出了跨任务解耦的信用分配机制。

在 ALFWorld、WebShop 和 ScienceWorld 三大主流智能体评测基准上,SkillRise 的 Pass@1 成功率相比当前最强的 RL 基线(如 GiGPO)提升了 2.3 到 8.5 个百分点。更引人注目的是,它展现出了罕见的“跨任务测试期缩放”(Cross-Task Test-Time Scaling)特性:即便每个新任务只尝试一次,只要上游任务序列不断延长,智能体的解题能力就会持续单调上升;同时,其端到端极简设计将训练耗时压缩到了传统多阶段流水线的六分之一。

SkillRise 框架概览

为什么现有智能体难以实现跨任务技能自进化?

理解 SkillRise 的设计精妙之处,首先需要看清传统智能体强化学习的两大结构性瓶颈。

第一个瓶颈是独立回合假设带来的探索冗余。在标准的 Agentic RL 设定下,优化目标通常最大化单个任务指令下的交互期望回报:

\[\mathcal{J}(\theta)=\mathbb{E}_{x\sim\mathcal{D},\,\tau\sim\pi_{\theta}(\cdot\mid x)}\left[R(\tau)\right]\]

这意味着每次环境重置,历史交互轨迹所包含的程序性知识(Procedural Knowledge)都会被归零。即便模型处理了成百上千个相似任务,它在参数更新之外,无法在上下文窗口中显式保留通用的解决模式。

第二个瓶颈在于现有技能学习方案的“信用归因缠绕”。为了让智能体拥有记忆,学术界此前探索了两条主要路径。其一是单任务内的 Meta-RL,即让智能体在同一道题上多跑几次,通过自然语言反思前一次的失败原因来修正后续动作。这种方式虽然能提高重复尝试的成功率,但本质上是“背答案”或针对单一具体状态的过拟合,无法应对任务分布的动态变化。其二则是构建外置技能库,使用独立的模型提取技能,存入向量数据库,在遇到新任务时通过 RAG 机制检索相关技能并喂给执行模型。这种架构极其复杂,一旦下游任务失败,算法根本无法判断究竟是技能提炼得不好、检索模块没召回对,还是执行策略执行不到位,多阶段误差累积使得端到端强化学习的梯度信号极其模糊。

SkillRise 的核心出发点正是打破这些阻隔:能否将一系列相关的任务串联起来,让同一个模型既做“一线做题家”,又做“经验总结师”,并用下游新任务的实际表现,直接反哺上游经验总结的质量?

SkillRise 核心机制:递进任务链与双重角色轮替

SkillRise 的系统设计追求极度的紧凑与优雅。它不再维护庞杂的多模块组件,而是将任务编排、策略角色轮转与信用分配统一在纯粹的 RL 框架内。

整个流程始于跨任务序列构建(Cross-Task Sequence Construction)。研究团队根据环境提供的元数据,将具有相似结构规律但具体实例不同的任务划分到同一个家族。为了让经验能够由浅入深地顺畅迁移,序列内的任务被按照难度进行递进式排列。例如在 WebShop 任务中,模型先接触属性约束较少的基础商品购买需求,再逐步过渡到需要配置多重复杂选项的高难度请求。一个长度为 $K$ 的任务序列可以形式化表示为:

\[\mathbf{x} = (x_1, x_2, \dots, x_K)\]

在每个序列的交互过程中,智能体维护一份纯文本形态的动态进化技能文档(Evolving Skill Document)$S$。在任务序列开始前,技能文档为空:$S_0 = \varnothing$。随后,同一个策略模型 $\pi_\theta$ 开始沿着任务序列向前滚动推进,在每个任务节点上严格交替扮演两个角色:

首先是任务求解(Task Solving)。在面对第 $i$ 个任务 $x_i$ 时,策略以当前继承下来的技能文档 $S_{i-1}$ 为上下文参考,生成完整的交互决策轨迹 $\tau_i$,并获得环境给出的客观任务奖励:

\[\tau_i \sim \pi_\theta(\cdot \mid x_i, S_{i-1}), \qquad r_i = R(\tau_i)\]

需要特别强调的是,为了严格杜绝上下文长度爆炸和噪声干扰,上一任务的具体交互细节(如具体的环境反馈、原始观察字符串)绝不会直接传入下一个任务。技能文档 $S_{i-1}$ 是连接前后两个任务之间的唯一信息信道

紧接着是技能提炼与编辑(Skill Curation)。当前任务执行完毕后,策略模型立刻切换身份,输入上一版技能文档 $S_{i-1}$、刚刚完成的轨迹 $\tau_i$ 以及当前任务的真实胜负奖励 $r_i$,输出一份全新重写后的技能文档 $S_i$:

\[S_i \sim \pi_\theta(\cdot \mid S_{i-1}, \tau_i, r_i), \qquad i < K\]

在这个阶段,模型被要求做三件事:保留 $S_{i-1}$ 中已经被验证有效的普适技能;从刚刚结束的 $\tau_i$ 中提炼成功的标准化操作流程或深刻的失败避坑指南;果断剔除与具体实例绑定的无关细节。编辑完成的 $S_i$ 将作为纯粹的先验知识,直接交由第 $i+1$ 个任务的求解阶段使用。

角色感知的解耦信用分配与群体优化

让同一个策略同时兼顾“做事”和“总结”,最大的算法挑战在于奖励信号的时序错位。

显然,当前任务的求解轨迹 $\tau_i$ 好不好,应该由当前任务的成败 $r_i$ 立即评判;然而,在第 $i$ 个任务后生成的技能文档 $S_i$,其价值根本不可能在第 $i$ 个任务上体现——它的好坏,必须看它能不能帮助后续未知的任务($x_{i+1}, \dots, x_K$)取得更高的成功率。如果笼统地把整个序列的最终累计奖励平均分给所有步骤,就会不可避免地将当前执行动作的优劣与经验提炼的质量彻底混淆。

为此,SkillRise 提出了跨任务解耦信用分配(Decoupled Credit Assignment)。假设系统对同一序列并行采样 $N$ 条独立的探索路径,阶段标识符 $z \in {\mathrm{solve}, \mathrm{curate}}$,则两类角色的阶段级回报计算公式被严格解耦:

\[G_{i,z}^{(n)} = \begin{cases} r_i^{(n)}, & z = \mathrm{solve} \\[6pt] \sum_{j=i+1}^K \gamma^{\,j-i} r_j^{(n)}, & z = \mathrm{curate},\ i < K \end{cases}\]

其中 $\gamma \in [0, 1]$ 是跨任务折现因子。可以看到,求解角色只对眼前任务的胜负负责,享受即时反馈;而技能提炼角色则承担着“前人栽树,后人乘凉”的长期责任,其监督信号完全来源于下游未来任务的折现累计回报。越靠近当前任务的下游表现,所占的奖励权重越大,这高度符合技能迁移的时序影响力衰减规律。

在计算优势函数时,SkillRise 进一步采用了角色感知的群体相对优化(Role-aware Group-Relative Optimization)。它在共享相同任务组、序列阶段位置 $i$ 和行为角色 $z$ 的 $N$ 个并行试验样本之间计算基准均值与相对优势:

\[\overline{G}_{i,z} = \frac{1}{N} \sum_{n=1}^N G_{i,z}^{(n)}, \qquad A_{i,z}^{(n)} = G_{i,z}^{(n)} - \overline{G}_{i,z}\]

这一相对优势标量被直接赋予对应阶段由策略模型生成的所有 Token 上,并结合 PPO 式的截断代理目标(Clipped Surrogate Objective)更新共享参数 $\theta$:

\[\mathcal{J}(\theta) = \mathbb{E}_{n,i,z,t} \left[ \min\left( \rho_{i,z,t}^{(n)}(\theta) A_{i,z}^{(n)}, \operatorname{clip}\left(\rho_{i,z,t}^{(n)}(\theta), 1-\epsilon, 1+\epsilon\right) A_{i,z}^{(n)} \right) \right]\]

这种设计既避免了额外引入复杂的价值网络(Critic Network),又确保了同一套模型参数在两种迥异的功能诉求下,各自沿着正确的梯度方向共同演进。

全面超越强基线:三大复杂环境上的实证表现

为了全面检验该范式的有效性,研究者在三类最具代表性的智能体交互环境中开展了系统评测:涉及具身导航与物体操作的 ALFWorld(包含 Pick、Clean、Heat 等 6 类子任务)、考察网页多轮商品配置与购买决策的 WebShop,以及需要严密科学实验与长程推理的 ScienceWorld。所有受训基线统一采用开源性能卓越的 Qwen3 系列模型(1.7B 与 4B 版本)作为底座。

在最能反映智能体独立执行能力的 Pass@1 指标上,基于 Qwen3-4B 的 SkillRise 展现出统治级的表现:

对比标准 PPO、RLOO 和 GRPO 等单回合 RL 算法,SkillRise 的优势非常显著。原因在于,跨任务序列训练让策略反复观察到同类交互流程在不同具体实例中的多样化演变。这种结构化的训练信号极大地降低了模型识别底层不变规律的难度,使得可迁移的解题套路被更高效地内化到了模型权重之中。

更令人惊喜的是,SkillRise 展现出了极佳的单任务反思泛化能力。虽然 SkillRise 在训练时专门接受的是“跨越不同任务”的提炼训练,但当研究团队在测试阶段让其在同一个失败任务上连续重试(即评估 Pass@2 和 Pass@3),并允许其将提炼的技能文档保留到下一次尝试时,SkillRise 在三大基准的 Pass@3 表现分别达到了 92.2%、96.1% 和 61.0%。这一成绩不仅大幅拉开与常规 RL 的差距,甚至全面碾压了专门针对单任务反复尝试进行 Meta-RL 训练的基线模型 LaMer(在 ScienceWorld 上超越 LaMer 达 14.2 个百分点)。这表明,SkillRise 所学会的“从行动轨迹提炼经验”的能力具有很强的元学习通用性,它不仅学会了跨任务迁移,更习得了一套通用的“认知诊断与自我纠偏”方法论。

跨任务测试期缩放:越做越聪明的涌现特性

在当前大模型领域,“测试期计算缩放”(Test-Time Scaling)大多依赖于思维链采样(如重复采样通过多数投票表决)。然而,SkillRise 揭示出了一种全新的缩放维度:基于跨任务经验积累的测试期能力扩展

研究团队将评测集划分为长度分别为 $K \in {2, 4, 6}$ 的相关任务链,在测试阶段允许 SkillRise 沿途滚动更新技能文档,但关键约束在于:每个任务实例仅允许尝试一次(Pass@1),绝不给重试机会

实验结果呈现出一条极为清晰且令人振奋的曲线:随着序列长度从 $K=2$ 延长到 $K=6$,SkillRise 在 ALFWorld 上的单次解题成功率从 83.6% 一路单调递增至 87.5%。与此同时,对比基线如 GRPO、GiGPO 以及 LaMer 随着序列拉长,性能曲线基本处于水平震荡状态,它们与 SkillRise 之间的差距从 3.9 个百分点被迅速拉大到 8.6 个百分点。

这一现象具有极高的科学含金量。它有力地证明:SkillRise 的性能增长绝对不是来自于对单一任务实例的“碰运气式”多重采样,而是源于智能体真正读懂并继承了前序任务沉淀下来的程序化技能。随着交互链条的推进,技能文档被层层萃取、去粗取精,后置任务得以站在更前沿的“认知肩膀”上展开行动。

此外,模型尺寸的消融实验也呼应了这一结论。从 Qwen3-1.7B 扩展到 4B 时,GRPO 的 Pass@1 提升了 4.7 个百分点,LaMer 提升了 3.3 个百分点,而 SkillRise 的性能跃升幅度达到了惊人的 +7.8 个百分点。这说明跨任务抽象与双重角色切换对模型的认知容量提出了更高的要求,而一旦底座模型的逻辑与表达能力变强,SkillRise 框架所释放出的自演进红利将呈现非线性的加速放大。

机制消融与效率对比:抛弃臃肿流水线的胜利

为了探究 SkillRise 内部各组件的实际贡献,论文展开了深度的消融实验:

其一是技能提炼机制本身的必要性。研究团队构建了一个“无提炼”(no-curation)的对照变体,同样输入包含 3 个相关任务的递进序列和同等的环境交互预算,但粗暴抹去任务之间的文档提炼阶段,禁止跨任务传递先验。训练曲线显示,在训练初期三者曲线重合,但随着数据积累,SkillRise 迅速与该变体拉开差距,并在最终收敛时领先“无提炼”变体近 3 个百分点,领先标准 GRPO 超过 6 个百分点。这充分证实,仅靠把任务按顺序排在一起训练是远远不够的,显式的“轨迹总结—经验外化—注入下游”闭环是实现知识正向迁移的根本动力。

其二是折现因子 $\gamma$ 的鲁棒性。当研究人员将跨任务未来折现因子在 $\gamma \in {0.3, 0.4, 0.6, 0.7}$ 之间进行大幅调整时,四条学习曲线的演进轨迹高度吻合,最终收敛浮动控制在极窄的 1 个百分点以内。这证明解耦信用分配机制具有很强的容错度,无需耗费巨大算力去精细网格调参即可稳定发挥作用。

除了算法效果,工程训练效率是这篇论文另一大颠覆认知之处。长久以来,学术界普遍认为跨任务技能库必须依赖“提取器—外部存储—检索引擎—执行器”的复杂系统(如 RetroAgent、SkillRL 等)。然而,在相同的 NVIDIA H800 计算集群环境下,SkillRise 在 ALFWorld 上不仅取得了与之媲美甚至更优的成功率(85.9%,大幅领先 SkillRL 达 12.5 个百分点),其端到端整体运行时间仅为 RetroAgent 的六分之一($6.0\times$ 加速),仅为 SkillRL 的四分之一($4.3\times$ 加速)

事实证明,将技能压缩为单一上下文文档并通过强化学习直接监督,彻底免去了外部教师模型标注、向量相似度索引维护和跨模块通信的巨大开销。端到端的纯粹设计,在智能体自进化领域展现出了压倒性的计算性价比。

总结与未来展望

SkillRise 为大语言模型智能体的自主进化提供了一套高度自洽、简洁而强大的全新范式。它打破了传统 RL 将任务割裂对待的局限,用纯文本技能文档作为最小化跨任务信道,用单一策略模型巧妙平衡了“当下行动”与“后继赋能”,并用跨任务解耦的信用分配彻底理清了技能提炼的时序奖励归因。

当然,作为这一探索方向的先锋之作,SkillRise 目前仍存在一定的局限。当前的实验依赖于环境预设的元数据来进行任务家族聚类与难度编排;在完全开放、非结构化的真实任务流中,智能体如何自主感知任务之间的关联性并动态构建学习曲率,仍有待更深入的算法突破。此外,当前验证主要集中在 4B 参数规模的文本决策基准上,未来将其推向百亿甚至更大参数规模的多模态、真实具身操作系统,无疑具备更加广阔的想象空间。

无论是从算法思想还是工程实践的角度来看,SkillRise 都向我们揭示了一个明确的信号:智能体的自我完善,并不一定需要堆砌复杂的外部辅助轮。让模型在真实的连续任务中边做边学、边思边改,用未来的成功来标定历史的智慧,大模型本身的程序性推理潜能便足以支撑起令人惊叹的自演进之路。