告别“一次性”Agent!SkillOS重塑技能管理,性能跃升近10%

SkillOS: Learning Skill Curation for Self-Evolving Agents

当前的大模型智能体Agent)普遍存在一个极大的局限性:它们往往是“一次性”的解题机器。 在处理完一个复杂的流式任务后,它们通常无法从历史交互中吸取教训并积累经验。 面对源源不断的新任务,如果Agent每次都要从零开始摸索,注定无法胜任复杂的现实世界需求。 为了打破这一僵局,来自Google、MIT等机构的研究团队提出了一套全新范式——SkillOS。 这是一种由经验驱动的强化学习训练方法,专门用于让Agent学会自主进行技能管理。 实验表明,它不仅能将基线性能相对提升近$10\%$,还能大幅降低任务所需的交互步数,让AI真正具备了长期的自我进化能力。

ArXiv URL:http://arxiv.org/abs/2605.06614v1

突破技能管理的系统瓶颈

要让Agent实现从“单次解题”到“长期精通”的跨越,建立有效的过程记忆Procedural Memory)是绝对的核心。 在实际应用中,这种记忆通常体现为从过去经验中提取出的、可复用的技能。 一个理想的自进化Agent应当遵循这样的闭环:面对新任务,检索相关技能指导执行;任务结束后,根据执行轨迹更新自身的技能库。

在这个闭环中,高质量的技能管理成为了系统最大的瓶颈。 目前社区广泛采用的方法存在明显缺陷。 手动编写和整理技能库,极其耗费人类专家的精力,且根本无法覆盖Agent在旷野中可能遇到的海量任务多样性。 另一方面,基于固定提示词或启发式规则的方法,由于缺乏对下游实际表现的反馈感知,显得非常死板。 即便是近期一些引入强化学习的研究,也多局限于短期的技能适应,难以从极其间接、延迟的反馈中,学会复杂的长期管理策略(如更新过时技能、删除有害技能)。

双智能体协同架构

面对这一核心痛点,SkillOS提出了一种极其巧妙的模块化架构设计。 系统被物理隔离为两个各司其职的核心角色:处于冻结状态的代理执行器Agent Executor),以及可被训练的技能管理员Skill Curator)。

Refer to caption

为了更直观地理解这种设计,我们可以将其类比为现代计算机操作系统的底层运作逻辑。 这里的执行器就像是系统的CPU或应用程序,它不关心底层的存储逻辑,只负责从外部调用所需的技能,专心致志地解决眼前的任务。 而技能管理员则扮演着操作系统中“文件系统后台进程”的角色。 它在后台默默观察执行器的运行轨迹,以及最终任务的成功与否。 技能本身被统一格式化为结构清晰的Markdown文件,存放在外部的技能库SkillRepo)中。

当一个任务周期结束后,管理员会根据观察到的经验,通过严格定义的函数调用,对技能库进行干预。 这些操作包括精准地插入新技能($insert_skill$)、修改已有但存在瑕疵的技能($update_skill$),甚至果断删除不再适用或产生误导的技能($delete_skill$)。 这种职责分离的架构,不仅保证了执行器在面对各类任务时的通用性,还将“如何实现自我进化”的沉重压力,全部集中并转移到了可以被专门优化的管理员身上。

强化学习攻克延迟反馈

训练这个技能管理员面临着一个算法层面的巨大挑战。 管理员今天决定修改了一段Markdown技能代码,这个决定究竟是好是坏?在当下是无法立刻知晓的。 它的真实价值,必须等到执行器在未来的某次相似任务中,再次调用这个技能时,才能通过任务表现体现出来。 为了将这种遥远且间接的反馈,转化为能够指导模型收敛的有效学习信号,研究团队在训练流上做出了两大创新。

任务分组构建训练流

区别于传统强化学习中将任务打散孤立训练的做法,SkillOS在构建训练实例时,精心设计了任务组。 算法会将存在底层技能依赖关系的相关任务,按照时间顺序打包成一个流式序列。 在处理每一个分组时,执行器顺序完成任务,而管理员在每个任务节点后对技能库进行迭代。 这意味着,管理员基于早期任务轨迹提炼出的技能,会直接投喂给后续的相关任务进行评估。 这种设计完美地在训练阶段模拟了真实世界中的流式部署场景,迫使管理员不能只顾眼前的局部利益,而是必须关注技能在长周期内的普适性和效用。

多维度的复合奖励机制

仅仅依靠下游任务的最终成功率作为单一奖励,信号过于稀疏,极易导致模型训练崩溃或产生次优策略。 为此,SkillOS引入了一套精密的复合奖励函数。 在每次训练迭代中,系统产生的奖励$r$由四个维度聚合而成:

\[r\;=\;r^{\text{task}}\;+\;\lambda_{\mathrm{f}}r^{\text{fc}}\;+\;\lambda_{\mathrm{u}}r^{\text{cnt}}\;+\;\lambda_{\mathrm{c}}r^{\text{comp}}\]

其中,$r^{\text{task}}$代表最核心的指标,即执行器在下游任务中取得的真实表现。 $r^{\text{fc}}$是一个即时奖励信号,用于判定管理员是否进行了合法的函数调用,确保其正确遵循了“文件系统”的操作规程。 $r^{\text{cnt}}$用于衡量生成的Markdown技能内容的实质质量。 而$r^{\text{comp}}$则像是一个严格的编辑,专门惩罚冗长、重复的信息,迫使技能库保持高度的压缩和精简。

在优化算法上,研究采用了稳定性极佳的组内奖励策略优化GRPO)。 其核心的损失函数设计如下:

\[\mathcal{L}=\mathbb{E}_{n}\!\left[\min\!\left(\rho^{n}\,A^{n},\;\mathrm{clip}\!\left(\rho^{n},\,1{-}\epsilon,\,1{+}\epsilon\right)\!A^{n}\right)\right]\]

公式中的$\rho^{n}$代表新旧策略的概率比值,而优势函数$A^{n}$被均匀地分配给序列中的所有Token。 值得注意的是,研究团队在此策略中去除了传统的KL散度惩罚项,旨在赋予模型更大的探索空间,鼓励管理员大胆尝试各种激进的技能重构方案。

Refer to caption

多场景下的性能飞跃

为了验证这套训练配方的威力,研究人员在多轮环境交互任务(如ALFWorld基准)以及单轮复杂推理任务上进行了详尽的测试。

实验数据呈现出压倒性的优势。 相较于完全无记忆的基线模型,以及目前社区中最强的一批基于记忆体的方案,SkillOS在有效性和效率两个核心维度上均实现了大幅领跑。 在ALFWorld的细分测试中,采用SkillOS后,系统的任务成功率获得了极为显著的攀升。 更具工程价值的是,完成相同任务所需的平均交互步数降低了$6.0\%$。 这意味着Agent不仅变得更加聪明,而且行事更加果断,不再需要通过反复试错来撞大运。

卓越的跨模型泛化能力 该研究中最令人兴奋的发现之一,是训练出的技能管理员具有极强的“即插即用”特性。 一个参数量仅为8B的技能管理员模型,在完成了SkillOS的强化学习流程后,竟然可以无缝对接Gemini-2.5-Pro这样顶级的闭源巨无霸模型。 当Gemini-2.5-Pro作为底层执行器时,在8B管理员的辅助下,其系统综合性能得到了进一步的突破。 甚至在对比实验中,这个专门训练的轻量级管理员,在技能管理这一垂直任务上的表现,超越了直接让Gemini-2.5-Pro原生充当管理员的基线。 这充分证明了强化学习在特定管理策略上挖掘出的巨大潜力。

Markdown文件的自我演化

除了冷冰冰的数字提升,研究团队在深层分析中观察到了一个迷人的现象:技能库中的知识表征正在发生自发的演化。

随着系统不断在流式任务中摸爬滚打,SkillRepo内部的Markdown文件内容经历了肉眼可见的质变。 在系统运行初期,管理员记录下来的技能往往非常具体且局限。 它们大多只是流水账般地记录了“如何解决刚刚那个特定任务”的详细操作步骤。

然而,在复合奖励(特别是压缩奖励和下游任务通用性奖励)的持续鞭策下,管理员开始主动对这些孤立的经验进行归纳与抽象。 随着时间的推移,这些简单的文本文件逐渐生长为结构丰富、逻辑严密、包含多级标题和条件分支的专业化文档。 它们不再仅仅提供特定问题的死板解答,而是提炼出了更高级别的元技能Meta-skills)。 这些元技能编码了解决某一类问题的通用工作流和思维框架,使得Agent在面对从未见过的新领域任务时,依然能够从容应对。

工程启示与未来展望

SkillOS的提出,为工业界构建能够长期在线运行的自进化智能体Self-evolving Agents),指明了一条极具可行性的技术路线。 将无形的经验沉淀为具体的、结构化的Markdown文件,并通过一个轻量级的独立模型进行后台异步管理。 这种架构不仅大幅降低了主Agent执行时的上下文负担,而且极大地提升了系统的可解释性与可维护性。 人类开发者甚至可以直接打开这些Markdown文件,审核并微调Agent的“知识结晶”。

当然,任何前沿探索都不可避免地带有一定的局限性。 当前的SkillOS主要聚焦于单文件级别的增删改,当未来系统面对跨学科、超大规模的海量流式任务时,成千上万个技能文件之间的冲突消解、以及高维度的知识图谱构建,将对管理员提出更为严苛的挑战。 此外,如何在自我演化的长周期中,从根本上防止“灾难性遗忘”(即模型为了迎合新任务,意外删除了支撑底层基础逻辑的关键旧技能),依然是该领域亟待攻克的难题。

但无论如何,SkillOS已经向我们展示了Agent进化的迷人曙光。 在不久的将来,或许每一个运行在云端或终端的大模型系统背后,都会配备这样一个默默无闻的“技能管理员”。 在日复一日的交互中,它们不断提炼、重构、升华,让硅基生命真正拥有了在经验中无限成长的可能。