MSCE:让大模型把记忆沉淀为可执行技能,软件工程任务提升15.39分

From Memory to Skills: Evidence-Grounded Co-Evolution Governance for Long-Horizon LLM Agents

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

MSCE:让大模型把记忆沉淀为可执行技能,软件工程任务提升15.39分 论文图示

在大模型驱动的智能体(LLM Agent)走向长程复杂任务的过程中,记忆机制一直被视为不可或缺的基础设施。当任务涉及多步骤代码修改、自动化软件测试、API 链式调用或跨应用协同工作时,有限的上下文窗口显然无法支撑完整的历史轨迹。然而,当前主流智能体的长期记忆机制,本质上往往只停留在“被动检索”的初级阶段:无论是直接存储原始交互日志、对话摘要,还是保存思维链反思,系统通常只是在每一步把相关历史文本作为上下文召回,再交给大模型重新推理一遍。

ArXiv URL:https://arxiv.org/abs/2607.16621v1

这种被动式记忆带来了显而易见的代价。在同一个代码仓库里排查问题时,智能体可能会在不同的会话中反复列出目录、反复探查构建配置文件、反复犯下类似的依赖解析错误;即便之前多次成功安装过某种插件,新的任务到来时,系统依然需要从头摸索安装、配置与检验流程。更糟糕的是,若直接把智能体探索中的成功交互轨迹“硬编码”或粗暴蒸馏成可复用技能,由于原始交互充满了试错探索、环境特有噪音以及延迟稀疏的奖励,往往会导致技能边界极其狭隘、缺乏验证手段,并在稍有变化的新场景中频繁引发致命调用。

针对这一长期困扰智能体进化的瓶颈,福州大学、香港理工大学、MemTensor、中国科学技术大学与西安交通大学等机构的研究人员提出了一种免训练的记忆与技能共进化治理框架——MSCE(Memory-Skill Co-Evolution)。该方法打破了“记忆仅作为被动提示”的传统设定,将智能体的运行经验重构为可审计、可治理的三层记忆体系,并在此基础上建立严格的“技能结晶”机制与双信号价值回填算法,使智能体能够将真实的交互证据,一步步晋升为具备明确适用边界与可靠性校验的可调用工具。在长程智能体进化基准 EvoAgentBench 的评测中,MSCE 在软件工程(SE)任务上实现了 15.39 个百分点的显著提升,同时在多项任务中大幅降低了交互轮次与 Token 消耗。

从被动检索到主动治理:三层记忆解耦架构

要让智能体从历史中提炼出真正稳定的能力,首要前提是厘清不同经验在抽象层级上的本质差异。过去的系统往往把“发生了什么”、“如何解决问题”以及“环境具有什么特性”混杂在单一的向量数据库或文本摘要库中。MSCE 将智能体的外部记忆系统明确划分为三层层次分明的治理底座,使原始证据、可复用流程与声明式环境常识彻底解耦。

最底层是 L1 轨迹记忆(Trace Memory),它充当整个系统的底层证据锚点。在长程交互过程中,智能体所执行的每一个动作、环境返回的观测以及当时的上下文,都会被格式化为标准化的决策单元 $f_{i,t}^{(1)} = (s_{i,t}, a_{i,t}, o_{i,t}, \rho_{i,t}, V(f_{i,t}^{(1)}))$。其中,$\rho_{i,t}$ 是智能体在执行该步时的局部自反思,而 $V$ 则是经过校准后的步骤价值。出于工业级存储成本与隐私风险的考量,L1 并不盲目保存无节制的原始屏幕快照或大段文本,而是对其进行标准化证据归一化处理,保留截断状态、结构化工具调用元数据以及关键输入输出,高层记忆则通过引用证据标识符的方式与之关联,杜绝了无意义的重复冗余。

中间层是 L2 策略记忆(Policy Memory),其核心职责是从跨任务、跨轮次的 L1 轨迹中归纳出具有复用价值的程序化流程。一个典型的 L2 策略被定义为五元组 $(\phi, \pi, \kappa, \mathcal{B}, {f^{(1)}})$,分别对应触发条件、建议流程、参数模式、适用边界以及背后的支撑证据集合。为了防止劣质策略泛滥,MSCE 为 L2 引入了策略收益指标 $G(f^{(2)})$。该指标通过对比使用该策略模式与未使用该策略模式时的加权步级价值差异,形成一种启发式的效益信号。这个增益值决定了一条策略在系统中究竟是被保持活跃、允许晋升,还是被打入冷宫甚至被注销。

最高层则是 L3 环境认知记忆(Environmental Cognition Memory)。在软件开发或操作系统交互中,许多知识并不是具体的执行步骤,而是环境的静态事实与约束条件。例如目标服务器运行的是 Alpine Linux 还是 macOS、底层依赖是否缺失特定的动态链接库、用户有哪些特定的偏好风格等。当多个活跃的 L2 策略频繁涉及相似的上下文环境时,L3 抽象机制会被自动触发。它仅提炼陈述性事实与约束规则,严禁夹带命令式的步骤指令。这样一来,执行流程与环境常识在结构上被彻底隔离,为跨环境自适应奠定了清晰的先验基础。

严密把关的“技能结晶”:如何避免脆弱与过拟合

如果 L2 策略只是停留在记忆库里的推理参考,智能体依然需要在推理阶段消耗大量推理算力去“阅读并理解”这些经验。MSCE 的核心突破在于,它将经受住考验的高价值 L2 策略正式固化为下游的可执行工具,即“技能结晶(Skill Crystallization)”。

变成一个独立的、可调用的技能 $k = (\phi, \pi, \kappa, \mathcal{B}, \mathcal{A}, \mathcal{D}, \eta)$,必须经过严苛的治理门禁。MSCE 设立了双重准入机制:首先,源 L2 策略必须沉淀了足够坚实的底层交互证据,且其计算得出的估计收益 $G(f^{(2)})$ 必须严格超过设定阈值 $\theta_G$;其次,该策略在近期的交互中必须保持结构稳定,这意味着近期的新证据能够自然落入其现有的触发条件、操作步骤与适用边界内,而不是不断引发对策略本体的大幅重写。

在生成候选技能时,系统不仅会聚合正向证据来拟合标准操作步骤,还会重点分析反事实与反向证据(Counter-evidence)。反向证据在这里具有无可替代的作用:它直接界定了该技能“绝不适用的边缘场景”,并据此生成防踩坑的反模式指南(Anti-patterns)。这就从源头上解决了传统智能体“在不该调用该技能的时候胡乱调用”的问题。

更为稳健的是,每一个生成的技能草案都必须通过确定性验证器(Deterministic Verifier)的刚性检验。验证器不仅检查结构 Schema 的完整性,还以极度严格的规则审查其证据溯源链条:技能中声明调用的外部工具,必须在底层 L1 证据的工具白名单中真实出现过;技能所引用的历史标识符,必须完全源于其关联的支撑集;同时辅以轻量级的覆盖度检查,坚决拦截任何大模型凭空捏造(Hallucinate)的虚假指令或偏离真实轨迹的冗余动作。任何未通过验证的草案都会被直接销毁,绝对不允许进入可执行技能库。

一旦进入正式技能库,技能还会挂载动态的平滑可靠性分值 $\eta$。该分值采用拉普拉斯平滑进行维护:

\[\eta = \frac{n_{\text{pass}} + 1}{n_{\text{trial}} + 2}\]

在执行阶段,如果技能成功解决问题,$\eta$ 会稳步上升;一旦遭遇环境报错或用户纠正,$\eta$ 会快速回落,并促使适用边界 $\mathcal{B}$ 进一步收敛。高可靠性技能享有优先检索与调用权,而分值滑落的技能则会进入观察期甚至被自动归档。在实际执行时,技能还会与 L3 环境认知联动。例如,同样是一个“安装系统依赖”的结晶技能,它在运行时会读取 L3 提供的操作系统版本,自适应地在 Alpine 的 apk、Debian 的 apt 或 macOS 的 brew 之间切换参数,而不需要在技能内部冗余编写多套互斥逻辑。

双信号价值回填:为记忆治理注入校准信号

无论是指引 L2 策略的增益计算,还是驱动技能的晋升、退役与修订,其底层都极度依赖一个客观的价值评价指标。但在长程多步任务中,智能体面临的最大难题便是“延迟奖励与信用分配”——交互数十步之后,环境往往只在任务彻底终结时返回一个成功与否的标量回报 $R_i$,或者一段非结构化的用户文字反馈。中间到底哪一步是力挽狂澜的关键突破,哪一步只是盲目低效的试错摸索?

以往基于强化学习或传统时序差分的方法,通常假设奖励可以在步骤间均匀或简单指数衰减传播,这在包含大量长文本推理的 Agent 场景中极易失效。MSCE 为此设计了反思加权的价值回填机制(Reflection-Weighted Value Backfilling)。

该机制的精髓在于,将终端任务的全局客观反馈,与执行步骤时的本地主观自反思深度耦合。在每个单步 $t$,智能体不仅执行动作,还会生成一段自反思 $\rho_{i,t}$。MSCE 利用辅助算子对该反思进行打分,得到一个动态反思权重 $\alpha_{i,t} \in [0, 1]$。其逻辑在于:如果智能体在某一步的反思客观、精准、因果关系明确,且对理解当前局势起到了决定性作用,该步的 $\alpha$ 就会被赋予高分;如果反思只是空洞的车轱辘话、毫无因果关联甚至是事后强行解释,其 $\alpha$ 就会被无情归零。

基于这一自反思权重,单步的校准价值按照如下递推式展开回填:

\[V(f_{i,t}^{(1)}) = \alpha_{i,t} R_i + (1 - \alpha_{i,t}) \gamma V(f_{i,t+1}^{(1)})\]

式中 $\gamma \in [0, 1)$ 为折扣因子。该公式构建了一个极其巧妙的价值流动机制:那些获得了高 $\alpha$ 的关键决策步骤,能够直接斩获全局终端回报 $R_i$ 的最大份额,作为决定最终成败的核心证据被突出显示;而那些低 $\alpha$ 的常规中转步骤,其价值则主要从后续步骤中被动继承。

这种设计确保了整个记忆与技能体系从根基上避免被“伪成功”轨迹污染。在任务结束后,这一回填过程在后台异步执行,算出的价值信号会立即更新 L1 轨迹,重新校准 L2 策略收益,并进一步触发 L3 认知的提炼与技能库的动态清洗。整个进化过程纯粹作用于智能体的外部认知状态 $\mathcal{C}_i$,底座的大语言模型本身不需要进行任何参数微调,极大地保证了系统的灵活性与部署可行性。

实验结果:复杂长程任务上的突破性表现

为了全面检验这套共进化架构在复杂长程环境中的自适应能力,研究团队基于统一的 OpenClaw 运行时底座,选用 GPT-5.2 作为主干模型,在长程演化权威基准 EvoAgentBench 以及长对话记忆基准 LoCoMo 上进行了深入评估。EvoAgentBench 涵盖了五大高难度领域:信息检索(IR)、数学推理(Math)、软件工程(SE)、代码实现(Code)以及通用知识工作(KW)。

基线对比涵盖了目前最具代表性的三类系统:第一类是不保留长期记忆的纯原生长模型(Vanilla Agent);第二类是经典的被动记忆增强智能体,包括 EverOS、Memento 与 MemSkill;第三类则是试图从原始轨迹直接蒸馏技能的系统,包括 EvoSkill、OpenSpace 以及基于补丁进化的 SkillFlow-Evolve。

在 EvoAgentBench 的核心有效性指标 Pass@1(单次通过成功率)上,MSCE 在所有五个领域中均取得了最优或并列最优的成绩。在复杂度极高、非常依赖精确调试步骤的软件工程(SE)领域,MSCE 的 Pass@1 相比最强基线跃升了 15.39 个百分点;在信息检索(IR)与数学推理(Math)上,分别提升了 4.61 与 4.00 个百分点;在知识工作(KW)场景中提升了 5.17 个百分点。在代码实现(Code)任务中,MSCE 达到了与最佳基线 EvoSkill 持平的 61.54% 成功率,但其平均交互轮次直接从 3.9 轮断崖式下降至 2.0 轮,执行开销缩减近半。

在更偏重长文本记忆与事实一致性的 LoCoMo 测试集中,MSCE 同样表现亮眼。在 GPT-4o 裁判给出的综合评分与总体 F1 分数上,MSCE 分别超越了最强基线 SkillFlow-Evolve 2.01 分和 1.18 分,并在单跳、多跳以及时序推理问题上斩获最高分。这表明 L1 到 L3 的分层治理不仅能够支撑技能生成,反过来也能极其精准地维护跨轮次的事实与因果关系链条。

更具说服力的是智能体在跨领域迁移(Cross-Domain Transfer)和终身学习(Lifelong Evolution)协议下的表现:

  1. 跨领域正向迁移:在将源领域演化出的记忆与技能直接注入目标领域再进行迭代的六组跨领域迁移实验中,所有组合的 Pass@1 均实现了绝对正向增长,平均提升达 3.93 个百分点,且多数场景的交互成本同步下降。这证实 MSCE 沉淀出的技能具备极强的通用问题求解结构,而非特定数据集下的机械拟合。

  2. “越用越聪明”的终身演化曲线:在随着交互规模不断累加的终身学习演化测试中,从零经验累积的 $p0$ 到完全累积的 $p100$,智能体在 Math、SE 和 IR 领域的成功率呈现单调递增,分别实现了 17.00、15.39 和 13.84 个百分点的巨大增益。与这一增长形成鲜明对比的是,任务的归一化交互成本在前期稍有探索性上升后,随着高质量技能的普及,在后期全部反向走低,甚至大幅低于没有任何经验累积时的初始成本。

在组件消融实验中,如果将 MSCE 退化为没有分层治理的扁平记忆(Flat Memory),或者直接剥离技能结晶模块(w/o Skill Crystallization),系统性能会出现 6.15 到 11.54 个百分点的全面滑坡,同时在所有领域中的交互开销均显著激增。类似地,如果移除反思加权算法或者直接去掉基于价值校准的技能过滤机制,智能体便会陷入错误技能胡乱注入的泥潭,导致错误率与调用开销成倍上升。这一系列细致的实验充分证明,MSCE 各模块之间不是简单的技术堆砌,而是一个环环相扣的治理闭环。

走向有秩序进化的智能体

MSCE 为构建持久运行、自主进化的长程大模型智能体提供了一条非常扎实的工程与架构路线。长期以来,学术界与工业界在赋予智能体自适应能力时,往往陷入两难:要么依赖昂贵且有灾难性遗忘风险的模型微调,要么依赖毫无纪律性、把上下文塞得满满当当的检索增强(RAG)。

MSCE 表明,经验的复用不应该只停留在“提示词阅读”层面,而是必须完成从“被动证据”到“程序性策略”,再到“可执行、带边界、能校验的技能”的质变跃升。通过在底层筑牢证据可追溯性,在中间层引入收益与环境约束,在顶层通过双信号价值回传建立动态准入与淘汰机制,大模型终于可以在不更新权重的前提下,像人类工程师一样在真实环境里“干中学”,并在漫长的工作周期中越用越快、越用越准。

当然,正如论文在局限性讨论中所指出的,MSCE 目前所采用的步级价值分配与策略收益计算,本质上依然属于启发式的治理信号,尚未达到因果推断层面的严格信用归因;此外,在超长生命周期的持续演化中,庞大技能库的索引与冲突解决机制也将面临更苛刻的挑战。但无论如何,这种将智能体记忆与技能融为一体的共进化范式,无疑为下一代能够自我迭代、自我纠偏的自主系统奠定了至关重要的认知架构框架。