Evo-Harness:把单次失败编译成复用技能,终端基准准确率提升超10%

Evo-Harness: Context-to-Harness Skill Compilation for Self-Evolving Agents

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

Evo-Harness:把单次失败编译成复用技能,终端基准准确率提升超10% 论文图示

在大模型驱动的自主智能体(LLM Agent)研发中,“让系统在实践中自我演化”一直被视作通往高阶通用能力的必经之路。然而,当前的自进化机制在真实复杂任务中往往表现得十分脆弱。常见的做法通常是构建一个外部记忆库或经验池,在智能体完成任务后将整条轨迹、思考步骤或自然语言反思存储下来;当遇到新任务时,再通过语义相似度将过往轨迹检索并拼接到 Prompt 中。

ArXiv URL:https://arxiv.org/abs/2608.15071v1

这种简单的经验复用逻辑在现实环境中很快会撞墙。现实世界的任务不仅长程、动态,而且具有极高的噪声,绝大多数情境下智能体面对新任务往往只有一次尝试的机会。单次执行的上下文中,既混杂着通用的排错逻辑,又充斥着大量任务特异性的局部变量、偶然的工具调用碎片甚至误导性的尝试过程。将未经提炼的原始轨迹直接回填给模型,不仅容易挤占有限的上下文窗口,还会引入严重的认知干扰。更关键的是,过往文献很少在诸如软件工程调试、复杂终端操作等高拟真基准上,系统拆解自进化究竟由哪些底层机制驱动。

由 UIUC、亚马逊、宾夕法尼亚州立大学、埃默里大学等机构联合提出的 Evo-Harness 框架,正是为了击破这一瓶颈。该研究重新定义了“在线脚手架学习”(Online Harness Learning)范式,不再把经验视为被动检索的案例库,而是通过“上下文到脚手架的技能编译”(Context-to-Harness Skill Compilation),把充满噪声的单次执行记录实时编译为高度结构化的通用与局部技能。在 TerminalBench-2、SWE-bench Lite、CL-Bench、$\tau$-bench 与 WebArena-Infinity 等五大高难度真实基准的评测中,Evo-Harness 展现出稳健的性能增益,不仅全面超越现有经验记忆方法,在终端交互任务上的成功率更实现了超过 10 个百分点的绝对提升。

从被动检索走向主动编译:在线脚手架学习的重构

要理解 Evo-Harness 的突破,首先需要认清传统“经验重用”范式与“脚手架技能演化”的本质差异。以往的方法大体遵循案例库检索逻辑:智能体在任务 A 中失败或成功后,将反思日记存入数据库;当下一次遇到与 A 语义相近的任务 B 时,系统将相关记忆原样检索出来。这种模式成立的前提是“任务之间存在高度的输入相似性”,并且“历史轨迹中包含可直接对照的显式线索”。但在面对真实的开发环境或系统管理时,两个任务可能表面上风马牛不相及,底层却共享着一套排错逻辑,例如处理某种文件锁冲突或环境依赖配置。

Evo-Harness 提出的核心假设在于:智能体不需要记住历史任务做过什么,而是需要学会未来在面对特定情境时应当如何操作。 技能(Skill)本质上是操作性的程序化知识,它必须指导规划、动作编排、状态验证与失败恢复,而不是单纯陈述过去的事实。

在此基础上,研究团队形式化了在线脚手架学习(Online Harness Learning)设定。在连续到来的任务流中,执行任务的基础解题模型(Solver)保持参数冻结,模型能力的提升完全来自于外部结构化脚手架 $H$ 的动态演变。脚手架充当了智能体外部的控制支架。对于当前任务 $x_{i,j}$,系统会依据预算限制从中筛选出最相关的精简技能子集 $S_{i,j}$,将其注入到解题模型的上下文中,指导其生成执行轨迹 $\tau_{i,j}$ 并获取环境反馈 $f_{i,j}$。整套框架的关键,就在于如何利用每一次执行产生的上下文 $c_{i,j} = (x_{i,j}, \tau_{i,j}, y_{i,j}, f_{i,j})$,在不改动模型权重的前提下,实现脚手架从 $H_i$ 向 $H_{i+1}$ 的高质量跃迁。

上下文到技能的双阶段编译体系

为了将高噪声的单次交互过程转化为稳定、可复用的操作规范,Evo-Harness 将自进化过程解耦为互补的两个阶段:执行反思(Execution Reflection)与脚手架演化(Harness Evolution)。

执行反思阶段专注于从具体的单次失败中捕获边界信号。一个值得注意的机制取舍是:Evo-Harness 显式地将反思触发条件限定在“任务执行失败或收到负面反馈”时。团队认为,成功的轨迹往往充斥着许多巧合与环境特定的细节,直接学习成功经验容易引入冗余信息;而失败场景则精确暴露了解题模型的盲区,比如错误的初始假设、遗漏的约束条件、低效的工具参数或缺失的验证环节。当失败发生时,系统会基于当前完整的上下文提炼出结构化的候选记忆元组:包括核心教训(lesson)、触发条件(trigger)、支撑证据(evidence)以及适用范围提示(scope hint)。该阶段不与现有脚手架对比,仅负责纯粹地提炼失败所折射出的归纳偏差。

紧接着的脚手架演化阶段,则由一个独立的演化者(Evolver)模块接管。这一模块不再简单地把候选记忆追加到列表末尾,而是执行类似于代码编译器的操作。演化者对候选记忆集合与现存脚手架进行跨任务的比对,执行四种基础编辑操作之一:新增(ADD)、合并(MERGE)、修订(REVISE)或丢弃(SKIP)。通过这种方式,重复的线索被聚类,具有冲突的经验被校准,冗余的任务级碎片被剔除。

更精妙的地方在于 Evo-Harness 维护的双层技能结构:

第一层是跨任务模式(Cross-task Patterns)。演化者通过对比来自不同批次、不同表象任务的候选记忆,抽象出具有广泛普适性的操作规范。例如,在代码仓库中定位复杂 Bug 时的通用排查顺序,或者调用系统底层命令时的安全验证闭环。

第二层是任务类型程序(Task-type Procedures)。它专门保留针对特定环境接口、固定任务格式或特定领域的局部操作规程。例如在 τ-bench 的航空客服系统中操作特定订票 API 的固定参数约束,或是处理特定 Web 表单时的 DOM 定位惯例。

这种双层设计不仅让生成的技能具备不同粒度的抽象层次,而且彻底改变了智能体的进化形态。它不再是一个随时间无限膨胀、检索耗时递增且冲突丛生的文档堆,而是一份结构清晰、经过持续剪枝与强化的动态操作指南。

五大真实场景检验:全线超越现有自进化基线

为了检验单次技能编译在现实高噪环境中的硬实力,研究团队选择了五个具有代表性、难度梯度大且覆盖多样化能力的基准数据集进行评估:包括面向复杂系统终端操作的 TerminalBench-2、真实软件工程修复基准 SWE-bench Lite、多任务自适应推理基准 CL-Bench、多工具交互环境 $\tau$-bench,以及拟真网络导航基准 WebArena-Infinity。实验选用了业界领先的闭源与开源模型进行交叉对照,默认以 Claude Opus 4.6 作为主力解题模型。

评测对比的基线涵盖了过去几年具有代表性的记忆与经验重用方案,包括利用工作记忆的 AWM、自适应备忘录框架 Dynamic Cheatsheet(包含 DC-Cu 与 DC-RS 变体)、轨迹反思演化系统 Evo-Memory、上下文优化机制 ACE,以及将技能与经验解耦维护的强基准 XSkill。

实验结果给出了清晰的结论:Evo-Harness 在全部五个复杂基准上均刷新了最佳表现,显著超越了不进化的静态基线(No Evolve)和现有的所有经验演化方法。在对操作程序与容错要求极苛刻的 TerminalBench-2 上,静态解题模型的成功率为 62.92%,而此前表现最好的 XSkill 达到了 66.29%;Evo-Harness 则将成功率拉升至 73.03%,实现了超过 10 个百分点的绝对增益。在极度依赖代码库全局理解与严谨测试验证的 SWE-bench Lite 上,Evo-Harness 的解题率从基准的 63.67% 提升到了 67.00%。

对比数据揭示了一个发人深省的事实:在复杂的真实场景下,盲目堆叠经验甚至可能带来负面效果。在多项基准测试中,AWM、Dynamic Cheatsheet 乃至 ACE 的表现频频低于不进行任何进化的 No-Evolve 基准。这充分印证了研究团队的初始判断:未加提炼、缺乏编译的经验池不仅无法给智能体带来智慧,其夹带的噪声反而会严重干扰解题模型的推理上下文,导致模型在面对新任务时误入歧途。Evo-Harness 能够全线稳定取得正向收益,关键正在于其对单次执行噪声的过滤能力与结构化技能提炼机制。

拆解自进化驱动力:究竟是什么让智能体变聪明?

除了亮眼的基准数字,这项研究更重要的学术价值在于系统性地剖析了在线脚手架演化的内在机制,回答了“脚手架中什么最重要”以及“什么样的模型才配得上进化”这两个核心问题。

在技能构成的消融分析中,研究者剥离了不同维度的功能组件。在 CL-Bench 与 SWE-bench Lite 上的对照表明,双层技能设计在不同任务场景中呈现出差异化的价值贡献。在 CL-Bench 这类异构、包含多样化自适应推理类型的基准中,“仅保留局部任务程序”(Topic Only)能达到 33.70% 的成功率,极其接近完整框架的 34.02%;而“仅保留跨任务模式”(General Only)的成功率则骤降至 30.28%。这表明面对复杂多变的推理任务,针对具体任务范式的特定操作引导是解题的关键支柱。

然而,在 SWE-bench Lite 这类软件工程场景中,趋势发生了戏剧性的反转:General Only 达到了 66.67%,几乎打平了完整版的 67.00%;而 Topic Only 仅为 64.33%。在软件修复中,具体的代码文件与报错各有不同,局部规程很难直接迁移,真正决定成败的反而是跨任务通用的工程素养:例如如何在修改前后设计边界验证用例、如何利用 grep 缩小排查范围、如何处理失败的单元测试。Evo-Harness 的自适应之处在于,它不需要人工预先设定哪类任务需要何种技能,而是让演化者在编译过程中自主形成针对性的技能分布。从各基准演化出的技能类型统计来看,WebArena 自动聚拢出大量的操作流程规程,TerminalBench-2 聚焦于验证与恢复逻辑,$\tau$-bench 侧重于 API 工具链编排,完美契合了不同环境的固有挑战。

更为深刻的发现出现在关于主干模型能力与“解题者-演化者”配对关系的探究中。过去业内常有一种乐观预期:自进化框架应该能够作为一种补偿机制,帮助较弱的模型追平较强的模型。但 Evo-Harness 的多模型横向评估打破了这种幻想。

在 CL-Bench 上,研究团队对比了 Claude Opus 4.7、Opus 4.6、Opus 4.5 以及开源大模型在框架下的演化幅度。数据呈现出强烈的正向马太效应:越是顶尖的模型,从脚手架进化中获得的提升越显著。Opus 4.6 获得了 +4.5 点的飞跃,Opus 4.5 提升了 +3.8 点;而对于能力相对较弱的开源模型,提升幅度则被压缩到了 +1.1 点甚至 +0.8 点。进一步的细分领域分析显示,在“程序化任务执行”(PTE)这类具有高度可复用操作结构的场景下,强模型的得分提升甚至接近 10 个百分点。

这揭示了大模型自主进化中的底层认知瓶颈:提炼出的技能再精准,也必须依赖执行端拥有足够的指令遵循、上下文理解与临机应变能力。 弱模型在面对抽象出的操作规程时,往往无法将其准确映射到当前复杂的长程推理中,甚至可能因为上下文负载增加而顾此失彼。

这种能力的非对称性在跨模型演化(Cross-model Evolution)实验中得到了进一步印证。当使用参数较小或能力稍逊的 Claude Sonnet 4.5 作为演化者去提取技能,并将提炼出的脚手架提供给强大的 Opus 4.7 去解题时,Opus 4.7 取得了高达 76.0% 的成功率,甚至超过了由 Opus 自产自销的 75.3%。这证明由中等模型总结出的规范化知识,其质量已经足够支撑高阶解题者的突破。然而反向测试却导向了完全相反的结果:如果让弱模型(Sonnet 4.5)作为解题者,无论是由更聪明的 Opus 帮它提炼技能,还是由它自己提炼,最终成绩(55.7% 与 55.3%)都明显低于不进化的原始基准(58.0%)。这一严酷的事实给整个智能体演化领域敲响了警钟:外部脚手架的注入不是万灵丹,解题者自身的“基础理解门槛”构成了知识能否被激活的硬约束。

最后,针对反馈机制的探究也表明,脚手架的健康演化高度依赖于扎实的环境接地。完全依靠模型自我感知(Self-Generated)的胜负判断来进行技能编译,其效果显著落后于拥有环境测试用例或退出状态码(Minimal)的方案。在缺乏客观真实反馈的环境中,错误反思所导致的“幻觉技能”会顺着脚手架不断污染后续的决策链路。

对未来智能体工程的启发

Evo-Harness 所验证的机制,对下一代能够自主进化的工业级 Agent 设计提供了极具实操价值的技术启示。

长久以来,学术界与工业界往往过度寄希望于两种极端路线:一种是依赖庞大的多轮交互后训练,试图把环境经验通过微调硬塞进模型权重,这不仅需要昂贵的算力,还极易引发灾难性遗忘;另一种则是无节制地扩充 RAG 式的向量数据库,把 Agent 退化为一个机械的记忆检索机。Evo-Harness 表明,在冻结的通用大模型与多变的现实世界之间,构建一个动态可编辑、可编译的结构化操作脚手架,是一条计算开销更低、解释性更强且上线适应更快的自进化路径。

更关键的是,它重新确立了“以失败为锚”和“编译替代检索”的方法论。在构建面向代码编写、自动化运维、复杂跨应用操作的 Agent 系统时,工程师们不应急于将每次成功跑通的代码片段或命令堆入上下文,而是应当建立精细的失败拦截器,在每一次踩坑与报错之后,驱动演化模块对现有的标准作业程序(SOP)进行合并与修订。同时,对于智能体系统架构的选型而言,必须优先将最精密的推理算力分配给执行端,因为唯有具备深度推演与代码执行稳定性的解题核心,才具备兑现结构化技能红利的前提。

随着 Evo-Harness 完整代码库的开源,这一将单次执行上下文熔炼为持续演化脚手架的范式,为大模型真正摆脱“每次启动皆为白纸”的尴尬宿命,提供了一个逻辑严密且经过现实基准淬炼的坚实起点。