EvoAgentBench:不是任务记忆而是能力转移,跨四领域揭露所有自动进化方法的短板

EvoAgentBench: Benchmarking Agent Self-Evolution via Ability Transfer

EvoAgentBench:不是任务记忆而是能力转移,跨四领域揭露所有自动进化方法的短板 论文图示

在长时间跨度的大型语言模型(LLM)系统研究中,一个不争的共识正在成型:一个实用的智能体(Agent)不应该每次都从零开始解决任务。当 Agent 在复杂环境中经历过成功与失败后,它应当能够像人类一样,将过往的经验沉淀为可复用的策略——比如一套有效的搜索工作流、一种特定的代码调试模式,或是某种严谨的数据验证步骤。

ArXiv URL:https://arxiv.org/abs/2607.05202v1

这种通过外部工具、技能库或记忆库来存储经验,进而提升未来任务表现的范式,被称为 Agent 的自我进化。从早期的 Reflexion 到如今的 Voyager 以及各种复杂的技能提取框架,非参数化的自我进化已经被视为提升 Agent 可靠性最轻量且模型无关的路径。

然而,我们真的有办法准确测量 Agent 的“自我进化”水平吗?

现有的评估体系存在一个巨大的盲区:它们无法将“程序性能力的转移”与“单纯的信息记忆”或“偶然的任务重叠”剥离开来。普通的 Agent 测试基准只关注单次任务的成功率;而长上下文和记忆测试基准,关注的仅仅是信息能否被精准召回,它们在“信息留存”这一步就戛然而止,从未真正触及“过程复用”(procedural reuse)。

更为致命的是,当前的自我进化专属基准往往将技能质量与任务出现的顺序、检索策略的优劣以及底层大模型自身的能力混为一谈。如果一个 Agent 在新任务上失败了,研究者根本无法诊断这究竟是因为训练阶段没有覆盖这项能力、技能提取出了错,还是检索机制在关键时刻掉了链子。

为了填补这一空白,由盛大集团 EverMind 团队、安徽大学、东南大学等机构联合提出了一项名为 EvoAgentBench 的全新基准测试。这项工作将 Agent 自我进化的评估,从粗放的整体准确率比较,硬生生拉回到了极其严苛、细粒度的机制诊断层面。通过跨越四个复杂领域的数万次执行轨迹,EvoAgentBench 揭示了一个残酷的现实:当前所有试图让 Agent 自动提取并复用经验的方法,不仅表现极其脆弱,甚至在很多情况下会触发严重的“负迁移”——即塞入自动提取的经验后,Agent 的表现反而变得更差。

经验转移的核心悖论与解决之道

要真正评估一段轨迹(trajectory)如何转化为可复用的程序(procedure),就必须直面一个在普通测试集中不存在的悖论:测试任务必须与之前的经验“足够相关”,以确保存在可以转移的过程能力;但同时又必须“足够不同”,以防止性能的提升仅仅源自对过往答案的死记硬背或是遇到了高度重复的相似问题。

如何在基准测试中保证这两个看似冲突的条件?作者通过一个结构性原则解决了这一难题:一个合格的 Agent 自我进化基准,必须同时满足“能力支撑”(ability-supported)与“实例不相交”(instance-disjoint)。

这正是 EvoAgentBench 的设计哲学。它并没有草率地使用原始数据集里的标签或者宽泛的领域分类作为能力转移的依据。相反,它深入到 Agent 解决问题的实际过程中,从真实的执行轨迹里提炼出具有实际操作指导意义的“能力(Abilities)”,并基于这些能力构建了图谱。通过这种图谱结构,基准确保了测试集中的每一道题,在训练集中都有相应的、被验证过的“能力支撑”,同时又绝不存在任务实例本身的雷同。

这意味着,如果在 EvoAgentBench 的测试中某个自我进化方法失败了,该方法就不能再用“训练集里没见过这种题”或者“任务本身毫无关联”来找借口。因为基准已经在机制层面保证了,解开测试题所需的底层操作策略,早就以某种形式潜伏在训练经验中了。能否将其挖出来、存好、并在正确的时候掏出来用,全看各家方法的真本事。

深入 EvoAgentBench 的能力图谱构建

EvoAgentBench 涵盖了四个典型的长周期 Agent 领域:基于网页搜索的研究(Web research)、算法推理(Algorithmic reasoning)、软件工程(Software engineering)以及知识工作(Knowledge work)。它们分别对应于 BrowseComp-Plus、LiveCodeBench、SWE-Bench Verified 和 GDPVal 这四个知名数据集。这四个领域对程序性能力有着截然不同的诉求,例如网页研究极其依赖搜索和验证策略,而软件工程则更看重仓库级别的代码修复和调试模式。

为了构建真正反映 Agent 行为的能力单元,研究团队设计了一个极其严谨的三阶段流水线。

EvoAgentBench构建流程图

首先是多主干模型的轨迹收集阶段。能力(Ability)的定义绝不是几句大话,而是扎根于多模型的真实执行。研究人员让多个不同特性的强力大模型(包括 Kimi-K2.5、GLM-5.1 和 DeepSeek-V3.2)在无技能辅助的情况下强行解决任务。对于每一个任务,系统会收集大量成功和失败的轨迹。在这个过程中,分析器不再是独立地看待某一次执行,而是交叉对比成功与失败的尝试,敏锐地捕捉到那些能够区分出可靠完成与脆弱尝试的关键操作。这种跨模型的聚合,有效剔除了单一模型可能存在的思维捷径或工具使用偏好。

其次是基于轨迹的能力提取与规范化。在这个阶段,提取器会将复杂的轨迹抽象为包含明确触发条件(trigger)、具体操作步骤(procedure)、汇总证据(evidence)以及边界约束(boundary)的“能力卡片”。然而,不同任务中提取出的原始卡片往往在表述上五花八门,即便它们本质上是在做同一件事。因此,EvoAgentBench 引入了极为保守的裁定机制,将这些卡片进行合并与规范化。这个过程不看表面的语义相似度,只看“操作上的等价性”,最终形成一套该领域特有的核心能力词汇表。

最后也是最关键的一步,是能力图谱的构建与感知转移的数据切分。通过前面的工作,研究人员建立了一张庞大的网络,网络中的节点是具体的任务,而连线则是它们所共享的可复用能力。借助社区发现算法(Louvain community detection),原本散落的任务被划分成了不同的“能力社区”。在切分训练集和测试集时,系统强制执行一个不变量:如果要把一个任务挪到测试集,它必须与同社区内留在训练集里的任务共享至少一种有效的操作能力。

经过这一系列地狱级的筛选和重组,EvoAgentBench 最终输出了 528 个训练任务和 267 个测试任务。其中最耀眼的数据统计是:对于所有 267 个测试任务,其在训练集中缺失能力支撑的比例为严格的零(Zero test tasks are unsupported)。

实验结论:残酷的“负迁移”与失效的自动进化

在匹配了相同的任务环境、工具集、评分契约和基础 Agent 配置后,任何自我进化方法的外部变量都被抹平了。所有的自动方法能拿到的只有训练集的提示词、轨迹和评分结果,它们唯一的区分点在于如何将这些信息转化为演化状态(如技能库或进化提示词),并在测试时如何调用。

研究团队在 OpenClaw 和 Nanobot 两个不同的 Agent 框架下,使用了 Qwen3.5-27B、Qwen3.5-397B 以及 Gemma-4-31B 这三个差异巨大的模型底座进行了全面评估。对比的方法包括:基于相似度检索案例的 Memento,基于自然语言策略蒸馏和策略检索的 ReasoningBank,以及完全不依赖检索、进行全局提示词广播的 GEPA。

为了探明大模型到底有没有进行跨任务能力转移的潜力,团队还精心设置了一个“上帝视角”的诊断对照组:Anchor Skill。这个对照组使用了从构建阶段通过图谱严格提取并打磨好的“纯净能力文件”,并且在测试时使用了准确的聚类标签进行强制路由分发。换句话说,Anchor Skill 并不是一个能在现实中部署的全自动方法,它代表的是“如果经验被完美提取且完美投放,Agent 能做到什么程度”。

实验结果揭示了两个方向截然不同的事实。

第一个事实令人欣慰:高质量的能力内容确实可以跨模型家族实现稳定转移。 无论是在 Qwen 的不同参数版本上,还是在架构完全不同的 Gemma 模型上,Anchor Skill 都在所有的评价指标上获得了正向的收益。在 24 个(方法-领域-设置)单元格的测试中,Anchor Skill 无一例外地全线飘红。在 Qwen 的两个主干模型上,它甚至超过了表现最好的自动方法 3.9 分和 7.0 分。这有力地证明了,只要将正确的过程知识交到大模型手里,这些底座模型完全具备理解并执行跨任务策略的能力。基准在训练端埋下的“能力支撑”,是确切且有效的。

第二个事实则非常残酷:目前所有的自动化方法,在经验提取与路由分发上都极其脆弱,经常诱发性能的大幅衰退。 与纯净的 Anchor 相比,自动方法在平均层面上虽然偶尔能带来微弱提升,但在深入到具体的领域和模型配置时,它们的防线瞬间崩塌。数据显示,每一个被测试的自动化方法,都在至少一个(框架-底座-领域)组合中引发了令人咋舌的负迁移。

例如,依赖表层语义匹配检索历史轨迹的 Memento,在软件工程(SWE)领域中面对 Qwen3.5-27B 模型时,遭遇了灾难性的 -36.3 分的性能暴跌。这种方法天真地认为,如果当前任务的查询词(query)与历史任务的查询词在向量空间里相似,它们需要的解决方案也会相似。然而在真实的复杂 Agent 环境中,两个表面看起来都在处理“登录异常”的工单,一个可能需要修改底层的路由配置,另一个却只需要修复前端的组件边界。表层特征的相似性成为了致命的毒药,让 Agent 固执地拿着旧钥匙去捅新锁孔。

稍微聪明一点的 ReasoningBank 试图将具体的轨迹抽象为自然语言描述的策略,再通过策略相似度进行检索。它在所有底座模型的平均分上勉强维持了正收益(+0.4 到 +3.6),但这微小的平均涨幅掩盖不住其在 6 个具体领域组合中出现的负面倒退。

而放弃针对性检索、直接将进化后的提示词全局广播给所有测试任务的 GEPA 方案,虽然在 Gemma 底座上表现出了相对强劲的平均涨幅(+5.7),却依然在知识工作(KW)等多个领域遭遇了大幅度的性能滑坡。全局广播本质上剥夺了 Agent 针对不同任务进行动态调整的空间,这种“一招鲜吃遍天”的强硬植入,显然无法应对跨越多个环节的长周期复杂任务。

问题的症结至此已经水落石出。自动进化并不是败在了底座模型的智力上,而是败在了它们自身的机制上。当训练集里确实存在有价值的过往经验时,现在的算法不仅不能像人类那样精准地提炼出普适的“能力法则”,反而在调度时像无头苍蝇一样,把毫无关联甚至是错误的策略硬塞进上下文里,严重干扰了 Agent 原本正常的思考和探索流程。

成本与准确率的脱节:进化不代表省事

除了成功率指标,EvoAgentBench 的设计者们还敏锐地捕获了自我进化的另一个核心痛点:交互成本。

在理想的预期中,如果一个 Agent 经过进化掌握了某个可复用的流程,那么它在面对新任务时,应该能够直接绕过早期那些盲目试错和环境探索的步骤,直接切入正题。这也意味着,自我进化应当能够显著降低 Agent 解决问题时调用工具的轮次(Turn cost)。

但数据给出的答案远比预期复杂。分析结果表明,进化并不等同于降低成本,准确率的提升与交互轮次的减少在当前的方法中是高度脱节的。

当经验被精准匹配并投放时(如 Anchor Skill 所示),Agent 确实能够在多个场景中减少无效尝试。特别是在 Qwen 系列模型上,对于那些被成功解决的任务,准确植入的技能显著降低了操作轮次。这意味着 Agent 在拿到正确的攻略后,确实少走了很多弯路。

然而,在面对自动化方法时,场面再次失控。以 Memento 和 GEPA 为例,它们在大部分测试设置下,不仅没有降低轮次开销,反而使得交互轮次出现了两位数百分比的暴涨。更讽刺的是,即使是在那些它们最终碰巧解决了的任务中,这种额外的冗余操作也依然存在。

背后的逻辑非常清晰:当一个泛泛而谈或者根本不匹配的旧经验被抛给 Agent 时,模型并不能直接从中获得捷径。相反,它需要花费大量的算力和动作轮次,去强行验证这个错误的直觉,并在撞了南墙之后,再艰难地通过不断调用工具来修正这个被扭曲的推理链路。这种成本的激增是隐性的,如果在评估体系中只看任务的最终通过率而无视底层的行为分布改变,研究人员就会被制造出一种“系统正在变得越来越高效”的假象。

总结与未来启示

EvoAgentBench 的问世,绝不是为了在众多的 Benchmark 榜单上再添一个枯燥的数字比拼。通过严格落实“能力支撑且实例不相交”的图谱化切割方案,这项研究无情地撕开了当前 LLM 系统中“自我进化”光鲜亮丽的表象。

它向我们展示了:将经验存进记忆库或者提炼成技能文档只是整个闭环中最容易的一步。真正的挑战,也是当下所有方法全部折戟沉沙的地方,在于如何保证提取出来的内容是高度普适的过程操作,以及如何利用环境状态进行精准、无害的动态路由调度。

对于后续的 AI 前沿探索而言,EvoAgentBench 发出了一个强烈的校准信号。未来的 Agent 研发不能再沉溺于把一堆历史轨迹扔进向量数据库里进行简单的点积运算。我们需要更加深度的机制来对“经验”进行编码,甚至可能需要引入专门的模型或监督信号来训练 Agent 区分表层语义与底层逻辑结构的差异。只有当大模型能够真正学会审时度势地选择并抛弃它所见过的历史时,Agent 才能摆脱“负迁移”的幽灵,迈出从单纯的“任务记忆机器”向“具备方法论的智能实体”进化的关键一步。