阿里EvoSOP:让Agent自动合成SOP,成功率提升13.4%
From Atomic Actions to Standard Operating Procedures: Iterative Tool Optimization for Self-Evolving LLM Agents

在当前的大语言模型(LLM)Agent 研究中,工具调用能力已成为其与真实世界交互、解决复杂任务的核心基石。然而,当开发者们不断赋予 Agent 各种能力时,一个明显的效率瓶颈逐渐显现:现有框架绝大多数依赖由“原子操作”(Atomic Actions)组成的静态工具集。
ArXiv URL:https://arxiv.org/abs/2607.07321v1
所谓的原子操作,指的是基础的文件输入/输出、单轮搜索、简单的 API 调用等。这种设计迫使 Agent 在面对每次重复出现的工作流时,都必须从头编排底层逻辑。就像一个人类打字员每次打字前都要重新理解键盘布局一样,Agent 在细碎的原子操作中消耗了大量的推理算力,不仅增加了推理开销,也导致在长周期任务中级联错误的风险急剧上升。
为了打破这一僵局,来自阿里巴巴和中国人民大学的研究团队提出了一种全新的自进化框架 EvoSOP。该框架的核心思想是:赋予 Agent 将零散的原子操作合成为可复用的“标准操作程序”(Standard Operating Procedures, SOPs)的能力。通过一个包含构建、合并、评估和修剪的完整生命周期,EvoSOP 让 Agent 实现了工具集的非参数化迭代优化。实验表明,这一机制在显著压缩交互轮数的同时,将任务成功率最高提升了 13.4%。
为什么 Agent 需要从原子操作走向 SOP?
人类在解决复杂问题时,通常不会陷入无休止的微观决策。在面对经常出现的流程时,人类会总结出 SOP,将多步逻辑封装成连贯的、高层次的日常操作。如果不具备这种抽象能力,Agent 在处理长期任务时,只能面对高度碎片化的动作序列,这正是当前大多数 Agent 系统频频失败的重要原因。
近年来,关于 Agent 工具调用的研究主要集中在两条路径上:一是通过强化学习或微调提升模型使用特定工具的能力;二是单纯扩大工具集的规模。然而,这些努力并没有触及根本问题——长序列原子操作带来的推理低效。
尽管近期也有一些研究允许 Agent 动态编写代码生成新工具,但它们大多将“添加工具”视为一次性事件,缺乏长期的管理机制。这就导致了一个致命的副作用:工具集膨胀(Bloated Toolset)。随着任务的推进,冗余或次优的工具不断堆积,成为了 Agent 上下文中的噪声,反而增加了决策的复杂度和错误率。
EvoSOP 的提出正是为了解决这一痛点。它不只是让 Agent 有能力“造工具”,更关键的是为其建立了一套系统化、持续优化的循环流程。通过在历史执行轨迹中挖掘频繁共现的动作模式,EvoSOP 能够压缩漫长的推理链,将其提炼为高阶工具;同时,通过严格的淘汰与合并机制,确保工具集始终保持精简和高效。
EvoSOP 核心架构:工具优化的四大模块
EvoSOP 的运行不需要对底层大模型进行任何参数更新,这使得它能够作为一种模型无关(Model-agnostic)的框架,无缝接入现有的黑盒 LLM 系统。它的核心架构被巧妙地设计为一个完整的工具优化生命周期,包含四个相互协作的模块:构造器(Constructor)、合并器(Merger)、评估器(Evaluator)和审查器(Reviewer)。

1. 构造器(Constructor):从原始轨迹提取功能抽象
工具优化的第一步,是从海量的历史执行轨迹中提炼出有价值的经验。Agent 记录下的原始轨迹中包含了严格按时间顺序排列的动作和环境响应。在实际情况中,很多连续的工具调用并非巧合,而是解决某一类子问题所必需的深层逻辑依赖。
构造器模块的作用就是识别这些模式。它将那些在逻辑上高度耦合的片段提取出来,并使用基础的原子工具接口对其进行重写。这个过程会生成全新的 SOP 源代码,并为其配备对应的语义说明(Schema),使其成为一个可以直接被大模型调用的高阶函数。
2. 合并器(Merger):维持工具集精简的结构优化
随着 Agent 在不同任务领域积累经验,新生成的 SOP 之间不可避免地会出现功能重叠。如果任由这些重叠的工具堆积在提示词上下文中,大模型在检索和决策时就会感到困惑,甚至调用错误的工具。
合并器模块专门负责解决这一结构性冗余问题。它的任务是扫描当前的候选 SOP 集合,将具有重叠逻辑或相似功能的流程合并为更通用、更高阶的工具。
值得注意的是,EvoSOP 在这里采用了一种“非破坏性”的整合策略。当一个新的复合 SOP 被生成并加入工具集时,它原来所包含的基础 SOP 并不会立刻被删除。作者指出,这么做是基于对 Agent 行为的深刻观察:即使两个 SOP 在字面上功能相同,它们在代码健壮性、编码风格和文档清晰度上可能存在巨大差异;此外,一个庞大的复合 SOP 在某些特定场景下不一定比颗粒度更小的工具更好用。因此,合并器只负责“新增泛化版本”,而把“是否删除旧版本”的决定权留给了后续的真实评估环节。
3. 评估器(Evaluator):基于真实执行的验证
无论合并器和构造器在逻辑上多么完美,由 LLM 生成的代码在复杂多变的状态环境中天然具有脆弱性。因此,所有候选 SOP 都必须经过真实环境的淬炼。
在评估阶段,Agent 将装备更新后的临时工具集 $\mathcal{F}^{\prime}$,对训练任务进行全量重新执行。评估器会实时监控任务结果,并捕获新的执行轨迹。这些在真实场景下跑出来的数据,为诊断代码缺陷、评估工具在不同条件下的泛化能力提供了最可靠的实证基础。
4. 审查器(Reviewer):严格的质量控制与修剪
EvoSOP 生命周期的最后一环是审查器,它扮演着“批评家”的角色,执行严格的质量控制。由于 SOP 是在不同的轨迹中独立合成的,系统往往会面临几类典型问题:
-
功能冗余:某些工具的作用几乎完全重叠。
-
语义错位:工具名称或文档字符串具有误导性,导致大模型无法正确检索。
-
低效占用:某些工具虽然存在,但在实际任务中极少被调用。
-
潜在缺陷:某些代码 bug 只有在特定的状态流转中才会暴露。
审查器会聚合评估器收集到的所有执行日志,计算出每个 SOP 的实际贡献度。对于那些表现出高错误率、几乎从未被使用,或者在泛化后被证明不如其基础版本的工具,审查器将毫不留情地将其剔除。通过这一步,EvoSOP 有效防止了“技术债务”的累积,确保 Agent 的能力库既强大又轻量。
概念上的非参数化机器学习
从宏观角度来看,虽然 EvoSOP 没有改变 LLM 的权重参数,但它的运作方式极度贴近标准的机器学习流水线:
-
数据获取与前向执行:Agent 利用当前工具集收集执行轨迹,相当于模型在训练集上进行前向传播。
-
反向传播与结构优化:构造器和合并器通过分析失败或繁琐的轨迹来生成和合并 SOP,类似于反向传播中更新特征表示。
-
正则化机制:审查器的修剪动作和合并器的整合,起到了关键的正则化作用,避免了 Agent 对过于狭窄、特定任务流的“过拟合”。随着迭代的进行,工具集逐渐稳定,这就如同训练过程中学习率的衰减,最终收敛到一个最优的层次化工具集合。
为了避免优化过程中的随机性导致优秀 SOP 被误删,EvoSOP 并没有采用绝对线性的更新。相反,它引入了检查点(Checkpointing)机制。在每次迭代结束时,系统会归档当前的工具集和评估日志。由于反馈直接来自环境本身(属于自监督范畴),最终系统会选择在训练集上成功率最高的那一轮作为最优输出,从而在工具表达能力和执行可靠性之间取得最佳平衡。
实验结果与深度解析
为了验证 EvoSOP 的有效性,研究团队在 ACEBench 和 Tau2Bench 两个基准测试上进行了广泛对比。基线方法包括原始的 ReAct 和 DFSDT(仅使用原子操作)、ASI(一次性生成技能,缺乏长期管理机制)以及 DRAFT(通过重写文档指导工具使用)。在所有的评估中,研究人员统一使用了 GPT-4o 作为主干模型。
任务成功率的大幅跃升
在 ACEBench 的不同子集上,EvoSOP 均展现出了压倒性的优势。相较于仅使用基础原子操作的基线 Agent,EvoSOP 的任务成功率获得了 2.5% 到 13.4% 不等的显著提升。
这一核心数据证明了,由 EvoSOP 演化出的 SOP 真正切中了当前 Agent 的痛点。通过为模型提供稳定、可靠的逻辑块,Agent 不再需要面对“每走一步都要小心翼翼防错”的窘境,从而能够将宝贵的注意力上下文用于规划和解决更高维度的任务目标。
推理轮数的深度压缩
本研究的一个核心假设是:SOP 应当通过封装多步工作流来降低 Agent 的认知负荷。这一点在交互轮数的统计中得到了完美印证。

如上图所示,展示了随着迭代周期(Epoch)的推进,Agent 平均解决一个任务所需的推理轮数变化。在最初的几个 Epoch 中,由于工具集可能混杂着不够稳定、尚在实验阶段的初级 SOP,Agent 有时需要进行冗余的试错,导致推理轮数并没有立刻下降。
然而,当 EvoSOP 的迭代闭环开始发力,低效工具被审查器剔除,冗余流程被合并器整合,情况发生了根本性逆转。在最后的几个 Epoch 中,平均交互轮数稳定在了一个远低于所有基准方法的水位上。
这种“推理压缩”不仅直接降低了频繁调用外部 API 带来的延迟和成本,更切断了导致长周期任务失败的根源——Agent 在冗长的交互轨迹中“走神”或丢失上下文。减少思考步骤,反而带来了成功率的提升,这是高阶抽象工具带来的最直接红利。
合并器模块为什么不可或缺?
为了探究各个模块对整体性能的具体贡献,研究人员针对合并器(Merger)进行了一项关键的消融实验。

从上图中可以清晰地看到,一旦移除了合并器模块(w/o Merger),系统的整体性能出现了明显的退化。这一结果揭示了工具泛化的重要性。如果不进行语义和功能的合并,系统里会充斥着大量只能解决极窄特定任务的碎片化代码。
合并器本质上充当了一个“正则化器”。通过合并,每个留存下来的 SOP 都获得了更广阔的适用范围和更高的可靠性。因为适用场景更广,这些整合后的工具在评估阶段被频繁调用的概率更高,进而避免了在审查阶段被系统当做“无用代码”误删。因此,合并机制是促使高阶工具使用模式涌现、确保 Agent 具备长期稳定性的基石。
动态优化的微观过程
为了更直观地理解工具集在优化生命周期中是如何优胜劣汰的,本文提供了一个合成 SOP 生命周期追踪的案例分析。

在这张追踪图中,每个区块内部的数字代表该 SOP 在当前周期的成功率(成功次数/总调用次数)。可以看到,有些 SOP 在被创造出来后,其执行成功率并不理想,或者被后续更为泛化的高级工具所替代,于是它们的生命线在某次迭代后戛然而止(以叉号标示)。
通过这种近乎残酷的末位淘汰与动态更新,尽管 EvoSOP 在整个生命周期中不断生成新的 SOP,但系统最终维持的工具集规模始终保持在一个非常紧凑的水平。它没有落入传统动态工具生成方法“只增不减、最终尾大不掉”的陷阱,从而保证了上下文输入的高效利用。
总结与展望
在从“机械的指令执行者”向“自主决策的智能体”跨越的道路上,如何让模型像人类一样沉淀经验、固化工作流,是行业内一直探索的命题。EvoSOP 的提出提供了一个优雅的解法:它并非通过昂贵的参数微调去强迫模型学会每个细微动作,而是通过机制设计,让模型自动完成从原子操作到标准操作程序(SOP)的抽象跃迁。
这项研究证实,一次性的工具扩充是不够的。真正的自我进化需要建立在一个包含构建、合并、验证和修剪的闭环之上。EvoSOP 不仅在成功率上取得了最高 13.4% 的突破,更重要的是,它为降低 API 交互成本、提高模型推理聚焦度展示了一条极具扩展性的技术路径。对于那些试图在复杂的企业级工作流中部署稳定 AI Agent 的开发者而言,由非参数化迭代优化带来的高效与可靠,无疑是极具启发性的下一步方向。