EMAS:冻结模型权重自演化Agent,代码准确率达89%且Token降62%

EMAS: Stabilizing Multi-Agent System Evolution through Evidence-Guided Revision

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

EMAS:冻结模型权重自演化Agent,代码准确率达89%且Token降62% 论文图示

在大语言模型驱动的多智能体系统(Multi-Agent System, MAS)设计中,存在一个长期被忽视的结构性矛盾:绝大多数自动化设计框架(如自动化工作流搜索、提示词优化器)都在系统上线前的“设计阶段”消耗大量计算资源搜寻最优的拓扑结构与提示词,一旦投入部署,整套多智能体架构就被彻底静态冻结。当系统在实际业务中处理成千上万个连续样本时,执行过程中产生的丰富错误归因与交互经验往往随着单次调用的结束而被直接抛弃。

ArXiv URL:https://arxiv.org/abs/2608.07196v1

这种“一次性设计、永久静态执行”的范式不仅难以适应多样化的下游数据分布,而且为了追求高准确率,许多静态系统往往堆砌了过于繁琐的验证层与反思轮次,导致单个任务的 Token 消耗居高不下。近期,来自复旦大学、京东以及阿卜杜拉国王科技大学的研究团队提出了名为 EMAS(Evolving Multi-Agent System)的演化多智能体系统。该框架明确提出:不需要更新大模型的底层权重,而是把多智能体系统的拓扑图和提示词本身作为可学习、可演化的程序状态,通过从线上运行轨迹中提炼可复现的诊断证据,实现系统架构的持续自演化。

在 MBPP 代码生成、Game24 组合搜索、Math 数学推理及 PlanBench 规划等四个基准评测中,EMAS 展现出了极强的自愈与自优化能力。尤其在 Qwen3.6-27B 模型底座上运行 MBPP 任务时,EMAS 仅通过系统层级的迭代演化,就将任务准确率从初始的 55.09% 提升至 89.12%,同时每个任务的 Token 消耗暴跌了 62.2%。这一工作为大模型时代的“递归自我提升”(Recursive Self-Improvement)开辟了一条完全绕过参数微调的系统工程新路径。

将系统层视为可学习的状态机

递归自我提升的核心目标在于构建能够随时间改善自身未来行为机制的人工智能系统。对于基于大模型的多智能体系统而言,这些机制绝不仅限于模型的连续参数矩阵。在参数层之上,提示词分配了角色职责,子步骤拆解了复杂工作,而有向图拓扑则调度着节点之间的中间制品流动。提示词、计算图拓扑与信息传递协议共同构成了一个包裹在底层 LLM 外层的“可执行系统层”。

传统的模型训练通过反向传播将标量损失回传至连续权重 $\theta^{(t)} \rightarrow \theta^{(t+1)}$;而 EMAS 则将底层大模型完全冻结,把优化目标瞄准了上层的离散系统架构。EMAS 认为,多智能体系统在连续处理新样本时产生的执行轨迹,本身就是驱动系统层迭代的最关键经验。

然而,让一个正在运行的多智能体系统动态修改自身拓扑和提示词,必然伴随着巨大的工程与稳定性风险。如果直接根据单次偶发的失败调整拓扑,极容易陷入过拟合与灾难性遗忘;若改动范围过大,甚至会导致原本运转良好的流水线全面崩溃。针对“在哪里修改”、“何时授权修改”以及“如何抑制能力倒退”这三个核心挑战,EMAS 建立了一整套严格的受控演化机制。

细粒度步骤图与结构化诊断

为了精准定位系统故障点,EMAS 首先对多智能体系统的内部表示进行了颗粒度重构。在既有框架中,一个智能体通常是一个承担多项职责的宏观模块,其内部的多次大模型调用与链式思考过程往往被封装成黑盒,使得外部优化器难以判断一次失败究竟源于提示词语意模糊、缺少必要的校验计算,还是有害的上下文传递。

EMAS 借鉴计算图视角,将每个任务类别的多智能体系统 $\mathcal{M}_c^{(v)} = (G_c^{(v)}, P_c^{(v)})$ 解构为由原子化“步骤”(Steps)和有向边连接而成的细粒度计算图。在这一图结构中,每个 Step 严格对应单次原子级的大模型调用,而有向边则显式传递结构化的中间制品。通过这种方式,智能体被拆解为透明的执行步骤序列,任何一步的中间输入、输出与提示词槽位都被显式暴露在可监控的环境中。

在演化执行阶段,系统会为每个样本的执行轨迹记录跟踪日志,并由专门的诊断器将其转化为标准化的可执行修改假设。EMAS 区分了两种完全不同的诊断方向:

  1. 准确率导向诊断:当且仅当系统输出错误时触发。诊断器深入检查每一步的中间制品,寻找导致最终答案失误的根本缺陷。例如,如果验证步骤(Verifier)没有收到解题步骤(Solver)的关键推导信息,诊断器会输出一个在 Solver 到 Verifier 之间增加边(add-edge)的假说;如果发现某个推理阶段缺失了反思校验环节,则输出增加节点(add-node)或节点拆分(split-node)的假说。

  2. 成本导向诊断:当系统输出正确时触发。此时准确率已经达标,诊断器转而寻找可被剔除的多余计算量、冗余信息流或过于冗长的指令提示,生成删除节点(remove-node)或修剪边(remove-edge)的降本假说。

通过这种规范化的诊断映射,高维模糊的自然语言执行轨迹被精准投影为包含具体操作类型、目标拓扑位置和提示词槽位的离散更新假说。

重复发生门控与成对验证机制

若系统对每一个生成的假说都立即实施代码重构,系统拓扑将频繁震荡,最终沦为随机游走的产物。现实生产中的单次错误,往往可能仅仅源于模型采样时的温度随机性或个别极端样本的噪声,并非架构层面的系统性缺陷。

为此,EMAS 提出了“重复发生”(Recurrence)门控机制。对于每一个局部修改假说 $h$,EMAS 维护着一个独立的证据缓冲区,专门记录支持该假说的不同样本。系统设定了严格的操作阈值 $\kappa_a$:只有当完全相同的结构化诊断在多个不同样本的运行轨迹中反复重现、累积的支持样本数达到阈值时,系统才会被授权触发一次候选架构生成。这种机制有效地过滤掉了偶发孤立的执行噪音,确保每一次提出的系统重构都建立在统计共识的基础之上。

即使一个候选系统 $\widetilde{\mathcal{M}}_c$ 拥有充分的复现证据支撑,它在实际部署中依然可能带来未知的副作用——修复了当前错误,却破坏了其他已有的解决路径。为了彻底防止架构劣变,EMAS 引入了基于固定平衡验证集 $\mathcal{D}_c^{\mathrm{val}}$ 的“成对验证”(Paired Validation)闸门。

在验证集上,候选系统 $\widetilde{\mathcal{M}}_c$ 必须与当前活跃版本 $\mathcal{M}_c^{(v)}$ 进行严格受控的同台竞技,两者共享完全一致的模型参数与推理配置。系统定义了严格的准入规则:

\[\operatorname{Accept}_{\mathrm{acc}}(\widetilde{\mathcal{M}}_c) \iff C(\widetilde{\mathcal{M}}_c) > C(\mathcal{M}_c^{(v)})\] \[\operatorname{Accept}_{\mathrm{cost}}(\widetilde{\mathcal{M}}_c) \iff C(\widetilde{\mathcal{M}}_c) \geq C(\mathcal{M}_c^{(v)}) \land T(\widetilde{\mathcal{M}}_c) < T(\mathcal{M}_c^{(v)})\]

其中 $C(M)$ 表示系统在验证集上的正确题数,$T(M)$ 代表总 Token 消耗。准确率候选系统只有在正确样本数绝对增加时才获准提交;而成本候选系统不仅必须实现更低的 Token 开销,还必须保证准确率不发生任何下滑。一旦候选方案被判定未达标,系统将果断执行回滚,完全保留原版本;若候选方案通过验证,系统状态才正式迁移至 $\mathcal{M}_c^{(v+1)}$,并立即对后续激活样本执行重放,彻底清除陈旧证据,防止系统基于过时的中间状态提出错误的二次更新。

突破性能上限:跨模型与基准的评测表现

研究团队在两个极具代表性的冻结基座模型——Kimi-K2-6 与 Qwen3.6-27B 上,对 EMAS 展开了深入评测。测试基准涵盖数学推理(Math)、代码生成(MBPP)、复杂规划(PlanBench)以及组合搜索(Game24)。作为对比基准,实验纳入了通用指令方案(Genesis)、融入标准操作规程的提示词方案(Genesis+SOP)、静态初始多智能体设计(Initial MAS),以及当前先进的自动化智能体设计框架 AFlow 和 ADAS。

对比结果展现了动态演化的显著优越性。在仅经历两个演化周期的前提下,EMAS 在 Kimi-K2-6 上取得了 6.30% 的任务加权相对准确率提升,而在 Qwen3.6-27B 上的相对提升幅度更是达到了惊人的 20.10%。在八个“模型-基准”组合实验中,EMAS 在六个设置中取得了最高或并列最高的准确率成绩,全面超越了依赖离线搜索的静态设计方法。

尤为引人瞩目的是 EMAS 在处理复杂任务时的双向优化能力。在 Qwen3.6-27B 运行 MBPP 代码生成任务的实验中,初始多智能体系统的准确率仅为 55.09%,平均每道题消耗 5.16k Token。经过经验驱动的拓扑重构与提示词修正,演化出的最佳版本准确率攀升至 89.12%,绝对提升达 34.03 个百分点,同时每道题的 Token 消耗大幅骤降至 1.95k,降幅达 62.2%。

这表明,高质量的多智能体演化并非单向依赖无休止增加检查节点和反思轮次;通过修剪冗余节点、精简通信接口并强化关键提示词约束,系统完全能够在大幅削减计算资源的同时,显著提升整体执行质量。

长周期演化动态与底座适配性

随着演化周期的进一步拉长,EMAS 揭示出了多智能体系统进化过程中更为深刻的动态规律。研究人员将 Game24 任务的演化周期延伸至 15 个 Epoch,观察系统在长期视界下的帕累托前沿外推能力。

实验数据显示,系统呈现出了明显的底座依赖性演化轨迹:

这一对比有力地证明了 EMAS 的普适性与自适应弹性:面对不同能力梯度的基础大模型,同一种演化机制能够自主调整工作重心——对存在明显能力短板的系统优先进行拓扑重组与逻辑补全,而对接近性能饱和的系统则专注于通信修剪与计算能效精炼。

为什么不能省略门控与验证?

为了探究 EMAS 保持稳健提升的关键机制,研究团队在 Qwen3.6-27B 的 Game24 任务上对“证据重复发生门控”(Recurrence)与“成对验证闸门”(Validation Gate)进行了精细的剥离消融实验。对比设定包括完整版 EMAS、取消证据累积(即单次轨迹出现假说立即触发修改,$\kappa=1$),以及彻底移除验证集过滤(候选方案直接上线)。

实验从多个维度揭示了控制机制对于抑制系统劣变的核心价值:

消融结果清晰地描绘出两道防线的明确分工:重复发生门控从源头过滤了噪声证据,防止了盲目生成错误方案;成对验证机制则在终端把守住了系统的性能底线,确保即便生成了不可靠的离散架构,也绝不会污染当前已建立的生产版本。

局限性与系统自演化的未来

尽管 EMAS 在多智能体自主进化领域迈出了突破性的一步,但该工作依然揭示了系统级自演化面临的一系列深层挑战。

首先是演化过程中的非单调性(Non-monotonicity)现象。即便拥有严格的成对验证集,在跨越版本迭代时,系统在独立测试集上依然会发生局部倒退——实验中观察到 93 次发生版本提交的演化节点中,有 39 次在测试集上出现了轻微的局部泛化下降。这表明基于有限固定验证集的评选容易产生一定程度的适应性过拟合;如何引入滚动验证(Rolling Validation)与保留意识验证(Retention-aware Acceptance),确保系统在掌握新技能的同时百分之百维持旧题目的留存率,是下一步演化机制亟待解决的课题。

其次是诊断归因的语义粗粒度问题。目前的诊断抽象将轨迹投影为离散的拓扑与提示词槽位,这种归约有时会将不同深层成因的故障合并为同一个结构化假说;与此同时,一次只允许修改单节点或单边的局部限制,也使得系统难以一次性完成需要多节点协同调整的深层次复杂重构。

此外,运行成对验证和高频回放所带来的额外推理 Token 消耗,也是系统自演化必须面对的现实代价。在工业化落地中,如何设计更为轻量廉价的粗筛机制,使多智能体系统在自我迭代过程中的计算开销“自负盈亏”,将决定此类技术能否真正长期驻留在生产环境中。

但无论如何,EMAS 提供了一个极具启发性的范式转变:大语言模型的参数冻结,绝不意味着基于它构建的自主执行系统必须停滞不前。通过将运行轨迹沉淀为具有因果诊断价值的经验证据,并在离散的图结构空间中执行受控演化,多智能体系统完全有能力打破静态提示词工程的上限,在实际业务与环境交互中完成持续的自我生长。