EvolveNet:不是聚合数据而是聚合代码!协作式Agent进化机制提升5大场景
EvolveNet: Collaborative Harness Evolution for Agent Self-Improvement

大语言模型(LLM)本身并不等同于一个真正可运行的智能体(Agent)。决定 Agent 最终能力边界的,不仅是底层的神经网络权重,更是包裹在模型外围的“控制程序(Harness)”——这套可执行代码负责构建多轮上下文、精准调用外部工具、验证中间推理结果,并在遭遇死胡同或运行崩溃时执行恢复策略。近年来,前沿研究逐渐揭示了一条无需触碰模型权重的能力跃升路径:只要不断优化和迭代这套 Harness 代码,Agent 就能获得持久且显著的行为改善。
ArXiv URL:https://arxiv.org/abs/2608.04968v1
然而,现存的 Harness 进化策略普遍受制于一个严重脱离真实生态的假设。它们默认所有的任务负载(Workloads)、执行轨迹和行为反馈都可以被毫无保留地汇聚到一个中心化的优化器中。这个集中式的大脑随后会逐字逐句地修改代码,沿着一条单一的时间序列轨迹去试错和演进。在真实的 Agent 应用生态里,这种假设是完全站不住脚的。个人用户的私有交互、企业机构的内部环境、垂直领域的特殊数据库,天然地产生着孤立的经验流。这就制造了一个极其矛盾的局面:那些最能够暴露系统短板、最值得 Agent 去学习的真实长尾经验,偏偏正是那些受制于隐私和物理隔离、绝对无法被集中池化的高价值数据。
为了打破“数据必须集中才能进化”的旧有范式,香港浸会大学、香港科技大学与中国科学技术大学的研究者联合提出了一种全新的协作式代码进化框架——EvolveNet。该框架的核心破局思路在于将经验提取的动作“下放”到数据本地。它不再强求将各地的原始数据强行打包上传,而是让散落各地的 Agent 独立在自己的私有负载上进行试错与代码改写,最后在中心节点对这些“提炼出来的代码变动”进行精妙的融合与重分发。
在包括 Text-to-SQL、数据科学代码生成、算法竞赛、软件工程迭代以及智能体工作流在内的 5 大核心场景中,EvolveNet 均成功推动了共享代码库的性能增长。尤其在各节点掌握完全不同领域专业知识(异构负载)的极限测试中,EvolveNet 所能挖掘的性能红利最为巨大。这证明了它并非只是简单地选出了一个“最好”的版本,而是真正把来自五湖四海的代码智慧有机组合在了一起。
颠覆演进路径:从“聚合数据再进化”到“本地进化再聚合”
在现有的单点中心化演进中,Agent 的进化过程是高度串行的。中心节点只能像消化单一流水线上的零部件一样,依次读取新进来的数据批次,生成新版 Harness,验证它,然后再基于这个版本去探索下一个方向。这意味着如果进行 $T$ 次搜索,其时间成本和串行深度就是 $T$。当面对来源错综复杂的海量数据时,单一的进化轨迹很容易在某个局部最优解中迷失,或者顾此失彼,为了迎合新场景的特定需求而改坏了原有的通用逻辑。

EvolveNet 彻底逆转了这一流程,提出了一种基于并行协作的全新生命周期。在每一轮进化的起点,服务器会将当前最优秀的共享 Harness 广播给网络中所有具备本地数据的 Agent 节点(即客户端)。这些客户端互不干扰,各自在受保护的本地数据环境里运行这套代码。当它们发现当前的 Harness 在处理本地特定任务(比如某个独特的代码库错误,或某种罕见的 SQL 语法结构)表现不佳时,就会在本地利用 LLM 驱动的代码修改器去修改和增强 Harness。
这种“进化发生在边缘端”的设计,直接产生了两大红利。第一,数据隐私和隔离的问题迎刃而解,原始负载永远不会离开它的产生地;越过系统网络边界进行通信的,仅仅是改写后的程序文本、差异代码(Delta)以及评估其有效性的脱敏打分。第二,进化的并行度被彻底释放。在同一时间窗口内,网络中存在多条互不干扰的演进轨迹。整体的等待深度不再是所有搜索步数的总和,而是取决于最慢的那个本地节点的搜索时间。经过一轮本地演进后,每一个节点都孕育出了一个专门适应其本地土壤的“特化专家版(Specialist)” Harness。
真正的硬核技术难点,也正是在这一步显现:中心节点该如何把这几十甚至上百个“特化版本”安全地缝合成一个统一的、比所有人都更强的新一代共享 Harness?
程序聚合的深水区:为什么常规的联邦学习套路失效了?
提及分布式节点的经验融合,联邦学习(Federated Learning)及其代表性算法 FedAvg 无疑是最直接的联想。在联邦学习中,各个客户端在本地训练模型,然后将更新后的参数张量发送给服务器。因为神经网络的权重存在于一个连续的实数向量空间中,服务器可以心安理得地使用数学上的算术平均,将各个客户端的更新按照权重“加”在一起,甚至可以对梯度冲突进行消解。
但 EvolveNet 面临的是一个截然不同的数学与工程空间——它要合并的是由 Python 或其他高级语言编写的源代码。对于代码而言,算术平均是一个毫无意义的概念。
两段被独立修改过的源代码,如果直接通过常规的 Git Merge 强制拼接在一起,大概率不仅无法将优点叠加,反而会直接造成灾难性的崩溃。例如,节点 A 发现一个验证机制太严格导致误判,于是删除了那行代码;节点 B 发现该验证机制存在漏洞,于是增加了额外的判断条件。如果简单合并,逻辑就会彻底矛盾。更隐蔽的冲突在于运行时的状态干扰:节点 C 修改了一个控制流中的全局变量用于保存临时结果,而节点 D 在另一处修改中恰好清空了这个变量。这种深层的语义冲突,完全无法通过单纯比对代码文本结构来预判。在代码空间里,两个独立看起来极其完美的补丁,组合在一起可能变得冗余、互相抵消甚至是产生致命的语法错误。
因此,协作式 Harness 进化的成败,不再是一个简单的“网络通信与版本同步”问题,而是一个极其复杂的“程序语义验证与能力组合”问题。服务器必须在没有原始测试数据的情况下,判断哪些代码修改是通用的、哪些是特定场景专属的,并确保它们拼装在一起后依然能够正常运行。
EvolveNet 的破局核心:证据引导与作用域类型化的代码组合
为了跨越代码聚合的鸿沟,EvolveNet 放弃了盲目的文本级拼凑,构建了一套被称为“证据引导、作用域类型化的程序聚合(evidence-guided, scope-typed program aggregation)”的核心机制。这套机制通过四个紧密咬合的步骤,确保来自不同节点的代码智慧能够以最安全、最高效的方式沉淀在共享库中。
第一重保障:基于共同基准的代码拆解(Common-base program deltas)。
由于在每一轮开始前,所有的客户端都是从服务器接收到完全相同的公共 Harness 作为起点。因此,当客户端将修改后的特化版本交回给服务器时,服务器可以非常清晰地提取出增量代码(Delta)。服务器会将这些增量进一步拆解为具有独立语义的“机制(Mechanisms)”。一个机制未必是一行连续的代码,它可能是为了实现“在报错时重新查询 Schema”这样一个完整动作而在多个不同位置插入的几段代码片段。
第二重保障:用真实执行证据说话(Behavioral evidence)。
在提交代码的同时,客户端必须附带提交一份“行为证据”清单。这份清单不包含具体的敏感数据内容,但它记录了这一项代码修改究竟“修好了哪些以前做错的题目”以及“弄坏了哪些以前做对的题目”。服务器不会去猜测一段代码的意图,而是完全依赖这份行为清单来评估该机制的价值。这实质上是用执行层的外在表现,来倒逼代码层的合理性验证。
第三重保障:严格的作用域类型分配(Scope-typed composition)。
这是 EvolveNet 最具创造性的设计之一。当服务器拿到一堆有效的机制后,它需要决定将这些机制安放在新程序的什么位置。EvolveNet 根据证据清单的来源,为每一个机制分配一个“作用域(Scope)”。
如果一个机制(例如一种极具通用性的思维链提示语,或一种通用的代码容错重试逻辑)在多个不同领域的客户端中都被验证有效,或者它解决了一个跨领域的共性失败模式,服务器就会赋予它 GLOBAL(全局)作用域。这意味着它会被直接整合到主干逻辑中,所有未来的任务都将受惠于此。
反之,如果一个机制的作用仅仅是为了应对某个极其特殊的本地环境(比如一套专为某个特定软件仓库定制的修复流程),并且只在某一个客户端的证据中被证明有效,服务器会赋予它 HOME(d)(特定领域专属)作用域。在合成代码时,服务器会将这类代码包裹在一个明确的条件判断分支里(例如 if current_domain == d:)。论文从理论上严格证明了这种基于条件守卫(Guard)的代码隔离属性,只要这部分代码不越界去篡改全局共享的状态变量,它就绝对不会对其他领域的任务执行产生哪怕一丁点的干扰。这种设计允许 Agent 在保持通用能力底座的同时,无限量地积累针对极其细分场景的“偏方”和“特技”。
第四重保障:不可动摇的行为接受门槛(The adoption procedure & Acceptance gate)。
尽管上述策略极大地降低了冲突概率,但程序的执行终究是充满非线性相互作用的。因此,EvolveNet 设置了最后一道防线——行为验收门槛。服务器基于其内置的验证数据集(Validation Slice),对拼接好的全新 Harness 进行一次完整的试运行。它强制要求合成后的代码带来的正向修复收益,必须大于由于代码冲突引发的破坏退化(即“修复的数量 > 弄坏的数量”)。这就像一个绝对严格的数据库事务(Transaction),如果组装后的程序未能跨过这道收益底线,服务器将无情地回滚该次合并提案。聚合操作在此变成了一种带有硬性质量兜底的保守演进,彻底杜绝了代码库陷入退化漩涡的风险。
异构负载下的断层式领先:组合优于选择
为了真正检验这套聚合机制的成色,研究团队设计了一套非常严谨的隔离测试方案,在 Text-to-SQL(自然语言转数据库查询)、数据科学编码、算法竞赛编程、软件工程问题修复以及复杂智能体工作流控制这五个前沿挑战场景中展开了验证。
实验结论提供了一个极其有力的证明:EvolveNet 能够在所有五个场景中驱动共享 Harness 实现性能的正向积累。更具启发意义的是实验对于“数据分布差异”的探索。当多个参与协作的客户端持有的是高度“异构”的任务负载——例如一个节点专门负责处理复杂的长连接 SQL 查询,另一个节点则埋头苦干于 Python 数据分析脚本时——EvolveNet 所能挖掘出的协作提升幅度达到了顶峰。
在针对异构环境的消融对比实验中,研究者揭开了 EvolveNet 成功背后的最终底牌。如果是使用常规的思路,在多个节点交回的 Harness 中“挑选”出一个综合得分最高的版本作为新一代的基线,性能很快就会触及天花板;因为选出的大神版本,往往只能精通它自己见过的领域。而 EvolveNet 因为采用了深入代码结构的“组合(Composition)”,真正做到了将节点 A 摸索出的通用纠错策略,与节点 B 针对特定 API 总结出的调用技巧无缝融合。合成后的共享 Harness 展现出了一种强烈的“1+1>2”的涌现能力——它完成了一些任何单一本地客户端都未能独立解决的边界难题。
EvolveNet 的出现,重新划定了大模型时代 Agent 能力进化的边界。它证明了提升 AI 系统的天花板,未必非要走无限吞噬数据、进行中心化暴力炼丹的独木桥。通过设计一套精巧的代码语义组合与行为验证规范,我们完全可以让分布在世界各地、面对千奇百怪真实长尾挑战的 Agent 们,在绝对保护数据隐私的前提下,共同编织出一个日益强大且无坚不摧的控制中枢。这种由数据端反向滋养核心框架的“众包式”代码进化网络,或许正是通向更灵活、更具韧性的下一代智能体生态的关键钥匙。