VaG:化解自进化Agent技能污染,腾讯以5倍更小技能池达72%成功率
When Self-Evolution Backfires: Pre-Commit Gating against Skill Contamination in LLM Agents

给大模型赋予“自我进化”(Self-Evolution)的能力,是构建真正长生命周期自主 Agent 的核心愿景之一。目前主流的设计模式非常直观:让智能体在执行任务后复盘自身轨迹,将解决问题的有效经验提炼成一条条自然语言技能(Skills),写入持久化的技能库中;当下一次遇到新任务时,这些技能会被动态检索或全部注入到模型的决策上下文中。在许多人的直觉里,这个过程应当像滚雪球一样带来能力的正向复利——经历的交互越多,沉淀的技能库越丰富,Agent 的能力就应该越强。如果偶尔混入了一条劣质技能,之后删掉不就行了吗?
ArXiv URL:https://arxiv.org/abs/2608.05810v1
腾讯的一项最新研究打破了这种美好的技术直觉。论文发现,未经审查的技能积累不仅无法实现性能的单调上升,反而会在越过某个临界点后发生崩塌式退化;更致命的是,劣质技能对智能体系统的污染具有结构性不可逆性(Structurally Irreversible)——一旦有缺陷的经验进入上下文,它就会成为后续轮次提炼新技能时的“参考资料”,即便事后把最初的问题技能精准剔除,它所衍生出的逻辑病毒也早已深深烙印在后续的技能谱系中。
针对这一本质瓶颈,研究团队提出了名为 VaG(Verifier-as-Gatekeeper)的预提交门控机制。该框架通过三层异构判别器与边际增益贪心选择,把技能入库变成一道极其严苛的晋升流程。在具有高难度终端交互基准 Terminal-Bench 2 上,无门控的 Agent 在经历几轮进化后性能大幅回落,而 VaG 则凭借大约小 5 倍的极简技能池,实现了轮次间的单调提升,最终以 72% 的 pass@1 远超基线。

自进化的暗面:技能积累为何不是单调递增?
在 Voyager、ExpeL 以及各类工作流记忆系统的经典设定中,技能提取模块输出的文本通常不加筛选地直接写入持久化存储。既然这些经验是由模型自己成功完成任务后总结出来的,研发者通常假设它们天然具备正向价值。
然而,在严格受控的多轮自进化实验中,研究人员观察到了明显的性能相变现象。在 Terminal-Bench 2 基准上追踪智能体五轮的演进历程,其 pass@1 成绩在技能池规模较小时确实有所爬升,但在达到某个临界池容量 $k^*$ 之后迅速见顶回落,最后甚至跌回了与第一轮相当的水平。
导致系统性能随经验积累反而恶化的原因,可以拆解为三个递进的污染层级:
其一是个体级污染(Individual Contamination)。某些被提炼出来的单条技能本身就带有逻辑缺陷或虚假假设。例如在特定环境下巧合生效的 Hack 操作,被模型概括成了普适性规则,一旦单独出现在决策提示词中,就会直接拉低任务的成功率。
其二是组合级污染(Combinatorial Contamination)。这是最为隐蔽也最普遍的形态。两条技能在孤立状态下各自测试都是完全良性的,甚至各自能带来微小的收益;但当它们同时被放入 Prompt 时,由于建议互相冲突、指引权重混乱或上下文长度膨胀带来的注意力稀释,智能体的执行逻辑开始变形,导致组合收益 $g({s_a, s_b}, \tau) < 0$。
其三则是系统级污染(Systemic Contamination)。前两类微观冲突经过多轮累积后,在宏观上表现为性能越过临界点后的雪崩。这种相变清晰地表明:技能的边际价值绝非恒正,堆砌经验必然会导致环境信息过载与逻辑退化。
为什么事后删除救不回崩溃的系统?
面对性能衰退,最直观的工程应对手段往往是“事后排查与回滚”——识别出引发错误的根源技能,直接从技能库中将其 Delete。但数学与机理推导表明,这种做法在自进化闭环中根本无法挽回损失。
设想在第 $r$ 轮进化中,智能体基于此前积累的技能库 $M_{r-1}$ 解决问题并提炼出新技能 $S_r$。这意味着后续技能的生成分布是条件依赖于先前上下文的:
\[S_r \sim \pi(\cdot \mid M_{r-1})\]一旦一条有缺陷的根源技能 $s$ 在早期轮次被接纳,哪怕后续的任务情境发生变化,大模型在总结归纳新经验时,依然会将 $s$ 视作先验真理或推理范式。由此提炼出的后代技能 $\text{desc}(s)$,即使在文字表述上完全不提及 $s$,其底层的认知偏见与错误假设也已经完成了基因代际遗传。
本文给出了一项令人警醒的经验验证:在无门控进化崩溃后的技能库中,研究人员定位并剔除了所有被标记为有害的根源技能,结果仅仅挽回了 17% 的性能跌幅(约 1.7 个百分点)。而即便引入具有全知视角的“神谕清理”(Oracle Cleanup),强行追踪并抹去根源技能及其全部后代,依然有近一半的性能缺口永远无法恢复。这证明污染已经深刻改变了模型演化轨迹的整体状态分布。
既然事后清理在原理上存在无法弥合的鸿沟,那么逻辑上的必然推论只有一个:技能准入必须是前置阻断(Pre-commit),绝不能是事后补救。任何技能在获得影响智能体决策上下文的资格之前,必须经过不可逆转的入库审查。

VaG框架:建立技能的渐进信任阶梯
为了在技能进入上下文之前筑起高墙,研究团队构建了名为 VaG(Verifier-as-Gatekeeper)的分层信任架构。该系统将技能的状态严谨划分为三个等级:$\text{Cold} \prec \text{Warm} \prec \text{Hot}$。所有从交互轨迹中刚蒸馏出的原始技能,默认全部被打入 Cold 状态,对智能体完全不可见。想要进入决策上下文,技能必须连续通过两道设计迥异的门控机制。
第一道门控(Gate 1)的核心任务,是考察单条技能是否“自身无害”。研究团队没有依赖单一的大模型打分,而是设计了三个彼此正交、成本由低到高的异构判别器:
-
结构有效性检查(Deterministic Schema Check):纯确定性规则检查。快速过滤掉格式畸变、标签残缺或触发条件定义模糊的残次条目,这一步完全不需要消耗模型推理算力。
-
行为无害性重放(A-B Replay):真实执行检验。将候选技能挂载到保留的任务集(Holdout split)上进行 A-B 对比测试,直接观测其是否会在实际上拉低任务完成率。这是杜绝“文字写得冠冕堂皇,运行起来暗中使坏”的最有力手段。
-
语义一致性审查(LLM Semantic Review):由大模型充当语义法官,审查技能文本内部是否存在捏造事实、逻辑自相矛盾或给出反常识操作指令等幻觉问题。
由于这三个审查器分别卡死了格式、实际行为与语义内涵三个独立维度,一条有害技能必须同时欺骗规则检测、沙盒环境与语言模型才能蒙混过关。更具工程美感的是,前两个低成本检查可以快速淘汰大量劣质候选,使得高成本的模型调用次数被大幅压缩。
顺利跨越 Gate 1 的幸存者会被标记为 Warm。然而,单兵表现优异并不意味着团队配合融洽。为了解决前述的组合级冲突,系统引入了第二道门控(Gate 2):基于边际增益的贪心子集选择。
由于多个技能同时注入后的联合效用函数 $f(H)$ 并不具备单调递增性,系统采取了一种保守且务实的贪心策略:从当前已被证实有效的候选集合出发,每次尝试加入一个让保留集联合表现提升幅度最大的 Warm 技能;只要该技能无法带来严格正向的边际增益,或者导致联合测试性能下降,就坚决将其阻截在门外。只有真正实现正向协同的技能,才能最终晋升为 Hot 状态,被写入智能体的核心运行时系统提示词中。
实验评测:不仅跑赢自进化,更击败“理想早停”
实验评测在标准严格的 Terminal-Bench 2(TB2)上展开。TB2 包含大量复杂的实际 Shell 交互场景,测试全部在沙箱容器中运行,并由确定性自动化代码进行正误判别,杜绝了 LLM 裁判带来的主观评分偏差。研究团队将任务集严格划分为三个不重叠的部分:用于驱动蒸馏与演化的 Event 集(50 题)、用于门控重放评测的 Holdout 集(14 题),以及从未参与任何演化和门控决策的独立测试集 Test(25 题)。
在主干模型驱动下,无门控进化系统(Ungated)在第 3 轮达到峰值后迅速崩溃,到了第 5 轮时 pass@1 大跌,技能池被塞入了 179 条良莠不齐的庞杂文本。相比之下,经过 VaG 门控筛选的智能体不仅每一轮都在单调提升,最终以 72% 的 pass@1 傲视全场,其 Hot 技能池在 R5 结束时仅保留了 37 条高密度、高价值的核心技能,体积仅为基线的五分之一左右。
这意味着,VaG 的表现不仅大幅拉开了与无门控基线的差距,甚至超越了假设存在完美监控的“理想早停点”(Oracle Early Stopping,即在无门控第 3 轮峰值处停下)。原因在于,即使在峰值阶段,无门控池子里也已经掺杂了潜在的负面冲突条目,而 VaG 则始终保持了池子内部极高的信噪比。
这一优势同样直接体现在运行成本上。由于无门控系统技能池过度膨胀,其每个 Trial 平均消耗的 Token 数量从前期的 0.7M 级飙升至 1.30M,导致推理速度放缓且充斥无效上下文;而 VaG 由于技能池被死死压制在小巧精炼的状态,平均单次交互的 Token 消耗稳定在 0.77M 至 0.94M 之间。门控带来的收益不仅是更聪明的模型,更是更便宜、更高效的运行时。
为什么每个组件都不可或缺?
为了厘清各个防御层的作用,研究团队进行了严密的消融实验。数据清晰地证明了异构判别器之间的非替代性:
在 Gate 1 中,移除行为无害性重放(Holdout Replay)带来了最为剧烈的性能滑坡,pass@1 直接暴跌 10 个百分点。这证明经验归纳中最具欺骗性的往往是那些“表面严丝合缝、实操完全走偏”的伪经验,只有放到沙箱里真实跑一遍才能撕下伪装。移除语义一致性审查会导致性能下降 4 个百分点,它放行了一批看似能跑通但指导逻辑荒谬的技能;而移除结构有效性检查则带来 2 个百分点的下降。
更具启示性的是 Gate 2 的消融表现。如果直接将所有通过 Gate 1 的良性技能无脑灌入 Hot 状态(即放弃边际增益贪心选择),Hot 技能池会立刻从 37 条膨胀至 58 条,而智能体的最终表现却直接丢掉了 8 个百分点。这一显著退步为“组合级污染”的存在提供了最铁证如山的经验证据:在多智能体与上下文工程中,局部最优的简单叠加绝不等于全局最优,多条各自无害的建议一旦在同一个 Prompt 里相遇,极易诱发致命的决策冲突。
跳出单模型视角:通往可迁移的工程常识
自进化框架沉淀出来的技能,究竟只是适配特定底座模型脾气的特定 Prompt Trick,还是真正具备泛化能力的通用操作知识?
研究人员冻结了通过主模型进化出的 R5 Hot 技能池(共 37 条技能),在完全不进行任何二次进化与适配的前提下,直接迁移挂载至其他四个完全不同的开源与闭源顶尖底座上:DeepSeek-V4-Pro、GPT-5.4、Claude Sonnet 4.5 以及 Qwen3.6-35B-A3B,并在 Test 集上测试其解题能力。
结果显示,这套由 VaG 守护提炼出的精简技能库展现出了极强的跨模型泛化性。所有模型在挂载该技能库后,相较于纯净 baseline 均获得了 8 到 16 个百分点的显著提升。尤其是 GPT-5.4 与 Claude Sonnet 4.5,成功率均达到了 56%,甚至超过了用于进化这套技能的初始主干模型本身的成绩。这强有力地说明:在严苛的前置阻断机制下,Agent 沉淀下来的并不是模型自身的执行噪声或过拟合碎片,而是具有极高信息密度的工程常识与操作方法论。更强大的底座模型不仅没有受到外部经验的干扰,反而能够更好地理解并释放这些自然语言经验的潜力。
同样的正面迁移效应也在 InterCode NL2Bash 基准上得到了复现。即便在偏向单步命令映射、任务颗粒度截然不同的场景下,被 VaG 提炼出的通用 Shell 技能依然能够保持稳定的性能正收益。
走向有纪律的 Agent 自我完善
长期以来,AI Agent 领域在追求“自主进化”时往往带有一种盲目的乐观主义,倾向于尽可能多地把历史轨迹当做养料吸收,却忽视了记忆库本身的免疫系统建设。
这项研究所揭示的核心价值,不仅在于提出了一套高效运作的 VaG 门控管线,更在于它用严谨的数学形式与实验数据,指出了自进化范式中不可逆的“污染相变”本质。对于任何试图构建自适应、终身学习型 Agent 系统的工程师而言,一个至关重要的范式转移已经摆在面前:技能库的准入绝不仅仅是一道轻量级的格式校验,而是防止整个认知闭环发生雪崩的最后一道防线。唯有建立起包含真实环境反馈与组合冲突排查的前置审查纪律,Agent 的自我进化才能真正走出“越学越笨”的怪圈,步入稳健向上的正向循环。