GSE:从局部修补到全局图谱,让编程Agent召回率最高提升180%
Learning Globally Reusable Skills for Coding Agents

在大语言模型(LLM)驱动的软件工程智能体(Coding Agent)领域,静态系统正迅速遇到天花板。无论是面对跨编程语言的语法细节、复杂的项目工程约定,还是难以捉摸的隐蔽缺陷,依靠人工预先写好的 Prompt 和工具调用策略,都难以应对真实软件开发中层出不穷的长尾场景。为此,无需昂贵模型重新训练的“技能自主演化”(Automated Skill Evolution)成为了近年来的前沿方向:让智能体在失败或成功的执行轨迹中总结模式,沉淀为可复用的技能并存入技能库(Skill Bank),从而实现能力的自主迭代。
ArXiv URL:https://arxiv.org/abs/2608.06153v1
然而,现有的演化方案往往存在致命缺陷。天津大学与清华大学的研究团队在一项最新工作中指出,以往的方法大多将技能演化简单视为一系列“局部更新”。智能体针对某一次单点失败总结出的经验,往往带着极强的项目特异性与偶发性,直接合并进技能库不仅容易导致技能过拟合与碎片化,更会引发致命的连锁反应——一条原本为了修补特定场景缺陷而新增的规则,可能会悄悄破坏其他技能依赖的上下文假设,导致系统在后续任务中出现严重的行为回退(Regression)。
针对这一瓶颈,研究团队提出了全局化技能演化框架 GSE(Globalized Skill Evolution)。该方案不再将技能视为孤立文本的线性堆叠,而是引入技能关系图(Skill Relation Graph, SRG)来显式建模与协同演化技能间的依赖、共用与冲突,并配合基于聚类的抽象合并与回放驱动验证机制,实现了全局一致性与泛化性的双重约束。在 Java 缺陷触发测试生成与字节跳动真实工业生产场景的 Bug 报告虚警过滤两大严苛任务中,GSE 展现出惊人的提升效果:相比现有前沿演化算法,其测试生成的召回率提升最高达 180.0%,工业落地场景的 F1 值显著增长 61.4%,为长生命周期自主智能体的构建提供了极具说服力的方法范式。

局部演化的死局:碎片、冲突与行为回退
要理解 GSE 的核心创新,首先需要看清当前 Coding Agent 在自我演化时面临的深层困境。传统的技能演化框架(例如 Trace2Skill 或 Live-SWE-agent)在逻辑上基本遵循“观察失败轨迹 $\rightarrow$ 反思提取规则 $\rightarrow$ 存入技能库”的流水线。这种模式直觉上合情合理,但在真实的复杂软件工程中却极度脆弱。
智能体在代码仓库中的工作是一个高度耦合的动态过程。例如,一个“上下文代码探索技能”负责圈定哪些文件和类与当前问题相关,而后续的“缺陷推理技能”则完全建立在此前提取出的上下文之上。当演化机制仅基于一次具体的失败去调整探索技能时,它可能会强制收紧搜索范围以规避特定的超时问题。这种改动虽然在当前用例上成功了,但它破坏了后续推理技能所预设的“上下文完整性假设”。当智能体面对其他项目时,收紧的搜索范围可能导致关键依赖文件被彻底遗漏,从而引发原本能够完成的任务全面溃败。
更为严峻的挑战来自于技能的泛化鸿沟。智能体在不同项目中遇到类似的问题时,往往会因为低层代码特征(例如特定的异常类型或第三方库调用)的差异,独立生成多个各不相同、但本质相同的琐碎技能。久而久之,技能库被大量高度定制化、浅层表象化的“碎片补丁”所充斥。智能体不仅没有学会通用的软件分析方法,反而对训练过程中见过的几个项目产生了严重的过拟合。面对这一矛盾,GSE 的核心洞察在于:技能演化本质上是一个针对互联复用系统的全局优化问题,必须兼顾技能间的兼容性(Compatibility)与通用性(Generalization)。
轨迹瘦身与结构化提案:提炼高因果密度的演化线索
真实的智能体执行轨迹往往长达数万个 Token,其中充斥着海量的冗余信息,例如终端执行 find 或 grep 后的海量文件路径、编译过程中的低信息量日志,以及工具返回的原始巨型文件内容。如果把这些未经处理的“垃圾信息”一股脑塞给演化模块,不仅会导致上下文窗口暴涨、推理成本陡增,更会掩盖真正的失败因果链。
GSE 首先构建了轨迹精炼机制(Trace Simplification)。该机制有选择地剔除耗费 Token 且无高层决策意义的工具输出,仅保留能够反映智能体思维链条的关键动作元数据,包括执行的明确命令、操作的目标路径、核心警告与报错信息,以及智能体内部的显式推理块(Reasoning Blocks)。这种处理在极大降低计算开销的同时,完整保留了动作的因果时序。
在获得高信息密度的轨迹后,演化智能体(Update Agent)会执行多层次的故障诊断,将失败根因精确定位为三类核心缺陷之一:
-
导航失败(Navigation Failure):在上下文探索阶段策略失当,未能锁定关键代码;
-
推理失败(Reasoning Failure):检索到了正确上下文,但对代码语义与依赖理解错误;
-
执行失败(Execution Failure):推理结论正确,但在编写测试用例或调用具体工具时存在行为偏差。

为了消除自然语言提示词在后续系统解析中的模糊性,GSE 设计了一套专用的领域特定语言(Domain-Specific Language, DSL)来规范演化提案的表达。如上图所示,一个标准的演化提案必须严格声明目标技能标识符、具体的编辑操作(例如更新指令内容)、触发此次变更的理论依据(Rationale)、更新后预期的行为表现,以及最关键的——该技能与图中其他技能关系的变化。这一设计为后续的自动化图操作和严格验证筑牢了确定性基石。
技能关系图(SRG):让技能作为网络协同演化
为了彻底打破技能孤岛状态,GSE 提出了其最具辨识度的核心结构:技能关系图(Skill Relation Graph, SRG)。在 GSE 中,技能库被建模为一个有向图 $G=(V, E)$,其中节点 $v \in V$ 代表具体的技能本体,边 $e = (v_i, v_j, r) \in E$ 则显式刻画了技能间的语义交互类型 $r \in \mathcal{R}$。在 GSE 的语义定义中,边关系主要涵盖三类:
-
依赖关系(Dependency):技能 $v_j$ 的执行依赖于技能 $v_i$ 所输出的前置状态或环境假设;
-
共用关系(Co-usage):在解决某类特定复合问题时,两项技能经常需要协同搭配使用;
-
冲突关系(Conflict):两项技能在行为策略或上下文假设上存在互斥,不能在同一执行流中被同时激活。
在这一拓扑网络的支持下,技能演化不再是对单个文本块的孤立修改,而变成了节点与边的主动协同更新。当演化智能体针对某一节点提出修改提案时,系统会依托 SRG 进行关联推理:该修改是否会动摇下游依赖节点的输入假设?是否会导致原本协同工作的节点产生语义分歧?如果检测到潜在不一致,GSE 会自动触发生成针对相关技能的辅助演化提案(Auxiliary Evolution Proposals),将影响沿关系链传递并完成联合调优,从而确保整个技能库在演进中始终维持内在的逻辑自洽。
聚类整合与回放验证:阻断过拟合与退化的防火墙
即使单次提出的演化提案能够帮助智能体在当前出错的用例上成功重跑(即通过了本地局部验证),它依然有可能是高度过拟合的产物。为了提炼出真正具备跨项目可复用价值的高阶能力,GSE 提出了两阶段的技能泛化策略:基于聚类的技能整合与回放驱动的全局验证。
在技能整合阶段,GSE 将所有通过局部有效性验证的演化提案归拢并执行针对性聚类。对于修改现有技能的提案,系统以其在 SRG 中受影响的技能节点集合为聚类主键,其背后的直觉在于:需要调整同一批技能的多个失败案例,往往映射出了完全一致的能力短板;而对于新增技能提案,由于图中尚无对应节点,系统则通过计算其在 DSL 中声明的演化意图(Rationale)与预期行为效应的语义相似度来进行聚类。完成聚类后,专门的合并智能体(Merge Agent)会对同一簇内的提案进行跨用例抽象,剥离掉特定工程路径、类名或临时变量等特定细节,消除冲突与重复指令,沉淀出抽象级别更高、指导意图更纯粹的高阶技能节点,进而形成一个候选技能库(Candidate Skill Bank)。
然而,高阶抽象必须经受实证检验。GSE 设计了严密的回放驱动验证机制,坚决防范行为回退。对于涉及修改老旧技能的候选技能库,系统会精确检索并回溯所有在历史上曾经激活过这些老旧技能的历史用例;对于新增技能,则收集所有促成该聚类的触发用例。候选技能库必须挂载至真实的基座智能体上,对这些回放测试集执行完整的重新判定。只有当候选技能库在所有回放用例上不仅没有导致原本成功的任务失败(无 Regression),并且维持或提升了整体指标时,该变更才会被正式合入生产技能库。这种机制如同一道坚实的过滤器,在将低质量、偶发性修改挡在门外的同时,确保存入系统的大脑始终呈现单调递增的通用能力。
严苛评测:开源 Java 基准与字节跳动工业实践
为了检验 GSE 提取能力的跨任务与跨环境通用性,研究团队选择了两项在能力维度上具有极强互补性的复杂软件工程任务:
-
缺陷触发测试生成(Bug-revealing Test Generation):要求智能体深入探索仓库,理解极其复杂的跨文件方法调用,并生成能够稳定复现真实 Bug 的测试代码。测试集基于 Multi-SWE-Bench 构建,严格筛选了 9 个活跃开源 Java 项目中的 108 个真实缺陷方法,平均每个方法包含 6 个分支与 8 个直接被调用方法,复杂性极高。
-
Bug 报告虚警过滤(False-positive Bug Report Filtering):要求智能体审核代码审查工具给出的缺陷报告,鉴别其是真缺陷还是由于防御性编码、环境特殊约定导致的误报。该数据集由团队与字节跳动深度合作构建,名为 IndustrialBugs,全部取自 8 个内部微服务与核心业务 Go 语言生产代码库,包含 132 个已确认的真实缺陷与 368 个虚假告警。
评测采用严格的单项目留出交叉验证(One-Project-Held-Out Protocol):每次评估留出一个独立项目的用例作为测试集,其余项目的用例仅用于驱动技能演化,确保评估完全考察跨项目的泛化性能。基座智能体选用了开源界公认处于第一梯队的 OpenHands 与 mini-SWE-agent,底层统一接入 DeepSeek-V4-Flash 模型,并与五种配置展开全面横向对比:原生智能体(Vanilla)、人工专家手写技能(Human Skills)、Live-SWE-agent 以及 Trace2Skill。
在 Multi-SWE-Bench 的 Java 测试生成任务中,评测结果展现出压倒性的优势:
-
相比基座系统及现有演化方案,GSE 在精确率(Precision)上实现了 6.1% 至 34.1% 的提升;
-
在更具挑战性的召回率(Recall)维度,GSE 取得了极其震撼的跃迁,提升幅度在 31.8% 至 180.0% 之间。传统方法由于生成的规则碎片化、易互相干扰,智能体在面对未知复杂项目时往往畏手畏脚或逻辑冲突,无法击中真正的缺陷触发点;而 GSE 沉淀出的高阶导航与断言约束技能,使得智能体触发深层 Bug 的能力呈现跨越式增强。
在字节跳动 IndustrialBugs 工业级 Go 代码审查任务中,GSE 同样确立了显著的性能壁垒:
-
精确率相对既有基线实现了 15.4% 至 96.4% 的巨大飞跃;
-
召回率提升达 13.1% 至 19.8%;
-
当部署在字节跳动内部研发的生产级 Industrial Agent 上时,GSE 驱动演化出的技能库直接带来了 61.4% 的综合 F1 分数暴涨。这一工业落地数据充分证明,GSE 提取出的并不是仅能在实验室封闭环境中运行的“纸面技能”,而是能够精准识别防御性编码约定、服务间 RPC 契约等真实工业语义的通用软件工程能力。
后续的消融实验(Ablation Study)进一步定量剖析了各模块的贡献度:当剥离技能关系图(SRG)后,系统的整体 F1 明显受挫,验证了技能协同演化在维护库内逻辑一致性上的不可替代性;而当停用基于聚类和回放的泛化机制时,测试集上的召回率发生大幅跳水,确凿证实了直接合并单点提案会迅速滑向“过拟合深渊”。
从经验堆叠到系统架构:代码智能体自进化的未来形态
长期以来,关于大模型如何自主积累技能的讨论,往往容易陷入一种浪漫主义的误区——认为只要赋予大模型反思能力,将反思后的自然语言段落一股脑存入向量数据库(Vector DB),依靠 RAG 进行检索调用,就能实现 Agent 的“终身学习”。
GSE 的成功给出了一记清醒的技术警示:缺乏结构约束的自然语言技能,随着规模的膨胀,必然退化为互相倾轧的噪声。在软件工程这种对精确性、前置假设与上下文极其敏感的确定性领域,智能体的经验积累绝不能是无序的文本堆叠,而必须以严格的软件工程思想来治理。GSE 将演化目标从离散的“知识点”升级为包含显式依赖、冲突判定的“网络图谱”,并引入聚类抽象和严酷的回归回放,本质上是在 Agent 的技能库中建立了一套类似于现代软件工程的“持续集成与持续交付”(CI/CD)体系。
这项由天大、清华与产业界共同完成的研究表明,自主进化 Coding Agent 的下半场,拼的不再是单纯的 Prompt 技巧,而是对智能体认知结构与演化生命周期的系统级工程构建。随着 GSE 范式在更广泛代码基准与工业场景中的落地,具备自我演进、永不回退特性的真正自主软件工程师,正在距离现实越来越近。