SkillEvo:多轮交互反馈驱动Agent技能进化,解决率提升51.8点
SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback

在企业级智能体(Agent)的实际落地中,决定业务成败的关键往往不是底座模型本身的推理参数有多大,而是注入到智能体内部的领域技能(Skills)。这些 Skill 以模块化、结构化的文本或代码形式,封装了垂直领域的专有知识、业务排障流程和工具调用规范。然而,当前业界对 Skill 的维护却陷入了极具讽刺意味的断层:一方面,初始的 Skill 大多依赖人工专家耗时费力地撰写,或依赖大模型进行单次生成;另一方面,当智能体在真实交互中产生差错时,系统缺乏自动化闭环,无法将这些交互失败转化为可复用的知识。
ArXiv URL:https://arxiv.org/abs/2608.13120v1
现有少数尝试闭环优化的方案,几乎全部受限在“单轮问答(Single-Turn QA)”或无评估的“自我反思(Self-Reflection)”范式中。这种做法带来了一个致命的不对称性:第一轮迭代往往能修补单次交互中暴露出的显性漏洞,但随后进化的“梯度”便迅速衰减;那些隐藏在多轮追问、复杂澄清与逐步排障中的深层缺陷,由于前期步骤被阻断而根本无法曝光,导致系统进化迅速触顶停滞。更严重的是,现有的版本治理通常依赖单一的标量通过率门控(Scalar Gate),它只能被动地拒绝性能下滑的版本,却既不能定位、也无法修复多轮修改引入的知识膨胀与结构破坏。
针对这一系列落地痛点,腾讯云与浙江大学的研究团队提出了名为 SkillEvo 的智能体技能自进化框架。研究的核心判断在于:制约技能持续自进化的瓶颈,从来不是大语言模型的文本重写能力,也不是迭代轮数的多少,而是评估反馈机制能否持续提供可信的进化梯度。 SkillEvo 将多轮用户模拟从单纯的评测终点重构为反馈生成引擎,并配合主动修复图结构退化的独立治理层,在腾讯云涵盖 6 大类云服务、9 个生产 Skill 的真实失败工单集上,将任务解决率(TSR)从初始基线的 30.0% 提升到了 81.8%,不仅比自我反思方案高出 23.0 个百分点,也彻底甩开了基于单轮 QA 驱动的演化方案达 15.4 个百分点。
单轮评估的死胡同与“梯度消失”
为了理解为什么现有 Skill 自进化方案容易陷入僵局,必须回到人机多轮交互的本质动态中。当用户带着一个模糊或复杂的故障问题进入云服务客服场景时,极少能在第一句话里就提供完整的信息。工程师面对真实工单时,必然经历“收集现象—排查配置—索取日志—验证猜测—给出方案”的多轮递进过程。
以往基于单轮 QA 或静态测试集的评估范式,本质上是把整个复杂场景压缩成一个单一输入和单一标准答案。当智能体针对该轮次进行自我反思或受控重写时,一旦修补了表面上的表述缺失,测试集指标就会立刻拉满。然而,这只是在表面掩盖了问题。
在真实的多轮对抗中,缺陷是“层级化”存在的。如果智能体在第一步分类时就给出了错误的排查方向,后续所有的深层知识盲区就全部被掩盖在这场失败之后。换言之,浅层的交互失败阻断了对话向纵深发展。如果只靠单轮评估,系统永远无法看到第 3 轮、第 5 轮才可能遭遇的流程分支断裂。这就造成了进化的“梯度消失”:修好第一层后,系统以为自己已经完善,演化曲线随之在第 2 轮左右彻底饱和。
要让进化梯度持续更新(Self-Renewing),评估系统必须允许智能体在修补好第一层缺陷后,对话能够走得更远,从而在更深层暴露出此前不可见的缺陷。但随之而来的新挑战是:多轮模拟用户本身也是由大模型驱动的,如果模拟器本身在胡言乱语、脱离用户原意,这种反馈就会变成毒化技能的噪声;而在连续数轮的多轮修改后,文本格式的 Skill 会不可避免地出现重复累赘、内部引用断裂和自相矛盾。SkillEvo 的技术设计正是针对这两大难题分别立论。
可信反馈:把多轮交互重塑为梯度的发电机
SkillEvo 首先对“什么是可信的反馈信号(Trustworthy Feedback)”确立了三个严格的数学与逻辑约束:覆盖性(Coverage)、准确性(Accuracy)和可归因性(Attributability)。只有同时满足这三点,生成的调整梯度才不会将 Skill 带偏。
为了满足覆盖性,框架构建了基于意图状态机(Intent State Machine)的用户模拟重构机制。在处理人工坐席的历史工单痕迹时,系统提炼出真实用户在这个问题下的完整意图集合与优先级约束。在随后的模拟交互中,意图状态机严格监控每一个意图是否被真实提出、以及该意图是否得到了智能体的实质性回应。只有当所有预设的关键意图全部得到实质处理时,模拟器才被允许正常终止;若智能体反复陷入死循环或顾左右而言他,状态机则强制触发放弃型终止。这一状态机设计彻底杜绝了模型在模拟用户时常见的提前退场或无休止闲聊,确保测试用例能够把智能体压榨到极限。
有了完整的交互轨迹,下一步是如何保证评估的准确性。以往研究直接对整段多轮对话打分,一旦得分低,就默认为是智能体技能不好。SkillEvo 认为这种归因存在逻辑漏洞:对话搞砸了,完全有可能是模拟器偏离了业务轨道,提出了不符合真实业务逻辑的无理要求。因此,框架提出了双侧正交评估(Dual-Sided Orthogonal Evaluation)。
在评估阶段,系统将用户模拟器一侧与客服智能体一侧的责任进行数学解耦。系统首先独立审查模拟器是否保真地还原了人类工单中的核心意图;只有在模拟器合格的前提下,才对智能体暴露出的意图处理能力进行评分:
\[s_{C}=h\cdot\frac{\sum_{i}w_{i}\,a_{i}}{\sum_{i}w_{i}},\quad w_{i}=\begin{cases}\alpha,&\text{priority}_{i}=\text{key}\\ 1-\alpha,&\text{priority}_{i}=\text{minor}\end{cases}\]其中 $h$ 为硬性惩罚因子,$a_i$ 为智能体在第 $i$ 个意图上的动作得分,$w_i$ 则根据意图属于核心(key)还是次要(minor)进行权重分配。值得注意的是,$s_C$ 约束的是已暴露意图的微观准确度,而非单纯的端到端成功率。微观上的失分点,恰恰就是后续进化梯度的精确输入源。
最后,在可归因性上,低分并不必然意味着 Skill 本身缺少知识。在复杂的云上排障中,失败可能来自网关权限不足、外部 API 超时,或者单纯是评估器本身的假阴性噪声。SkillEvo 引入了集体归因(Collective Attribution)模块,将所有评测失败严格划分为三类:
-
知识缺陷(Knowledge Gap):人类工程师参考方案中存在稳定的业务事实,但智能体遗漏或回答错误;
-
能力边界(Capability Limit):涉及未授权权限、工具接口缺失或底层云基础设施故障;
-
评估噪声(Evaluation Noise):由于场景构建失真或裁判模型误判导致的错误。
只有被裁定为“知识缺陷”的样本,才会被允许投射进反馈流中。更关键的是,如果同一次迭代中有 10 个测试用例都遭遇了失败,且全部指向某个 API 参数说明的缺失,SkillEvo 不会粗暴地把 10 条报错日志拼接到 Prompt 里让模型改写,而是通过语义相似度将其做全局聚合(Merge),提炼出跨样本的共性知识缺口。这种设计消除了针对个案特征的过拟合,保证了输入给编辑器的演化梯度具备高度的通用性。
可控治理:图结构知识系统的主动修复
如果仅仅拥有高质量的反馈梯度,在经历三到四轮迭代后,Skill 依然会崩溃。这是因为自然语言编写的业务 Skill 本质上并不是散装文本,而是一个结构化的知识系统(Structured Knowledge System)。在这个系统内,分流路由节点(Routing Nodes)引导智能体判断问题类型,进而跳转到具体的知识节点(Knowledge Nodes),知识节点之间又包含复杂的 cross-reference 交叉引用。
现有的迭代框架往往只依赖一个标量阈值(如总体准确率必须提升)来做门控。当大模型为了迎合当前轮次的失败用例而随意添加段落时,往往会引发严重的隐性退化:为了补上新知识而删掉了旧的稳定规则;为了解释特殊情况而把特定场景的例外升格为通用规则;或者破坏了路由逻辑的 Markdown 锚点链接。这种退化在早期的标量得分上可能看不出来,但随着轮次推进,整个 Skill 的组织结构会彻底腐化。
SkillEvo 放弃了被动的标量拦截,转而引入了一个具备主动干预能力的独立治理层,将治理拆分为“硬约束”与“软约束”两道屏障。
硬约束对应的是事实一致性(Fact Consistency),其核心法则是:任何更新后的技能 $S_t$,必须完全保留生产基准版本 $S_0$ 中经过验证的稳定业务事实,即 $\operatorname{Facts}(S_t) \supseteq \operatorname{Facts}(S_0) \cap \mathcal{S}_{\text{stable}}$。为了精准定位破坏源,SkillEvo 设计了双锚点机制(Dual Anchors):
-
以初始版本 $S_0$ 为全局锚点,比对 $S_0 \to S_t$ 的差异,专门检测在漫长演变中被模型无意删减的历史核心事实;
-
以上一轮版本 $S_{t-1}$ 为局部锚点,比对 $S_{t-1} \to S_t$ 的修改,专门捕获当前轮次模型“自作聪明”编造出来的流程错误。
传统的单一锚点无法区分事实丢失究竟是累积引入的还是当轮发生的,往往导致模型在修复时来回推翻。一旦双锚点检查器发现事实违规,系统会直接打回该候选版本,并根据差异代码行给出精确的修复指令:强制恢复被删事实,同时禁止回退本轮新增的有效知识。
软约束则对应结构一致性(Structural Consistency),重点监控并治理三类隐性病态:
-
知识膨胀(Knowledge Bloat):模型在扩写时产生大量废话和重复模板,导致 Token 暴增;
-
引用断裂(Reference Breakage):修改了节点小标题后,前面的分支判断依然指向旧路径,导致逻辑迷航;
-
事实过度泛化(Factual Over-generalization):把针对某个特殊客户配置的临时补救措施,写成了该产品所有用户的通用前置条件。
治理层通过图结构诊断识别出这些结构损伤后,不会直接粗暴拒绝版本,而是将这些结构修复建议打包成“治理工单”,在下一轮迭代中与“集体归因”生成的业务知识缺口合并,一同输入给优化器。这种“边打补丁、边做代码重构”的双重推进模式,使得 Skill 的组织骨架在经历多轮高强度重写后依然保持整洁。
生产实证:从 30% 到 81.8% 的非线跃迁
SkillEvo 的实验不是在合成数据集上做的玩具评测,而是直接依托于腾讯云真实生产运维支持场景。该场景涵盖了云主机、数据库、对象存储、网络配置等 6 大核心领域,抽取了 9 个由资深专家维护的生产级 Skill 文件以及 98 个底层参考手册。所有参与评估的工单,全都是在真实生产环境中触发了“流转到人工工程师”的疑难杂症——其中约 40% 在对话开头就因智能体无法识别而转人工,约 60% 则是经历了多轮排查未果后升级。这意味着,这份测试集是一套纯粹由真实用户在生产环境中砸出来的“缺陷集合”。
研究团队将工单按时间顺序划分为开发集与严格隔离的评测集,所有演化闭环只接触开发集,最终结果在评测集上盲测。实验对比了三套技术路径在连续四轮演化下的表现:
| 演化轮次 | 原始基准 ($S_0$) | 自我反思 (Self-Reflection) | 单轮 QA 驱动演化 | SkillEvo (多轮交互驱动) |
|---|---|---|---|---|
| Round 0 | 30.0% | 30.0% | 30.0% | 30.0% |
| Round 1 | - | 45.1% | 52.8% | 59.4% |
| Round 2 | - | 53.4% | 63.2% | 71.0% |
| Round 3 | - | 56.7% | 65.5% | 77.2% |
| Round 4 | - | 58.8% | 66.4% | 81.8% |
数据清晰地揭示了不同演化范式的上限差异。传统的自我反思方法由于缺少外部真实交互的碰撞,演化过程极易自说自话,在第 4 轮后仅仅录得 58.8% 的任务解决率。单轮 QA 驱动的演化表现出前述的典型特征:在第 1、2 轮修补表面缺陷时解决率增长较快,但从第 2 轮(63.2%)到第 4 轮(66.4%)增长几乎停滞,两条曲线过早地进入了水平饱和期。
反观 SkillEvo,在多轮交互反馈的牵引下,任务解决率从初始的 30.0% 连续破局,以稳定的增量一路攀升至 81.8%。不仅相比原始 baseline 净增 51.8 个百分点,也高出单轮演化范式 15.4 个百分点。这一跨越正是“梯度的自更新性”发挥了威力:当第 1 轮把浅层知识补齐后,第 2 轮的模拟用户得以顺利跨越前置阶段,将对话推入第 3 轮甚至第 5 轮,从而把埋藏在深层的边缘配置缺失直接撕开给归因模块。
为了解构各组件的实际贡献,消融实验提供了更具深度的剖析:
| 实验变体配置 | 最终任务解决率 (TSR, %) | 相比完整方案的变动 |
|---|---|---|
| SkillEvo 完整框架 | 81.8 | - |
| (a) 移除多轮交互反馈(退化为单轮 QA 驱动) | 66.4 | -15.4 |
| (b) 移除图结构治理层(保留多轮反馈但无主动治理) | 78.6 | -3.2 |
| (c) 移除归因分类器(不对失败原因做三分类过滤) | 73.1 | -8.7 |
消融结果表明,性能断崖的最大成因依然是反馈源的模态。一旦失去多轮交互生成梯度的机制,即便后续的治理层再严密,模型也会因缺乏深层信号而直接损失 15.4 个百分点的解决率;而若不进行归因过滤,将基础设施抖动或评估噪声混入知识更新,性能同样会折损 8.7 个百分点。
那么,治理层的作用是否被低估了?答案是否定的。治理层的核心价值不在于短期内拔高多少跑分,而在于遏制多轮修改过程中的结构性退化。实验对跨轮回归率(RegR,即原本能解决的题目因为修改而变得无法解决的比例)和文本膨胀率(Bloat)进行了精细统计:
在缺乏治理层干预的情况下,Skill 在经历 4 轮演变后,其总体代码行数暴涨了 16.2%,充斥着大量的陈述冗余和断裂的索引标记;而在 SkillEvo 的图结构治理下,全流程的累计文本膨胀率被死死压制在 2.8%,且在第 1 轮知识框架补齐后便不再增加。在近乎不增加文本冗余的前提下换取 51.8 点的准确率跃升,足以证明其能力的进化源于对知识图谱的高质量修正,而非漫无目的的文本堆砌。与此同时,治理层使得跨轮回归率从早期的波动逐步收敛递减,验证了双锚点硬约束在守住业务底线上的不可替代性。
从模型微调到外置技能库的认知重构
长期以来,业界在探索智能体能力的自我提升时,存在一种深层的路径依赖——即倾向于依赖强化学习(RL)或者持续微调(Continual Fine-Tuning)去直接修改大语言模型的底层权重。类似 SEAD 等工作便是在多轮对话场景下尝试通过 PPO 等算法更新模型参数。
然而,在严肃的企业级场景中,频繁重训或微调底座模型是一件极其危险且成本高昂的事情。它不仅伴随着灾难性遗忘的风险,更致命的是黑盒模型的不可控性:人类工程师无法向客户保证,微调后的模型昨天修好的云服务器退款规则,今天会不会在另一个提问方式下失效。
SkillEvo 所展现的范式,是将智能体的核心决策知识外置为显式的、可解释、可版本控制的结构化 Skill 模块。在这个范式下,大语言模型扮演的是稳定的推理机和工具执行器,而业务知识的沉淀、演化与修剪,则完全在一个透明的外部文本图谱中完成。每一次改动的 Diff,人类工程师都可以逐行审查;每一条新增规则,都可以追溯到真实工单中哪一次归因出的 Knowledge Gap。
在企业部署落地中,SkillEvo 明确坚持“Human-in-the-loop”的防线:自进化循环的终点并非无人值守的自动化线上发布,而是将生成的高质量候选版本及对应的演化归因链路提交给业务专家。正是事实一致性的硬约束与专家的最终确认机制,使得自动吸收失败经验、演化技能知识库在严苛的企业级 IT 运维体系中真正具备了工程可行性。
大模型 Agent 从“被动接受规则”走向“通过交互试错自主进化”,是迈向完全自主系统的必由之路。SkillEvo 用极具说服力的生产环境数据证明了:决定这一进化旅程能否走通的关键,不在于模型是不是足够会“改写”,而在于评估系统是否能穿透单轮表象、持续挖掘出可信的梯度,以及是否有足够坚韧的治理框架去守护知识本身的结构秩序。