WML:从粗暴重写到精准归因,Agent技能优化突破90%准确率
Workflow-Localized Mechanism Learning: Attribution-Guided Repair and Knowledge Reuse for Structured Agent Skills
在面向复杂任务构建大模型智能体(LLM Agent)时,业界正逐渐形成一个共识:决定智能体任务能力的,绝不仅仅是基础模型的参数权重,也不只是单次输入的 Prompt,而是那些被封装起来的可复用过程性知识(Procedural Knowledge)。诸如工具调用规范、任务约束、容错回退机制与后验验证规则,正在被系统性地打包为外置的“Agent 技能”(Agent Skills)。然而,当智能体在多步执行中遭遇失败时,如何自动优化并修复这些技能文件,一直是困扰社区的棘手难题。
ArXiv URL:https://arxiv.org/abs/2607.20999
现有的技能优化器往往陷入一种粗放的调试困境。即便前沿方案如 SkillGrad 引入了层级感知补丁,知道该去修改包的哪一层,但面对复杂工作流内部的具体故障,依然束手无策。一个环节的报错可能涉及语义解析、目标绑定、算子调度或状态提交等多个逻辑机制,传统优化器无法精准定位是哪一个具体机制失效,更无法理清多个机制之间的协作冲突。结果,微小的局部执行偏差常常诱发大模型去全盘重写技能,或者在全局工作流中塞满僵硬的特异性规则,导致原本通用的技能体系迅速膨胀并退化。
针对这一根本瓶颈,这项最新研究提出了工作流局部机制学习(Workflow-Localized Mechanism Learning,简称 WML)。该框架告别了将技能当成整块文本或黑盒代码的盲目修改方式,核心创新在于建立了“节点-机制归因”(Node–Mechanism Attribution)体系与六模块闭环的 WGSO 优化机制。在权威的电子表格智能体基准 SpreadsheetBench 上,WML 驱动 DeepSeek 取得了 $90.33\pm 1.53\%$ 的 Hard Accuracy(任务级严格准确率),在 Qwen3.6-Flash 上达到 $74.67\pm 3.51\%$;无需任何额外训练,优化后的技能跨基准迁移至 WikiTableQuestions,仍能分别保持 $84.00\%$ 和 $83.00\%$ 的高准确率。更重要的是,在统一的编译器评测集 Compiler-Supported50 上,WML 产出的技能展现出了极高的结构规范性,不仅 Hard PASS 任务量大幅领先基线 17 个,更实现了全场最低的单任务成功开销。
痛点根源:为什么技能修复不能只看“层级”?
要理解 WML 为什么有效,必须先厘清结构化 Agent 技能的运行机理。现代 Agent 框架普遍采用渐进式披露(Progressive Disclosure)的组织形态,将技能划分为三个层级:L1 负责最顶层的触发条件与意图路由;L2 是主干工作流协议,定义状态转移、算子调度与流程组合;L3 则是底层的专用资源与具体算子实现,包含针对特定任务的细粒度操作手册、参数契约与局部验证逻辑。
以往类似 TextGrad、SkillOpt 或 SkillGrad 的方法,尝试借助执行轨迹语言反馈对这些文本构件进行梯度式更新。但这种优化思路在工作流内部存在严重的“目标歧义”。假设智能体在“状态提交(State Commit)”这一工作流节点连续发生两次失败。在情况 A 中,智能体已经顺利获取了上下文、绑定了目标单元格,并正确完成了运算,仅仅因为输出了被当前格式契约禁止的中间表示而崩溃;而在情况 B 中,数据序列化、提交次序、故障恢复以及提交后验证规则各自都完好无损,偏偏它们之间的协作顺序错乱,导致事务回滚失效。
如果优化器只具备粗粒度的“层级感知”,它就无法辨别这两种性质截然不同的错误。在情况 A 中,病灶仅仅是单个输出契约机制缺少对应规则,最小有效修复靶点应精确指向该机制对应的 L3 局部资源文件;而在情况 B 中,底层各个算子本身没有问题,盲目扩充任何一个 L3 资源不仅治标不治本,反而会带来冗余,此时最小修复靶点必须路由至 L2 组合协议,修改机制之间的协调逻辑。正因为缺乏对工作流节点与内部机制关系的解构能力,现有优化器很容易出现“过度治疗”,将一次窄视角的局部报错演变为技能文件的大面积改写。
此外,社区中沉淀的大量第三方开源技能本应成为重要的先验经验库,但以往方案多是将检索到的整篇第三方技能生硬拼接到 Prompt 中,由于上下文环境、依赖假设和触发作用域各异,往往引入巨大的噪声干扰。第三方经验的复用,本质上也必须是一次严格受控的局部手术。
节点-机制归因:解构故障的“最小手术切口”
为了从根源上消除上述目标歧义,WML 提出了系统化的节点-机制归因(Node–Mechanism Attribution)机制。它在逻辑上将各种工具型智能体的执行过程抽象为六个通用的领域无关功能节点:上下文获取(Context Acquisition)、目标绑定(Target Binding)、算子选择(Operation Selection)、执行与转换(Execution/Transformation)、状态提交(State Commit)以及验证与终止(Verification/Termination)。这六大节点覆盖了工具驱动任务的全生命周期。
每当智能体在批量测试任务中暴露缺陷,诊断模块不再泛泛给出文本层面的批评,而是严格生成一个结构化的归因四元组:
\[A_{t,i}=(n_{t,i}, \Gamma_{t,i}, \rho_{t,i}, \tau_{t,i})\]其中 $n_{t,i}$ 精确锁定上述六个功能节点之一;$\Gamma_{t,i}$ 标记出引发缺陷的一个或多个可复用机制集合;$\rho_{t,i}$ 判定缺陷的交互类型;$\tau_{t,i}$ 则解析出最终获准修改的最小有效文件地址。系统在这里确立了一套强类型的路由契约:
当缺陷被判定为单一指导缺失(Single-Guidance, $\rho=\text{SG}$)时,意味着问题局限在单一机制内部($\lvert \Gamma \rvert=1$),优化器严禁触碰主干协议,修改地址 $\tau$ 必须严格限制在承载该机制的 L3 独立资源文件中,仅允许收紧其决策分支、边界定义或验证前置条件。
当缺陷被判定为跨机制关系缺陷(Multi-Relation, $\rho=\text{MR}$)时,意味着涉及两个及以上机制之间的协同失控($\vert{}\Gamma\vert{}\ge 2$),优化器则直接绕过底层具体实现,将修改地址 $\tau$ 锁定在 L2 组合协议中,仅针对机制间的调用顺序、作用域冲突处理或联合验证逻辑进行编排修正,严禁拷贝或合并底层的具体操作流程。
更关键的是,这一归因过程不是大模型不可控的自由发挥。每次归因都必须绑定执行轨迹中的切片依据以及“保持性约束”(Preservation Constraints),即明确指出哪些历史成功逻辑绝对不能被破坏。当多个候选诊断发生冲突、或者缺乏足够证据支持唯一定位时,归因解析器会主动放弃更新(Abstain)。这种高门槛的防御性设计,彻底阻止了优化器在证据模糊时产生“幻觉修改”。
WGSO 优化闭环:局部补丁与双重记忆机制
在归因四元组的指导下,WML 进一步构建了完整的六模块优化闭环——工作流引导的技能优化(Workflow-Guided Skill Optimization,简称 WGSO)。整个系统的运行逻辑如下图所示:
![]()
WGSO 的执行路径展现出了极强的工程严谨性。它并不在每次出错时都向外部发起知识检索,而是建立了一个审慎的阶梯判断策略:
首先,系统检索当前技能文件与本地记忆;只有当现有规则确实缺乏对应覆盖时,才激活第三方技能库的按需检索。
其次,对于第三方技能,系统在预处理阶段就将其碎片化为具备溯源与作用域标签的规范记录元组,包含适用场景、机制定位与前置依赖。检索模块只抓取与当前归因节点高度重合的知识碎片,由补丁生成器针对目标地址打上有界补丁(Bounded Patches)。第三方技能的内容绝对不允许被整段原样复制进生产技能中,杜绝了上下文污染。
在补丁生成之后,WGSO 设立了双重验证门控机制(EvaluateGate)。第一道门槛是静态语法与契约校验,凡是不完整、格式破坏或改动范围溢出指定地址 $\tau$ 的候选补丁,一律直接抛弃;第二道门槛是动态回放评测,候选技能会在相同的任务批次上重新执行,只有当任务级与细粒度指标实现真正收益,且没有触发回归错误时,补丁才会被正式提交部署。一旦发现性能倒退,系统立即执行毫秒级回滚。
在这个过程中,系统的演进经验被沉淀到优化器侧的补丁策略记忆库(Patch-Strategy Memory, PSM)中。这里体现出作者对智能体架构的一项深刻思考:执行器与优化器必须彻底解耦。
运行时的智能体只需要纯净的技能定义,绝不能承担优化过程中的试错包袱。因此,PSM 连同所有第三方原始记录被牢牢隔离在优化器内部。PSM 专门按照归因特征对历史成功的修改手法进行归纳索引,记录在特定节点、特定机制冲突下,哪种修改范围、哪些保持性约束能够真正通过后验评估。当下一次面对类似的局部缺陷时,PSM 便会先验性地为补丁生成器提供策略指导,形成越修越准的正向循环。
严谨评测:跨模型基准提升与零训练迁移能力
为了检验 WML 的真实威力,研究团队在标准数据集 SpreadsheetBench 以及用于零额外训练迁移测试的 WikiTableQuestions 上展开了系统评测。实验选取了推理表现优异的 DeepSeek-chat(关闭思考模式以保持统一执行协议)和极具成本效益的轻量端侧模型 Qwen3.6-Flash 作为基础骨干,对比了无技能、种子技能、官方版 SkillGrad、SkillOpt 以及 EvoSkill 等一系列代表性方法。所有基于优化的基准方法都严格使用相同规模的训练数据、完全一致的测试集与评测沙箱。
在电子表格核心操作基准 SpreadsheetBench 上,评测不仅统计单元格级别的平均精度,更以苛刻的 Hard Accuracy(要求整个工作簿中所有目标单元格完全正确)作为核心指标。实验数据显示,在以 DeepSeek 为基座时,WML 的 Hard Accuracy 一举冲上 $90.33\pm 1.53\%$,相比原始无技能状态提升了 8 个百分点以上,相较于此前表现最出色的官方版 SkillGrad($82.00\pm 1.00\%$)更是实现了 8.33 个百分点的绝对领先。而在轻量级的 Qwen3.6-Flash 上,WML 的优势更加凸显,Hard Accuracy 从基线的 $55.33\%$ 飙升至 $74.67\pm 3.51\%$,直接拉开了近 20 个百分点的差距。
更具说服力的是跨任务形态的无缝迁移测试。研究团队直接将面向电子表格优化得到的最终技能,在不施加任何追加训练或调优的前提下,部署至 WikiTableQuestions 表格问答基准中。结果表明,基于 DeepSeek 的 WML 技能获得了 $84.00\pm 2.00\%$ 的最终答案准确率,不仅领跑所有基准方案,而且在 Qwen 架构上也拿下了 $83.00\pm 2.00\%$ 的高分。这有力地证实,WML 淬炼出的是结构高度健康、逻辑高度普适的过程性规则,而非仅仅对某些特定工作簿过拟合的补丁堆砌。
为了严谨探究各功能模块的具体贡献,论文在 SpreadsheetBench 上跨越 42、123、456 三个独立随机种子进行了严格的组件消融实验,结果呈现出高度一致的性能下陷规律:
-
完整版 WML:在三个种子上稳定跑出了 $90.00\pm 1.00\%$ 的平均 Hard Accuracy 以及 $95.78\%$ 的单元格准确率。
-
剔除节点-机制归因(No Attribution):整体 Hard Accuracy 瞬间回落至 $84.67\pm 0.58\%$,跌幅达 5.33 个百分点;更为关键的是,单元格准确率遭遇了全场最大的滑坡(下滑 7.89 个百分点),且在优化循环中频繁引发修补重试。这表明一旦失去精确定位,优化器就极易陷入“盲人摸象”,导致修复行为对现有正确逻辑产生严重扰动。
-
剔除过程知识增强(No Knowledge Enh.):单纯依靠大模型在无外部补充的情况下自省修补,Hard Accuracy 同样跌落 5.33 个百分点,充分印证了对第三方知识进行溯源受控复用的必要性。
-
剔除补丁策略元策略(No Meta-Policy / PSM):失去历史成功策略引导的优化器,Hard Accuracy 也下降了 3.33 个百分点,印证了经验记忆对持续优化效率的护航价值。
走向工程落地:从“自由漫游”到“编译执行”的架构跃迁
除了单纯刷高评测榜单的分数,该论文最值得工程界深思的突破,在于它探索了 Agent 技能与现代工作流编译器之间的交互范式。
以往许多 Agent 框架在实际落地时饱受诟病,核心原因在于高昂的模型调用成本和不可控的自由代码执行。为了验证结构化技能在生产环境中的工程转化潜力,作者设立了 Compiler-Supported50 测试环境,引入一个共享的 LLM 工作流编译器作为统一的下游消费者。编译器直接读取最终生成的技能文件,统一生成严格类型化的工作流声明并编译为静态运行代码,剥离了所有特定平台的定制适配器。
在这个极其考验技能组织条理性的硬核考验中,WML 表现出对编译器非同寻常的友好度。相比其他竞品优化器生成的技能,WML 产出的技能结构边界极其清晰、机制依赖明确,使得工作流编译器能够毫无阻碍地将其降阶为确定性执行流。在 50 项任务中,WML 成功达成了最多的 Hard PASS 任务数,领先最强基线多达 17 项。
成功标准化成本(Success-Normalized Cost)指标进一步放大了这一优势。若将所有任务(包括失败重试任务)消耗的 Token 总量平摊到每一个成功任务上,WML 不仅在通过率上拔得头筹,更实现了全场最低的单任务 Token 消耗与模型请求数。相比于依赖 Agent 运行时反复进行开放式自主规划、试错代码生成的传统“自由漫游”模式(Direct SkillAgent),经由 WML 优化并经过编译器固化后的工作流,在保留了绝大部分任务成功率的同时,将执行阶段的模型交互调用量和 Token 消耗压缩了数倍。
这一发现为未来企业级智能体系统的分工演进勾勒出了极为清晰的蓝图:
我们应当把高昂的思考与探索成本前置,在离线阶段由优化器负责学习、归因并凝练出高质量的过程性技能;在部署阶段,交由工作流编译器将成熟技能快速编译成轻量、可审计、受沙箱权限严格约束的高效可执行代码。只有在遭遇完全超出当前技能边界的长尾异常时,系统才动态降级、回退到算力消耗较大的开放式 Agent 进行兜底介入,并将全新轨迹沉淀为新的修复证据。
从粗糙的全局改写,到精巧的“节点-机制”双轨手术;从杂乱的 Prompt 拼接到可溯源的局部复用与策略记忆,WML 用极具说服力的实验数据证明:大模型时代的智能体能力成长,并不一定要建立在不断扩充参数规模或无休止的随机采样之上。通过精细化的工程状态建模与工作流级局部归因,智能体不仅能够“吃一堑长一智”,更能将零散的踩坑经历,持续提炼为高度可靠、可编译且低成本交付的软件级资产。