SkillSV:用结构感知Shapley为Agent技能定价,实现无损安全剪枝
What Is a Skill Worth? Structure-Aware Shapley Valuation of Agent Skills

在大模型驱动的智能体(LLM Agent)开发中,自动化技能优化正在成为主流。借助 TextGrad、GEPA、SkillOpt 以及 Trace2Skill 等前沿优化框架,开发者可以让 Agent 在复杂任务中通过反思、自演化与试错循环,自动沉淀并迭代出一份长篇的技能文档(skill.md)。这类文档往往包含层级分明的 Markdown 章节、具体操作规则、提示词启发、辅助脚本甚至是少样本示例。优化器跑完后,整体跑分确实提升了,但随之而来的却是一个棘手的“黑盒”问题:这份动辄几千 Token 的技能文档里,究竟哪一句话真正起到了关键作用?哪一个代码块其实毫无贡献,甚至哪一行规则还在悄悄拖累性能?
ArXiv URL:https://arxiv.org/abs/2608.04562v1
直接套用传统机器学习的消融实验(Ablation)或经典数据定价方法,在面对 Agent 技能时往往会全面失效。因为技能文档不是一堆彼此独立的文本片段或离散样本,它具有严密的上下文依赖与层级结构。盲目删除其中一个子模块,往往会导致引用落空、符号未定义或语义断层,此时测得的性能暴跌反映的并不是该模块的真实价值,而是 Agent 对“残缺损坏文本”的抗挫能力。
为了解开这个黑盒,来自微软、南京航空航天大学、合肥大学与鹏城实验室的联合研究团队提出了 SkillSV(Structure-Aware Shapley Valuation)。该框架首次将结构感知引入博弈论中的 Shapley 值定价体系,把复杂的技能文档编译为受约束的合作博弈结构。SkillSV 能够在极其有限的调用预算下,精准剥离出每个技能单元的内容价值与长度成本,并准确复现技能整体的增益闭环。实验表明,依据其估值进行剪枝,可以在几乎不损失任务准确率的前提下,大幅消除自动化生成中的冗余内容。

为什么传统的消融与定价算法在此失效?
要对复杂系统的内部组件分配贡献,合作博弈论中的 Shapley(沙普利)值一直是最理想的理论工具。在经典定义中,集合 $N$ 中有 $n$ 个玩家,联盟 $S \subseteq N$ 的收益函数为 $V(S)$。玩家 $i$ 的 Shapley 值 $\phi_{i}$ 定义为:
\[\phi_{i} = \frac{1}{\lvert \Pi(N) \rvert}\sum_{\pi\in\Pi(N)}\big[V(S_{i}^{\pi}\cup\{i\})-V(S_{i}^{\pi})\big]\]它通过遍历所有可能的排列 $\pi \in \Pi(N)$,计算玩家 $i$ 在加入前驱集合 $S_{i}^{\pi}$ 时的边际增益(Marginal Contribution),从而在理论上满足效率性、对称性、线性与空玩家公理。近年来,这一思想已被广泛用于特征归因、训练数据定价以及 MoE 架构中的专家贡献评估。
然而,将这一公式直接迁移到 Agent 技能上,会遭遇两大核心瓶颈。
首先是结构反事实挑战(Structural Counterfactuals)。传统的 Shapley 计算假设玩家的任意子集 $S$ 都是合法有效的。但在 Agent 技能中,一个技能单元可能是一个 Python 工具函数、一段操作规则,或者是一个针对特定格式的说明。单元之间存在着强烈的语法与逻辑依赖关系:子标题依赖于父标题,步骤 $B$ 明确引用了步骤 $A$ 中定义的变量,辅助代码块必须由前面的指令来调用。如果像传统方法那样随机抽取子集或简单地执行“留一法”(Leave-One-Out, LOO),剥离某一行前置定义,下游的单元就会变成悬空引用(Dangling Reference)。此时 Agent 看到的只是一份语句不通、格式破碎的乱码式文档。这种粗暴评估混淆了“该单元的实际指引价值”与“系统因文档损坏而诱发的异常扰动”。
其次是带预算的评估与上下文成本混淆(Budgeted Rollout Estimation)。在数据定价中,评估一个子集只需要在前向推理或简易训练中打分;但要评估 Agent 技能的某一个反事实组合,必须将该组合动态渲染成真实的 Prompt,让被测大模型驱动的 Agent 跑完完整的多步交互轨迹(Rollout),再对最终结果进行核验打分。Agent 的单次运行成本极高,且任务难度本身的波动性往往掩盖了单个单元微弱的边际提升。更为隐蔽的是,每当直接物理删除一个单元时,Prompt 的长度同步缩短了。在上下文有限的大模型推理中,性能变化究竟是因为这个单元“内容有用”,还是仅仅因为“长文本压缩让模型注意力更集中”?扁平的消融方案完全无法解耦这两层效应。
SkillSV的核心机制:从文档编译到结构感知定价
面对这些矛盾,SkillSV 的核心突破在于:它不再把技能视作平面字符串,而是将其转化为一个受结构约束的合作博弈模型。整个系统通过编译、双算子解耦与链式采样三个阶段协同运转。
1. 确定性编译器:构建结构合法的博弈图
SkillSV 设计了一个无需模型介入的纯规则编译器 $\mathsf{C}$,直接解析技能 Markdown 文件的语法树,将其映射为一个三元组 $G = (N, D, H)$:
-
单元划分 $N$:对齐目前自动化优化器(如 TextGrad、GEPA 等)最常用的编辑粒度,将 Markdown 顶级列表项、独立段落、可执行代码块等切分为原子级的评估单元。
-
依赖关系 $D$:提取九类结构依赖边,包括显式的 Markdown 超链接、文件路径引用、标题名提及等。若单元 $u$ 的理解或执行依赖于单元 $v$(记为 $u \to v$),那么任何合法的反事实技能子集 $S$ 都必须在 $D$ 上满足向下闭包(Downward Closure)——包含 $u$ 的前提必须包含 $v$。
-
文档层级 $H$:记录技能的树状层级关系。单纯依靠依赖图 $D$ 会产生大量语义交织但阅读极不顺畅的插入顺序,比如先插入一级标题,跳过前三段正文去插入第四段,再回头补全第二段。层级树 $H$ 强制要求同级兄弟单元必须保持局部连续性(Contiguity),保证每一步构成的中间状态都读起来像一份格式规范的真实技能。
基于 $(N, D, H)$,SkillSV 定义了可行排列集合 $\mathcal{F}$。所有反事实技能的构建都严格限定在合法的前缀排列中,彻底根除了产生“语法畸变技能”的可能。
2. 配对算子:解耦内容价值与上下文开销
为了解决“内容贡献”与“长度变化”纠缠不清的痛点,SkillSV 引入了两种不同的移除渲染算子:
其一是物理删除算子 $\rho_{\mathrm{del}}$,它在剔除未入选单元时直接将文本移除,Prompt 随之变短;
其二是等长填充算子 $\rho_{\mathrm{pad}}$,它在剔除未入选单元时,使用完全中立的占位符(如无实际语义的结构化空白或通用停用字符)填充相应位置,保持 Prompt 的总 Token 长度与原始技能严格一致。
借助这种成对设计,SkillSV 能够精妙地拆解出两种价值维度:
\[\text{内容价值(Content Value)} = \phi_{i, \rho_{\mathrm{pad}}}\] \[\text{上下文成本(Context Cost)} = \phi_{i, \rho_{\mathrm{pad}}} - \phi_{i, \rho_{\mathrm{del}}}\] \[\text{综合净价值(Net Value)} = \phi_{i, \rho_{\mathrm{del}}}\]如果一个单元在等长填充下表现出正向增益,但一旦删除它带来的缩短效应更大,说明该单元虽然有微弱用处,但占用的上下文窗口得不偿失。这一区分直接赋予了系统针对 Prompt 进行“精准重构”还是“果断剔除”的指导依据。
3. 链式耦合估计器:在严苛预算下稳健收敛
由于每次评估都需要运行昂贵的 Agent 任务,暴力采样成千上万条排列在工程上完全不可行。SkillSV 引入了链式耦合(Chain-Coupled)采样技术。
在每个采样的合法前缀链 $\varnothing = S_{0} \subset S_{1} \subset \dots \subset S_{n} = N$ 中,相邻两个集合仅仅相差一个新插入的单元 $i$。估计器让 $S_{j}$ 与 $S_{j-1}$ 在同一批随机抽样的测试任务窗口 $B_{k}$(大小为 $b$)上进行成对评测:
\[\hat{\phi}_{i, \rho} = \frac{1}{K}\sum_{k=1}^{K}\left[\bar{v}_{\rho}\big(S_{i}^{\pi_{k}}\cup\{i\}, B_{k}\big) - \bar{v}_{\rho}\big(S_{i}^{\pi_{k}}, B_{k}\big)\right]\]通过在相同的任务子集上计算配对差值,任务本身的随机难度差异被直接抵消(极大地降低了估计方差)。此外,结合早期停止阈值判断,SkillSV 能够跳过对高度饱和状态的不必要测试,将总采样开销降至经典排列采样的极小比例,使其在工业级复杂 Agent 评测中具备了实际落地可行性。
实验评测:保真度、价值闭环与安全剪枝
为了验证这套定价体系的客观有效性,研究团队在四个截然不同的大模型智能体基准上展开了深入评测,涵盖复杂数学推理 LiveMath、文档级办公推理 OfficeQA、工具操作与数据分析 SpreadsheetBench(SSB)以及具身环境决策 ALFWorld。测试所用的技能文档全部来自四种主流优化器(TextGrad、GEPA、SkillOpt、Trace2Skill)迭代出的最优成果。
评估主要聚焦在三个关键维度:估值的保真度(Faithfulness)、下游操作的可行性(Actionability)以及对技能冗余性的解释力(Explanation)。
1. 理论与经验的价值闭环
在博弈论中,Shapley 值的基石是效率性公理(Efficiency),即所有个体成员分配到的价值总和必须精确等于该群体创造的总价值增量。在 Agent 技能语境下,整个技能相较于没有技能时的真实内容净提升定义为 $\Lambda = V(N) - V({m})$(其中 $m$ 代表基础通用前言)。
一个可靠的估值系统,其所有单元估值之和 $\sum \phi_{i}$ 必须高度逼近 $\Lambda$。
实验数据给出了极为鲜明的对比:
在所有四个数据集上,SkillSV 估算出的各项单元价值总和与真实测得的内容净增益 $\Lambda$ 展现出惊人的吻合度。在 LiveMath 上两者的比值为 $0.97\times$,在 OfficeQA 上为 $0.95\times$,在 SpreadsheetBench 上为 $0.96\times$,在 ALFWorld 上为 $1.04\times$。全部严格落在 $95\%$ 置信区间内部,完美达成了经验层面的 Shapley 闭环。
反观传统的留一法(LOO),在面对组件间的冗余与互补协同效应时产生了极大的失真。在 LiveMath 中,LOO 算出的总贡献和居然呈现出与真实情况完全相反的负值(比值达 $-0.83\times$);在 OfficeQA 中,由于存在高度互补的模块,LOO 将协同增益重复计算,估值膨胀到了真实提升的 $4.43\times$;而在 ALFWorld 中,LOO 甚至爆出了 $-10.00\times$ 的荒谬结果。这一结果强有力地证实:脱离结构约束与组合博弈的单点消融,在复杂技能分析中几乎完全不可信。
2. 无损的“安全剪枝”与上下文瘦身
既然每个单元都有了明确的“标价”,那么依据价值从低到高依次剔除排名靠后的单元,理应能够实现技能的无损瘦身。
研究团队进行了循序渐进的剪枝实验(Pruning Curve)。结果显示,在四个任务基准上,依照 SkillSV 估值排序剔除冗余项时,性能衰减曲线表现得极其平缓,在剪枝初期甚至出现了微弱的正向反弹。基于 SkillSV 的精简版本在剔除大量低分、零分甚至负分单元后,模型表现保持了高度坚挺:
相较于未剪枝的原始庞大技能,经过 SkillSV 提炼后的新技能在各个基准上的表现变动仅分别为 $-4.8$、$+1.2$、$0.0$ 和 $-1.6$,整体平均净波动仅为 $-1.3$ 个百分点。与此同时,Prompt 的上下文体积被大幅削减,调用推理延迟与成本显著下降。
相比之下,基于传统 LOO 或扁平消融给出的剪枝方案,往往在第一轮就会误删那些看似独立但处于核心依赖路径上的底层关键定义,导致 Agent 的成功率迅速发生断崖式下跌。
3. 为什么自动生成的技能充满了“水分”?
通过进一步解构各单元的价值分布,研究团队揭示了当前自动化技能优化体系普遍存在的深层机制问题:
在自动化优化器(如反思式演化、梯度提示词优化)多轮迭代之后,所生成的庞大文档内部呈现出极端严重的价值高度集中现象。文档中通常仅有 $10\% \sim 20\%$ 的核心单元(如关键的工具调用逻辑、核心格式规范)承担了几乎全部的正面性能提升,其余大量的条目呈现出以下特征:
-
死代码与冗余描述:部分规则虽然文笔流畅、看似合理,但 Agent 在实际解题执行中从未触发,或者与其他先验指令形成了信息重叠;
-
负资产单元:部分长篇大论的细节提示不仅未能提供增量信息,反而占用了宝贵的上下文注意力,导致核心 Prompt 的权重被稀释,其测得的上下文成本远超内容价值;
-
脆弱的耦合:大量文本块虽然名义上是操作步骤,但语法上高度依赖特定的局部变量名,一旦优化器后续轻微改写前文,这些单元便沦为诱发 Agent 幻觉的隐患。
SkillSV 第一次为这种结构性的“低效膨胀”提供了量化的诊断探针,不仅指出了技能行不行,而且精准标定了“哪一段在立功、哪一段在占坑、哪一段在帮倒忙”。
迈向结构化、可审计的 Agent 资产工程
长期以来,提示词工程与 Agent 技能构建都带有浓厚的“试错”色彩。工程师们通过黑盒式的自动化流水线刷高总分,却不得不承受 Prompt 越堆越长、维护越来越难、难以定位偶发 Bug 的副作用。
SkillSV 的价值在于打破了“将 Prompt 视作不可拆解的一团混沌”的旧思维模式。它证明了:Agent 技能完全可以像现代大型软件项目一样,被系统化地解析为带有依赖图谱、调用关系与模块层级的结构化系统。通过将经典的博弈论工具引入受约束的语法结构中,我们第一次拥有了一种兼具数学严谨性与计算可行性的“标价系统”。
这种细粒度的归因技术,预示着 Agent 技能沉淀将从早期的“野蛮生长”步入“精细化重构”时代。未来的自动化 Agent 框架不再仅仅需要一个只顾往 Prompt 里狂塞技巧的“优化器”,更需要一个能够定期审视代码、剔除负资产、保持轻量化与高可用性的“结构化诊断与重构编译器”。在这个进程中,搞清楚每一项技能内部的真正价值,正是构建下一代稳健、可解释自主智能体不可或缺的基石。