Skill-Use:给大模型装上技能库,为何最高分只有0.61?

Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses?

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

Skill-Use:给大模型装上技能库,为何最高分只有0.61? 论文图示

在大模型驱动的智能体(Agent)生态中,“技能”(Skills)正在成为标准配置。从早期的 Prompt 提示词工程,到近来由 Claude Code、Cursor、OpenClaw 等主流平台普及的标准化规范,技能被定义为一段结构化的领域知识文档:它明确告诉模型何时采取行动、遵循怎样的标准作业流程(SOP),以及哪些工具和操作是被明令禁止的。行业普遍默认,只要为基础模型挂载上足够完备的技能库,复杂长链路任务的成功率就能顺理成章地提升。

ArXiv URL:https://arxiv.org/abs/2608.04828v1

然而,真实的落地表现往往与预期大相径庭。华东师范大学、复旦大学、香港科技大学与腾讯联合团队近期发表的研究指出,社区长期忽略了一个核心前置命题:大模型在面对一个复杂的真实任务时,究竟能不能自主识别、精准调取并严格执行这些技能?

这项工作提出了首个专门评估渐进式披露机制下智能体技能调用能力的基准——Skill-Use。在覆盖 9 大领域的 177 个真实任务测试中,即便集结了业内最顶尖的前沿模型(包括 GPT-5.5、Claude Opus 4.8 等),最强组合下的综合技能使用评分(SU Score)也仅达到 $0.613$。更令人意外的是,技能使用并非模型的固有静态能力,它极度依赖承载模型的框架(Harness);甚至在很多场景下,给模型提供一个未能完整执行的技能,其任务完成度还不如“裸跑”的基础模型。

拆解黑盒:渐进式披露下的三维评估

以往对技能库的评测通常存在两类偏差:一类是“产物导向”,只看最终任务成功率,把技能等同于额外的上下文增益;另一类则是“全量预载”,直接把上万字的完整 SOP 塞满上下文窗口。这两种做法都脱离了生产环境的真实形态。

在实际工业界体系中,面对成百上千个技能,系统普遍采用渐进式披露(Progressive Disclosure)机制:初始阶段,模型在上下文里只能看到技能的名称和一句极短的功能描述;只有当模型自主判断当前任务匹配该技能,并发起检索请求后,完整的执行流程才会被加载到工作区。

Skill-Use 评估基准的构建流程

为了精准度量这一黑盒决策过程,Skill-Use 放弃了粗糙的端到端对错判断,而是将技能使用行为严格解耦为三个维度:

  1. 触发率(Trigger,记为 $g$):模型是否仅凭名称和简短描述,就在执行轨迹中正确触发了目标技能的检索调用。

  2. 依从度(Compliance,记为 $\mathrm{C}$):在展开完整技能文档后,模型是否忠实遵循了规范中制定的关键操作流程与阶段性约束。

  3. 边界感(Boundary,记为 $\mathrm{B}$):模型是否有效克制了走捷径的冲动,没有触犯文档中明确禁止的危险操作或非法工具调用。

在最终评分机制上,基准设计了门控综合指标:

\[\mathrm{SU}(y)=g(y;s)\left[\alpha\,\mathrm{C}(y)+(1-\alpha)\,\mathrm{B}(y)\right]\]

公式中将权重 $\alpha$ 设定为 $0.7$。这意味着,如果模型在一开始未能自主触发技能($g=0$),后续即凭自身能力完成了任务,其技能使用分也直接归零;只有成功触发技能的前提下,执行规范($70\%$)与克制约束($30\%$)才会被纳入加权。

为了保证评估的客观与可复现,基准从超过 10 万个候选集合中精选出 79 个涵盖数据库、安全合规、DevOps 等 9 个领域的真实技能,并配对构建了 177 个包含完整沙箱依赖(Docker)的真实任务。每个任务平均包含 4.8 个只有阅读了技能文档才能获知的独占约束点,彻底杜绝了模型依靠训练集通识“蒙混过关”的可能。

核心发现:独立瓶颈与框架依赖

研究人员在两个行业主流框架——Claude Code (CC) 与 Codex 下,对 8 款顶尖大模型进行了系统评测,揭示出若干颠覆直觉的实验现象。

首先,触发能力与流程依从能力呈现出相互独立的瓶颈特性。传统观点往往认为,只要模型的推理能力提升,识别意图和按照步骤做事会同步变强。但数据显示,在基线测试中,擅长“联想并触发技能”的模型,进入流程后往往频繁出现步骤跳跃或遗漏;而那些严格遵循既定步骤的稳健型模型,在一开始面对简短描述时却往往极度保守,根本无法主动唤起技能。二者在能力图谱上并未显现出必然的正相关。

其次,技能使用表现并不取决于纯粹的模型参数,而是强烈受制于外围框架(Harness)。在 Claude Code 环境下,GPT-5.5 展现了极强的技能检索触发率,夺得榜首;但在切换到 Codex 框架后,原本处于优势地位的 GPT-5.5,其条件依从度(Compliance†)下滑超过 $10\%$,总榜冠军旋即被 Claude Opus 4.8 取代。不同框架对上下文组装方式、工具反馈解析以及控制流调度逻辑的细微差异,会直接重置各模型的技能调用表现。这也解释了为什么开发者在特定 Agent 框架下调优的“最佳技能”,迁移到另一个平台后常常迅速失效。

技能库规模扩展、域外克制以及对任务完成率的实际影响

陷阱与临界点:技能用半截,不如完全不用

顺着评测结果深入剖析,作者团队进一步在多变量实验中定位了智能体使用技能时的三项关键机制缺陷:

1. 规模效应呈现“阶跃式门槛”,而非线性衰减

在实际工程中,开发者常倾向于将数十个技能一次性注入 Agent。实验表明(如上图 a、b 所示),当技能库中只有 1 个目标技能时,各大模型的触发表现均十分出色;但一旦加入无关扰乱项,将库容量扩大至 10 个,所有模型的性能曲线均出现断崖式下跌。令人意外的是,当技能数量进一步从 10 个增加至 30 个时,曲线反而不再显著下滑。这意味着,从“单一确定目标”切换到“多选项决策”,模型面临的是一个固定存在的认知门槛;而在未能触发的失败样例中,绝大多数表现为未调用任何技能(None),而非选错了扰乱项。模型在面对丰富选项时,更容易走向过度谨慎,忽视辅助工具的存在。

2. 能“按部就班”,不等于能“知止不为”

团队专门设计了 53 个与技能主题高度相关、但实际目标并不需要该技能 SOP 的“超范围任务”(Out-of-Scope)。测试发现(如上图 c 所示),模型在目标任务中的依从度得分,与其面对诱惑时的抑制调用率(Avoidance Score)呈现出负相关。最善于顺着规范执行复杂流程的模型,在面对似是而非的文本描述时,最容易产生调用冲动;它们往往仅仅因为看到了关键词的重叠,就盲目调出复杂的业务工具链,陷入无效消耗。

3. 0.5 分水岭:半吊子执行具有反噬效应

将技能接入智能体,是否无论如何都能带来正向收益?图 d 给出了极具警示意义的结论:技能介入对任务完成率的提升,在 SU 评分 $0.5$ 处存在严格的分水岭。

其底层机理在于,模型一旦调出技能,就会被其预设的工具流或格式框架锁定;如果模型缺乏足够的依从能力完整跑完全程,它就会既没有满足技能的强约束,又丢失了自由推理时的灵活性,最终交付出两头不讨好的残缺产物。

走向实用的工程考量

Skill-Use 基准所呈现的系统性评测,为当前方兴未艾的 Agent 平台开发带来了清晰的启示。

单纯堆砌 Markdown 格式的 SOP 库,并寄希望于基础模型自行阅读与理解,当前依然存在极大的系统脆弱性。解决之道不能只指望下一代底层模型参数的盲目扩大,而需要从认知分发机制上重构:一方面,需要为智能体框架引入更明确的检索验证器,解决渐进式披露场景下的初筛瓶颈;另一方面,企业在沉淀技能文档时,必须警惕冗余且缺乏强约束的操作描述,尽可能将长篇幅的定性指导,固化为可被沙箱直接检验的确定性程序。

唯有让大模型跨过“自主检索”与“完整执行”的双重门槛,技能生态才能真正转化为坚实的生产力。