19款大模型评测揭示:不是拼参数,而是拼Agent技能让小模型直追旗舰

A Framework for Evaluating Agentic Skills at Scale

19款大模型评测揭示:不是拼参数,而是拼Agent技能让小模型直追旗舰 论文图示

大语言模型(LLM)驱动的 Agent 正在迅速重塑软件开发、数据分析和复杂工作流的自动化方式。为了让通用模型能够胜任特定领域的复杂任务,行业内形成了一种标准的做法:为 Agent 注入“技能”(Skills)。这些技能本质上是结构化、可复用的知识载体,它们封装了特定领域的工作流、API 调用模式、代码规范以及专家的偏好设定。

ArXiv URL:https://arxiv.org/abs/2606.17819v1

技能在各大 Agent 平台中正被广泛采用,但一个基础且致命的问题却一直悬而未决:我们到底该如何严谨地评估一个技能是否真的改善了 Agent 的表现?

由 Tessl 机构主导的这项最新研究,正是为了解决这一盲区。作者指出,现有的主流 Agent 评测基准大多聚焦于通用的任务解决能力或工具调用能力,完全无法衡量“引入某个特定技能后,Agent 行为发生了怎样的边缘改变”。更现实的困境是,当开发者编写了一个全新的技能时,没有任何现成的方法可以用来测试这个新技能究竟是提高了任务成功率,还是仅仅改变了表面行为。

为了解答这些问题,研究团队提出了一套可扩展的 Agent 技能自动化评估框架,并基于此对来自开源社区和商业机构的 500 个真实技能进行了大规模测试,生成了 1000 个高质量的评估任务。通过对 19 种不同的“Agent-模型”配置(涵盖闭源旗舰与开源模型)进行跑分,论文揭示了几个极其重要的结论:首先,在当前的前沿模型能力下,“能否完成任务”已经不再是区分模型优劣的主要标准,真正的分水岭在于“模型能否精确遵循技能中编码的特定工作流”;其次,也是最引人瞩目的一点,为一个较小、较便宜的模型配备合适的技能后,其表现能够直接抹平与顶级旗舰模型之间的代差,甚至将推理成本大幅压缩至三分之一到四分之一。

为什么通用的基准测试无法评估“技能”?

在当前的评测生态中,我们已经有了非常丰富的基准测试体系。然而,这些固定的基准测试集无法回答技能开发者在实践中面临的最核心问题:给定一个新创建的技能,如何确定它在预期任务上切实提升了表现?

这个问题实际上可以拆解为几个更深层次的追问。Agent 是否真的遵循了技能中包含的特定指令?这个技能是否提供了模型本身预训练数据中尚未掌握的知识或工作流?技能是实质性地改善了任务完成度,还是仅仅让输出的格式发生了一些不痛不痒的改变?更具商业价值的疑问是,获取这些结构化技能后,一个小参数量或低成本的模型,能否媲美庞大昂贵的旗舰模型?

如果依赖传统的人工编写测试用例,不仅领域覆盖面极窄,而且根本无法适应如今分布在各个社区注册表中的海量异构技能。传统的基准只是用固定的任务去测试固定的技能,缺乏对“任意新增技能”进行即时泛化评估的能力。这使得开发者在优化 Agent 时,往往只能依靠直觉和零散的日志,而缺乏系统性的定量指标。

自动化评估框架的核心机制

为了突破这种局限,研究团队设计了一套将任意技能自动转化为可执行评估任务的合成框架。该框架的巧妙之处在于,它不需要人工去设想技能的使用场景,而是通过一组专门的协同 Agent,直接从技能的内容中推导出真实的测试任务。在整个生成和测试过程中,系统会隐蔽地植入评分标准,从而在不泄露“考题答案”的前提下,精准测试求解 Agent 的真实能力。

框架流程图

这套流水线包含几个关键的处理节点:

环境工程分析

任何真实世界的技能都不可能在真空中运行。一个技能可能需要特定的数据库访问权限、特定的命令行工具、API 密钥,或者是某种特定的编程语言运行时。评估框架中的环境工程 Agent 负责扫描技能,识别并分类这些依赖项。如果是在完全自治的模式下,该 Agent 会尝试自动满足这些缺失的条件(例如准备好基础的执行容器)。如果某些依赖(如极度特定的本地运行服务或多轮状态)无法自动构建,框架会及早剔除这些技能,以确保生成的任务在物理上是绝对可执行的。

任务生成与意图推演

在确认环境可行后,任务生成 Agent 会基于技能本身的文档、代码和结构,提出合理的任务提案。由于许多技能(例如“处理 PDF 文档的技能”)在实际运行中需要外部输入文件,生成 Agent 还会尝试通过检索公共资源或从头合成的方式,补齐这些必须的输入物料。最终输出的是一个极具现实意义的用户请求。

质量验证与防泄露机制

这是保障评测有效性的关键一步。验证 Agent 必须确保生成的任务描述没有“泄题”。如果任务描述直接把技能内部的执行步骤原封不动地翻译成了提示词,那么这种评测就失去了意义,因为即使是没有该技能的模型也能照猫画虎。验证 Agent 会过滤掉那些模棱两可的任务、环境不一致的任务,以及可能让被测模型通过“作弊”得分的任务。

双轨评分体系

当生成了包含自然语言描述、输入文件夹和隐藏评分标准的任务包后,系统会分别在“带有技能”和“不带技能”两种条件下,让目标模型去解决同一个任务。

在评分环节,作者采用了基于强大模型(Sonnet 4.6)的 LLM-as-judge 机制,并制定了两套截然不同的评分维度:

  1. 目标完成度(Goal-completion):考察模型是否最终输出了正确的结果或有效运行的代码。如果引入技能后该分数大幅提升,说明技能提供了基础模型完全不具备的核心能力。

  2. 指令遵循度(Instruction-following):考察模型在解决问题的过程中,是否严格采用了技能所规定的偏好、格式和特定工作流。如果该分数出现显著差异,说明技能成功改变了模型的深层行为模式。

500 个真实技能的图谱与数据特征

为了让评估结果具备现实指导意义,作者从知名企业(如 Anthropic、Google、Shopify 等)和开源社区中,精心筛选了约 500 个高质量的开源技能。在经过安全漏洞扫描和许可协议过滤后,这些技能被送入了环境工程流水线进行依赖项分析。

数据特征显示,绝大多数技能的运行环境依赖集中在“命令行工具访问”、“身份认证凭据”以及“特定的语言运行时”。相对而言,需要复杂数据库访问或浏览器自动化的技能占比不到 10%。对于那些需要认证凭据的第三方 API 技能,由于即使缺少真实的 Key,模型依然可以生成正确的调用代码逻辑,因此这部分技能被大量保留用于评估。

通过聚类分析,这 500 个技能展现出了极其丰富的领域分布。

技能聚类分布图

从聚类结果可以清晰地看到,软件工程类技能占据了绝对的主导地位。其中,Web 与 UI 设计(14.3%)、机器学习与 AI(13.6%)、测试与代码质量(10.2%)以及基础设施与 DevOps(8.3%)构成了最大的几个板块。此外,金融加密、数据处理、科学计算以及内容文档处理等领域也占据了可观的比例。

基于这 500 个技能,流水线最终合成了约 1000 个高质量的评估任务。这构成了一个极具挑战性且高度贴合实际开发场景的数据集,为后续测试 19 款不同模型提供了坚实的基础。

核心发现一:任务完成率接近饱和,指令遵循才是能力分水岭

在对 19 种“Agent-模型”配置(包括 Claude 代码框架和 OpenHands 开源框架,涵盖 Claude 3 系列、GPT-4 系列、Gemini 系列以及 GLM 5.1、DeepSeek V4、Qwen 等开源模型)进行约 38000 次轨迹运行后,作者提取出了令人深思的数据对比。

实验最直观的现象是:在目标完成度这一单一指标上,当今的前沿模型已经强大到几乎能够“殊途同归”。无论是否提供技能支持,绝大多数模型在目标完成度上都能达到接近饱和的水平,普遍超过 90%。这意味着,即使不告诉模型该用什么具体方法,只要目标明确,强大的模型总能自己摸索出一条解决路径。唯一表现异常的是参数量较小的某些特定系列模型,它们在目标完成度上遭遇了滑铁卢,作者推测这与模型本身的参数规模以及训练配方中相关数据的缺乏有关。

然而,既然目标大多能完成,为什么我们还需要技能?

答案隐藏在“指令遵循度”的巨大落差中。作者发现,一个在形式上完成了目标的模型,如果它在执行过程中忽略了既定的指令规范,在真实的工业应用中将引发严重的灾难。比如在基础设施代码部署中,如果模型没有遵循特定的目录结构或变量命名安全规范,即便代码当下能够运行,也会导致后续的系统维护、安全审计和代码复用变得极为困难。

测试数据表明,对于所有受测模型,一旦接入了相关的技能,其在指令遵循度上的表现都会出现戏剧性的飞跃。这种提升直接拉动了整体综合评分(目标完成与指令遵循的加权)的上涨,提升幅度在 5.5 到 22 分之间不等。这从根本上证明了:技能的最大价值,不在于教模型“能不能做”,而在于强制模型“必须这么做”。技能作为一种外部知识载体,成功地在推理阶段压制了模型预训练时形成的通用散漫习惯,将其行为强行拉入到了专家设定的轨道中。

核心发现二:技能是抹平模型代差与成本的最强杠杆

这篇论文最具有商业冲击力的结论,来自于不同模型在引入技能后的横向对比。

数据揭示了一个极其稳定且一致的模式:一旦提供了相关的业务技能,同一个模型家族中的“小杯”或“中杯”模型,其表现能够迅速逼近甚至等同于该家族中最昂贵的“超大杯”旗舰模型。

以 OpenAI 阵营为例,在使用技能的情况下,较小规格的 GPT-5.4 mini 获得了 84.5 的整体高分,距离体积庞大、成本高昂的满血版 GPT-5.4(88.2 分)仅有不到 4 分的微弱差距。在 DeepSeek 阵营中情况完全一致,V4 Flash 在技能的加持下拿到了 83.9 分,紧紧咬住 V4 Pro 的 86.6 分。技能的存在,极大地压缩了模型家族内部的阶级差异,使得低配模型成为了极具竞争力的旗舰平替方案。

更震撼的是这种效应在跨越开源与闭源鸿沟时的表现。中国的开源权重模型 GLM 5.1 在获取技能后,整体得分飙升至 91.1 分,这一成绩不仅基本打平了备受赞誉的闭源模型 Sonnet 4.6(91.5 分),而且距离当时表现最为顶级的商业旗舰 Opus 4.8(92.7 分)和 Opus 4.7(92.3 分)仅仅落后了 1.2 到 1.6 分。

这背后的经济账令人无法忽视。根据论文披露的模型调用成本数据,GLM 5.1 在单个场景下的运行成本大约仅为 0.89 美元。相比之下,同样具备顶级表现的 Sonnet 4.6 成本为 1.46 美元,而 Opus 4.8 和 4.7 的成本分别高达 3.26 美元和 3.94 美元。

这意味着,只要开发者能够提前将确定性的工作流提取为清晰的 Agent 技能,就可以放心地使用开源模型或商业系列中的廉价版本。这种组合能够以仅相当于顶级旗舰模型三分之一甚至四分之一的推理成本,交付几乎完全相同的任务完成质量与规范严谨度。对于需要长期运行自动化任务的企业级应用来说,这无疑指明了一条切实可行的降本增效新路径。

哪些领域的技能带来的提升最大?

并不是所有的知识转化为技能后,都能产生同等显著的催化作用。作者对不同领域的技能进行了分类统计,发现技能所带来的边缘提升幅度与该领域的知识属性息息相关。

最大的增幅出现在那些高度依赖特定工作流的领域——即那些明确规定了“必须按特定步骤执行”的场景。例如,“媒体与文件处理”领域的技能带来了高达 +38.1 的绝对得分提升。这是因为无论是视频裁剪、音频格式转换、图像批处理还是有声书生成,往往都需要极其严格的命令参数、特定的调用顺序以及确切的文件格式约定。模型依靠预训练知识很难精准猜出用户的特殊偏好,但一旦技能以工作流的形式将这些步骤固化,模型的执行精准度就会直线飙升。

同样的规律也适用于“安全与合规”领域(提升幅度 +30.3)。这类技能通常封装了严格的安全检查清单、精确的 CLI 审计命令以及结构化的报告生成模式。这些步骤属于“如果不知道就很难无中生有,但只要告诉了就极其容易照做”的程序性知识。

与之形成鲜明对比的是,在“测试与代码质量”或“数据处理与分析”这类领域,技能带来的边缘提升幅度相对较小。原因在于,这些领域的技能往往更多地是在宣导宏观的指导原则和最佳实践(例如“保持代码高内聚低耦合”或“注意数据清洗的稳健性”),而不是死板的操作步骤。这类声明式、高度依赖逻辑推理的泛化指引,现代大模型本身在预训练阶段就已经掌握得很好了,外部注入的增量价值相对有限。

由此,论文作者总结出了一个极具实操价值的启发式规则:当某项专家知识可以被清晰地拆解、固化为一条循序渐进的工作流时,它就是被开发成 Agent 技能的最优候选者;而如果知识只是一些抽象的原则,将其编写成技能的回报率则大打折扣。

对未来 Agent 评测与开发的启示

Tessl 的这项研究不仅仅是发布了一个新的跑分榜单,更重要的是,它重新定义了在 2026 年(论文时间语境)及以后,我们应该如何看待 LLM Agent 的能力。

对于技能开发者而言,这套自动化评估框架提供了一把精准的手术刀。通过在“有技能”和“无技能”两种状态下的双重对比,开发者可以一眼看出自己编写的冗长提示词中,到底哪一行真正在起作用,哪一行只是无用的废话。如果两者得分差距微乎其微,说明这段技能不仅多余,还白白消耗了宝贵的 Token 额度;如果指令遵循得分差距巨大,就证明这段工作流成功对模型实施了心智注入。

在商业落地与部署策略上,这篇论文彻底打破了“大模型包治百病”的迷思。在已知目标场景且工作流清晰的企业级生产环境中,“小模型 + 精心雕琢的技能工作流”在绝大多数情况下,无论是算力成本消耗还是最终输出的工程规范性上,都要优于“裸奔的大参数模型”。

当然,这项研究也坦承了其局限性。在实验设定中,测试环境是直接向 Agent 暴露了相关技能的存在。但在真实的开发世界里,面对系统中安装的上百个技能,Agent 能否在合适的时机准确检索并调用对应的技能,本身就是一项极具挑战的能力。但这并不妨碍这篇论文的核心贡献:它首次在大规模数据层面上向行业证明,相比于永无止境地卷模型参数,用心沉淀特定领域的执行规程并将其技能化,或许才是当下推动 AI 走向真正可靠自动化的最短路径。