SkillSmith:不改参数,让27B端侧Agent单任务步数从36.1降至9.9
SkillSmith: Enhancing Locally Deployed Agents via Automatic Skill Construction and Evolution

在个人助理、自动化办公和设备控制等长链路任务中,基于大语言模型的智能体(Agent)正逐渐从概念走向实用。然而,主流部署方案面临着难以两全的结构性矛盾:若采用以千亿甚至万亿参数闭源大模型为核心的云端智能体(Cloud Agent),由于每一步都需要上传包含用户文件、任务上下文和应用状态的累积观察信息,既容易带来隐私泄露风险,又会产生昂贵的持续 API 调用开销;若改用完全部署在用户设备上的端侧智能体(Local Agent),受限于本地端 30B 左右的开源小模型(SLM)规模,其任务执行成功率往往大幅落后于云端方案。
ArXiv URL:https://arxiv.org/abs/2608.08037v1
很多人直觉上认为,端侧模型的不足在于推理与规划能力不足,弥补差距需要高成本的微调(Fine-Tuning)甚至模型蒸馏。但由南方科技大学等机构联合发表的最新研究 SkillSmith 提出了截然不同的诊断结论:端侧模型的核心短板并非通用智能不足,而是缺乏特定任务环境的规则与操作常识。通过在离线阶段让云端强模型探索环境并自动沉淀“技能文档”(Skill),再根据端侧模型的真实踩坑反馈进行迭代演化,SkillSmith 实现了在完全不改动端侧模型参数、不向云端发送在线数据的前提下,让 27B 开源模型在日常复杂任务中的表现逼近甚至超越顶级云端大模型,同时将单任务平均执行动作从 36.1 步大幅缩减至 9.9 步。
端侧 Agent 的真实瓶颈:不是算力弱,而是缺“常识”
现有的 LLM 智能体大多遵循 ReAct 范式,在“观察—思考—行动”的闭环中交替前行。智能体控制器(Controller)在本地环境收集反馈,将不断拉长的上下文发给基座模型,再执行模型生成的动作指令。

如上图所示,当采用云端方案时,任务执行过程中的关键隐私细节不可避免地暴露给云端接口。端侧智能体虽然彻底隔绝了数据外流风险,但在实际任务基准测试中,往往表现得极为笨拙,频繁陷入无效尝试或重复报错中。
为了探究端侧智能体失效的根源,研究团队进行了一项针对性诊断。他们对比了前沿开源小模型 Qwen3.6-27B 与顶级云端模型 Claude Opus 4.5 的核心能力,发现两者在纯粹的单步工具调用、代码生成或逻辑推理上的差距并不致命。当分析端侧智能体在真实复杂应用环境中的失败案例时,真正导致任务崩盘的原因高度集中:在统计的失败样本中,绝大多数任务之所以中断,是因为端侧小模型并不知道特定第三方 API 的隐式规则、调用前置条件或标准的操作顺序。
针对这类“环境知识缺失”,常规思路是采集大量专家轨迹做后验微调。但微调不仅代价高昂,而且一旦底层环境升级或 API 变更,整个训练流程必须重来。研究团队做了一组概念验证:仅仅通过人工撰写少量的通用环境操作指引放入系统 Prompt 中,在完全不调整模型权重的情况下,原本失败的任务有接近 80% 得以直接解决。这确立了一个核心前提:弥补端侧智能体与云端差距的最佳路径是非参数化(Non-parametric)的外部知识注入,而非参数微调。
为什么现有非参数方案难以兼顾实用性?
既然非参数化的知识补充切实可行,为什么过去的技术路线没有彻底解决这一问题?现有的方案大致可以划分为三类,但它们在端侧设备上面临严格的资源与工程制约:
第一类是基于提示词的方法(Prompt-based),试图将所有使用说明或 Few-shot 样例一股脑塞进上下文。端侧小模型不仅上下文窗口有限,长文本注意力在面对过长 Prompt 时极易发生信息稀释,导致“大海捞针”能力下降。
第二类是基于记忆检索的方法(Memory-based),如各类分层交互记忆框架。虽然能按需检索,但基于相似度检索出的零散片段往往缺乏连贯的程序化逻辑,且维护一套动态检索系统本身就会占用端侧有限的计算与内存开销。
第三类是近年来备受关注的技能方法(Skill-based)。在这一设定中,技能被定义为由一个主入口文档(SKILL.md)和若干按需加载的参考文件构成的轻量级知识库。它天然支持渐进式暴露(Progressive Disclosure)机制:智能体在初始阶段只加载核心规则,只有当触发特定操作条件时,才将对应的操作细则载入当前上下文。这种机制对端侧小模型而言极为高效,既保证了关键上下文不超载,又提供了明确的步骤指引。
然而,已有技能系统普遍存在一个致命断点:它们默认高质量的初始技能必须由人类专家手工编写。这使得系统很难低成本拓展到上百种复杂、动态的真实业务场景中。
SkillSmith 框架:离线双端协作,在线完全隔离
针对上述痛点,SkillSmith 提出了一套让云端强模型与端侧轻量模型相互配合的协作机制。整套系统被严谨地划分为离线学习(Offline Learning)与在线服务(Online Serving)两个完全独立的阶段。

如系统图所示,所有昂贵的大模型推理和探索过程都被收敛在离线阶段。在这一阶段,由 Claude Opus 4.7 等顶级云端模型充当探索者与编译器,利用代表性训练任务合成初始技能;随后端侧小模型在本地环境中加载该技能进行实操,暴露出自身真实的执行障碍;云端模型再针对端侧模型的失败报告进行归因和修补。
一旦这套迭代流程结束,生成的技能文件直接打包固化到本地端侧设备。在随后的在线服务阶段,云端链路彻底切断,API 调用归零,端侧智能体在完全冻结参数的状态下独立运行,用户的任何私密输入和业务数据均不出本地。
1. 技能创建:三大角色化繁为简
要让云端模型自动从任务轨迹中提取环境规则,最大的工程挑战在于“信息过载与噪声混杂”。面对上百个任务的执行日志,如果直接丢给模型归纳,很容易混入大量与具体用户输入强绑定的任务级细节,反而干扰了通用规则的提炼。

SkillSmith 在技能创建模块中设计了三种不同职能的 Agent 角色:
-
聚类智能体(Cluster Agent):首先对大量离线反思日志进行语义与应用维度的聚类,将同类 API、相似任务类型的报告归纳为有限且紧凑的簇,避免后续处理时因杂乱输入而超出模型注意范围。
-
提炼子智能体(Distill SubAgent):为每个聚类簇单独分配提炼任务。其核心目标是过滤具体数值,只榨取高复用性的程序信号,包括规范的 API 调用模板、常见边界报错陷阱与应对预案,并明确标注哪些是当前工具独有的规则,哪些是跨应用通用的共性逻辑。
-
合并智能体(Merge Agent):在严格的代码行数预算约束下(例如主文档不超过 400 行,单个参考文件不超过 250 行),将高频的通用逻辑合并进主入口手册,而将应用特定的操作细节解耦拆分为参考文件,并精确设定每份参考文件的载入触发条件。
2. 技能演化:以端侧失败为靶心的定向迭代
单纯由云端大模型归纳出的技能,往往带有“强模型傲慢”——即很多对强模型而言理所应当的逻辑跳跃,端侧小模型根本无法稳定执行;或者某些参考文档的触发词设置过于生僻,导致小模型在实际调用中漏载关键操作指导。

为此,SkillSmith 构建了以端侧真实反馈为驱动的闭环演化算法。在每一轮演化迭代中,端侧小模型带着当前版本的技能文件完整执行训练任务,任何未能成功完成的轨迹连同环境报错信息,都会被压缩为一份针对性的“失败报告”。
云端模型随后扮演“技能审计官”的角色:它对比失败日志与现有技能文档,定位出是技能中遗漏了某条关键前置限制,还是给出的代码模板存在歧义,抑或是加载触发条件未能命中。随后,云端模型以极小化修改为原则,更新技能规则并输出新版本。这一黑盒优化过程循环数轮,直至端侧小模型在该场景的经验通过率达到极值。
实验结果:效率跃升与逆袭云端模型
为了验证 SkillSmith 的有效性,研究人员在两个极具代表性的综合智能体基准上进行了深度评估:包含多款复杂模拟移动应用交互的 AppWorld(涵盖 Normal 与跨应用 Challenge 两个难度级别),以及涉及真实办公日程、报表分析与项目管理的 WorkBench。端侧本地模型采用开源的 Qwen3.6-27B,对比基线包括纯提示词方法、动态交互记忆方案,以及由 Claude 4.5/4.7 支持的原生云端 Agent。
从任务通过率(Pass Rate, PR)的最终数据来看,原本未加载技能的端侧 Qwen3.6-27B 在 AppWorld-Normal 上仅能取得极其微弱的成功率,与云端顶级模型的差距高达 57.7 个百分点。但在装备了 SkillSmith 自动构建并演化后的技能后,该端侧模型的成功率大幅跃升,与云端模型的差距被迅速压缩到了 15 个百分点左右;在任务复杂度更高的 WorkBench 办公场景中,加载技能后的 27B 端侧模型甚至以 13.6 个百分点的优势反超了使用顶级云端模型的原生 Agent。对比各类现有的非参数化增强基线(如 Memento、REMe 等记忆与提示词方法),SkillSmith 在各数据集上展现出了 11.3 至 26.2 个百分点的绝对领先。
更为惊人的是端侧执行效率的质变。直觉上,让模型阅读外部技能文档会增加上下文长度,可能导致推理变慢。但实验表明,环境知识的精准注入从根本上改变了小模型的行为轨迹:
没有技能辅助的小模型在面对陌生 API 时,往往处于盲目试错状态,频繁报出参数错误并反复重试,在 AppWorld-Normal 上平均每个任务要消耗 36.1 步动作,累计上下文 Token 消耗超过 45 万;而在技能的精确指引下,模型能够直接写出符合环境预期的正确 API 参数和调用顺序,单任务平均动作步数直接被压缩至 9.9 步,降幅超过 72%;累积上下文 Token 从 450.7k 减半至 200.6k,输出 Token 也由 6.3k 显著降低至 3.7k。这种“以知识换确定性”的机制,不仅提升了成功率,更显著降低了端侧计算芯片的持续负载。
关键机制拆解:技能生成与演化的权衡
在消融实验中,研究团队深入探讨了“技能创建”与“技能演化”两阶段各自的贡献。数据显示,仅靠云端三智能体流水线完成的初版技能(Creation-only),就已经能够提供绝大部分的核心收益;随后的演化阶段(Evolution)则进一步收敛了约 10% 到 15% 的边界长尾失败。
这种特性赋予了该框架极强的工程弹性:对于算力与预算极其充裕的场景,可以开启完整的“创建+演化”模式追求极限效果;而在 API 预算紧张或离线构建周期有限的场景下,仅运行一次创建阶段,也能直接让端侧模型获得质的飞跃。
更为关键的是技能的跨模型泛化能力。团队将针对 Qwen3.6-27B 迭代演化生成的最终技能文件,在不作任何重写的前提下,直接挂载到 Qwen3.6-30B-A3B 以及 Google Gemma-4-31B 等异构端侧模型上。测试结果显示,各模型在挂载后均获得了极其显著的性能跃迁,例如 Gemma-4-31B 在 AppWorld-Normal 上的通过率同样获得了近 50 个百分点的增长。这一结果强有力地证实:SkillSmith 萃取并固化的是面向底层软件环境的“客观事实与操作真理”,而非仅能适配某一特定模型的专有过拟合 Prompt。这为未来构建通用的“端侧 Agent 技能商店”提供了坚实的理论与工程依据。
端侧 Agent 规模化落地的新范式
长久以来,工业界在考虑端侧 Agent 落地时,往往陷于“本地小模型太笨办不成事,云端大模型太贵且泄露隐私”的两难境地。常见的中庸方案如云端路由(Routing)或推测协同(Cascading),虽然降低了平均开销,但依旧无法斩断对云端运行时的依赖,无法真正满足极端注重隐私的严肃个人助理或政企端侧场景。
SkillSmith 的技术路径提供了一种极具吸引力的全新范式:将大模型的推理智能作为离线阶段的“编译器”,把繁杂的交互环境编译为高度结构化、模块化的轻量级操作技能;而在在线运行阶段,由端侧冻结参数的小模型担任纯粹的“解释器”。
这种“云端重型锻造、端侧轻量运行”的架构,绕开了高昂的参数微调壁垒,保留了小模型完全离线、低延迟和零数据泄漏的根本优势,同时大幅消解了小模型因参数规模限制带来的常识缺陷。随着端侧 NPU 算力的普惠与开源小模型底层推理能力的持续升级,以结构化技能为载体的端侧非参数化增强方法,很可能会成为下一代个人操作系统级 AI 助理的标准基础设施。