HiSkill:以分层技能图打通动作落地,成功率提升17%且Token缩减78%

HiSkill: Empowering LLM Agents with Hierarchical Skill Graphs

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

HiSkill:以分层技能图打通动作落地,成功率提升17%且Token缩减78% 论文图示

在大语言模型(LLM)驱动的自主智能体(Agent)研究中,如何让模型在多步骤的长程交互任务中“举一反三”,一直是构建通用智能体的核心瓶颈。面对包含数十步甚至上百步探索的复杂环境,如果智能体每次都从零开始摸索,不仅执行成功率极低,还会耗费海量的上下文 Token。

ArXiv URL:https://arxiv.org/abs/2607.25853v1

为此,学术界和工业界逐渐将目光投向了“技能(Skills)”机制,尝试将历史成功经验抽象为可复用的程序性能力单元。然而,现有的轨迹提炼技能方法大都停留在“扁平文本集合”的层面:它们往往只是从历史记录中提炼出几句高层策略或自然语言规则,随后通过向量相似度粗暴地检索并塞进 Prompt。这种做法导致了两个长期难以调和的矛盾:一是高层技能描述与底层可执行动作之间存在巨大的落地鸿沟,模型知道“要去找钥匙”,却不知道当前环境下具体的 API 参数和动作时序;二是技能之间彼此孤立,缺乏对动作分解、前置依赖、时序衔接以及失败恢复等复合关系的结构化刻画。

由蚂蚁集团、北京邮电大学与中国移动研究院联合提出的 HiSkill 框架,为这一难题提供了一套系统性的图结构解决方案。该研究打破了将经验视为纯文本片段的传统范式,提出从成功与失败的历史交互轨迹中自动化构建包含高层技能节点、可执行原子操作(AtomicOp)节点以及五类显式关系边的分层技能图(Hierarchical Skill Graph)。在运行时,HiSkill 通过紧凑子图检索与轻量级符号状态追踪,有效引导 Agent 完成从宏观决策到底层具身化操作的平滑推进。

在 ALFWorld 具身家居交互、WebShop 网页购物和 ScienceWorld 复杂科学实验三大基准任务上的全面评测显示,HiSkill 在取得平均成功率相对提升 17.33% 的同时,较最强基线缩减了 78.75% 的推理 Token 消耗,展现了结构化程序性先验在提升 Agent 执行精度与计算效率上的双重优势。

现有扁平技能方案与 HiSkill 分层技能图架构的对比

扁平经验池的瓶颈与落地鸿沟

长程交互任务对 LLM Agent 构成了极其严苛的系统性挑战。无论是在真实网页中寻找满足多重约束的商品,还是在虚拟物理环境中完成加热受潮物品等物理实验,环境返回的观测往往是局部的、动态变化的,且伴随着极高容错成本。如果 Agent 仅依赖 ReAct 等提示词机制在单次推理中进行试错,往往会陷入死循环、参数报错或中途偏离初始目标的窘境。

为了赋予智能体长期记忆,早期尝试如 Reflexion、ExpeL 等侧重于提取自然语言反思;而近期的 SkillRL、D2Skill 则尝试将轨迹沉淀为“技能库(SkillBank)”。这些方案本质上依然将技能视为扁平的文本卡片。当 Agent 面临具体执行时,单纯向上下文中注入类似“先检查目标容器是否通电,再调整温控开关”的高层经验,往往无法帮助模型准确推导出在当前 step 应该调用 click[switch_3] 还是 toggle[power_button]。高层逻辑的“策略抽象”与执行层面的“动作落地(Action Grounding)”之间,始终隔着一道难以逾越的鸿沟。

不仅如此,现实任务中的动作序列往往高度共享且具备复杂的拓扑结构。例如,“清洁物品”可以作为独立技能,也可以作为“烹饪”技能的前置支持步骤;而在主干操作受阻时,系统往往需要特定的“补救恢复动作”。近期虽然出现了如 Graph of Skills(GoS)和 GraSP 等引入图结构的探索,但这些方法大多依然停留在技能与技能之间的宏观依赖,忽略了可执行原子动作的直接建模,也未能充分利用失败轨迹中所蕴含的容错和恢复证据。

HiSkill 的核心洞察在于:程序性经验复用不应只是策略层面的自然语言检索,而必须建立一套从高层抽象向下直通具体动作参数、横向覆盖时序与容错逻辑的分层网络。

分层技能图:双层节点与五维类型边

为了实现上述目标,HiSkill 首先对历史轨迹集进行正负样本划分。成功轨迹 $\mathcal{T}^{+}$ 提供了规范的执行模式,而失败轨迹 $\mathcal{T}^{-}$ 则蕴藏着宝贵的执行痛点和失败恢复线索。基于这些轨迹,HiSkill 自动化构建出一个有向异构图 $G=(V, E)$,其中节点集合 $V$ 由技能节点 $V_S$ 与原子操作节点 $V_O$ 构成,边集合 $E$ 则由带有五种语义类型的有向边组成。

第一层基础是原子操作节点(AtomicOp)的规范化提取。HiSkill 设计了一个基于模式的规范化解析器,对原始动作进行解构。它识别动作类型与参数,将具体的实体替换为抽象占位符(例如将 clean mug 1 with sinkbasin 1 规范化为 clean <obj> with <receptacle>),从而形成统一的动作模板。系统在合并同类模板的同时统计其在轨迹中的支持频次,构筑起底层执行的原子动作词汇表。

第二层是高层技能节点(Skill)的序列挖掘。系统在成功轨迹对应的规范化 AtomicOp 序列中进行频繁模式挖掘,将反复出现的高频操作序列沉淀为一个技能节点。与常见的纯文本描述不同,HiSkill 中的每个技能节点不仅绑定了一个严格有序的 AtomicOp 子序列,还挂载了丰富的结构化元数据,包括技能的前置适用状态、预期产生的环境状态变化、代表性实例、参数填充候选集、经验支持频次以及失败提示信息。LLM 在该阶段仅被用来微调自然语言名称与描述,并不干预底层挖掘出的硬性操作序列,确保了技能的客观性与鲁棒性。

连接这两层节点的,是系统依据轨迹共现与转移统计诱导出的五种类型化边,这也是 HiSkill 得以覆盖复杂交互逻辑的关键:

  1. 分解边(decomposes_to:由技能节点指向其包含的有序 AtomicOp 节点,明确定义了该技能在底层由哪些具体步骤构成;

  2. 时序承接边(can_follow:在技能节点之间或动作节点之间建立可行的先后衔接关系,表明前序步骤完成后可无缝过渡到后序步骤;

  3. 兼容边(compatible_with:连接可以交替执行或在相近场景下平级复用的技能,增强任务调度的灵活性;

  4. 前置支持边(supports:标识当主干操作缺乏先决条件时所需调用的辅助动作,例如在切菜前必须先执行“拿起刀具”;

  5. 失败恢复边(recovers_with:专门从失败轨迹及后续成功补救的轨迹对中诱导得出,指示当某一操作或技能陷入异常时可以尝试的替代恢复路径。

通过这种设计,分层技能图既拥有顶层策略的抽象概括能力,又具备底层模板的精准执行约束,同时显式刻画了智能体在环境试错过程中不可或缺的容错与支持逻辑。

运行时调度:紧凑子图检索与符号状态驱动

当 Agent 进入推理阶段,面对具体的新任务描述 $q$ 与初始观测,直接将整个全局技能图输入大模型不仅在上下文窗口上难以承受,还会引入巨大的决策噪声。HiSkill 采取了“离线构建全图、在线检索紧凑子图、运行时动态状态锚定”的渐进式推理范式。

在任务初始化阶段,系统将任务描述与初始环境观测拼接为查询文本 $x_q$。为了兼顾深层语义关联与精确关键词匹配,系统采用了混合检索机制:

\[\mathrm{score}(v \mid q) = \lambda\,\mathrm{Dense}(x_q, d_v) + (1-\lambda)\,\mathrm{Sparse}(x_q, d_v)\]

其中 Dense 计算查询与节点文本化表征之间的向量余弦相似度,Sparse 则基于 BM25 计算词法重合度。系统分别在技能节点池与 AtomicOp 节点池中独立打分,各自筛选出 Top-$K$ 个节点构成初始种子集合 $V_{\mathrm{seed}}$。

单纯依靠种子节点依然可能切断关键的执行链路。因此,HiSkill 随后执行图水化(Graph Hydration)过程。考虑到不同类型边的方向语义,系统进行一跳邻域定向扩展:对于分解边 decomposes_to,顺向拉取种子技能所分解出的所有 AtomicOp 节点;对于其他关系边,则反向汇聚能够支撑、承接或补救种子节点的相关实体。最终构成的任务子图 $G_q$ 规模紧凑,但完整保留了当前任务最可能需要的步骤链条与应对预案。

在运行时的逐步交互中,HiSkill 并不机械地遵循硬编码的工作流,而是将任务子图作为上下文约束,配合一个显式的符号任务状态 $z_t$ 进行动态推进。该符号状态记录着执行进度、当前手持物品、所在位置以及已访问实体等客观事实,在每次执行动作 $a_t$ 并获得新观测 $o_{t+1}$ 后自动更新。

整个单步决策过程呈现出精细的层次化状态机特性:

这一运行时架构有效消除了大模型在多步推理中的“悬空幻觉”,让原本不确定的自然语言自由生成,转变成在结构化图谱引导下的参数具身填充。

三大基准验证:超越基线与极低 Token 消耗

为了验证 HiSkill 的综合能力,研究团队在涵盖具身操作、网页决策和科学计算的三大标准交互环境上开展了全面测试。评测基准包括模拟家庭多步具身任务的 ALFWorld、模拟多约束真实商品搜索与采购的 WebShop,以及模拟长链条物理化学探究实验的 ScienceWorld。骨干模型主要选用 Gemini-2.5-Pro,并在附录中补充了 GPT-5.2-Codex 的交叉验证。

作为对比的基线方法涵盖了三大主流范式:一是纯提示词方案(ReAct、Reflexion);二是经验与记忆方案(ExpeL、Mem0、MemP、SimpleMem);三是前沿技能方案(Vector Skills、SkillNet、Graph of Skills / GoS)。

实验结果显示,HiSkill 在所有任务和划分集上均取得了最高的综合性能。相较于各个环境下的最强基线,HiSkill 实现了成功率平均 17.33% 的相对提升,任务得分平均 22.95% 的相对提升。在任务类型极为多样的 ALFWorld 评测中,HiSkill 在全部 6 个子任务类别中的 5 类取得了第一或并列第一的成绩;而在极度考验长程探索逻辑与复杂因果推理的 ScienceWorld 任务中,面对未经训练的全新测试集(Unseen Split),HiSkill 相比于强大的程序性记忆方案 MemP,将得分提升了 25.30%,成功率提升了 32.55%。

与纯 Prompt 方案相比,HiSkill 证明了将交互轨迹显式沉淀为离线先验的巨大价值;而与 ExpeL、Mem0 等文本记忆方案相比,HiSkill 的优势则清晰地说明:智能体需要的往往不是大段含糊的“历史经验心得”,而是能够直接拆解为具体 API 模式的结构化指导。面对同为图结构的 GoS 方案,HiSkill 依靠原子操作层的打通和多样化的类型边,打破了宏观技能无法精准落地的局限。

更为引人注目的是推断成本维度的对比。在长程智能体研究中,性能的提升往往以不断向上下文塞入冗长记忆、反思甚至几千字历史轨迹为代价,这导致推理成本呈指数级上升。HiSkill 却反其道而行之:在单任务平均推理 Token 消耗的统计中,HiSkill 在所有数据集上均取得了全场最低的消耗量。

具体数据显示,相较于各自评测中原本消耗 Token 最少的基线方法,HiSkill 在 ALFWorld 上将 Token 进一步削减了 61.10%,在 WebShop 上削减了 94.12%,在 ScienceWorld 上削减了 66.76%;若与综合实力最强的基线相比,平均 Token 缩减幅度高达 78.75%。这充分表明,分层技能图在离线阶段承担了原本需要在在线阶段由 LLM 反复消耗上下文去解析、对齐和纠偏的重任。在线检索出的子图不仅结构严密而且体积极其小巧,LLM 仅需在极短的上下文提示下完成模板参数绑定,彻底扭转了“长程智能体必然耗费海量 Token”的固有印象。

消融实验:图结构与运行机制的协同效应

为了量化 HiSkill 各项设计对最终性能的实际贡献,研究团队实施了系统性的消融实验与交叉组件迁移测试。

当从图中剥离 AtomicOp 节点、仅保留高层技能作为检索与调度单位时(w/o Atom.),模型在所有基准上的成功率均出现了直观的滑落。这直接证实了文章的核心假设:单靠高层自然语言策略,大模型在复杂环境中依然难以稳定推断出具体的环境动作及其实参。而当进一步移除所有类型边、仅将节点作为孤立词条处理时(w/o Edge),性能同样出现显著衰减,说明关系边所蕴含的时序与因果结构是构成连贯执行路径的关键。

在运行时模块层面,去除支持与恢复边(w/o Sup./Rec.)会使智能体在面对意外阻碍或前置条件缺失时频频报错陷入僵局;而一旦去掉符号任务状态(w/o State),技能的适时切换和 AtomicOp 的按需推进就会失去动态现实依据,进而引发逻辑退化。

此外,研究人员还对比了两种极端的子图使用模式:一是将检索出的子图作为完全静态的硬编码脚本直接执行(Static Subgraph),不给大模型留出动态调整余地;二是不引入图执行机制,仅将 Top-$K$ 技能文本直接塞入 Prompt(Top-$K$ Prompt)。两者的表现均明显落后于完整的 HiSkill。这表明,分层技能图的定位既不是死板固化的流水线,也不是任由模型自由发挥的松散文本,而是一个富有弹性的“执行脚手架”,大模型的动态泛化与图谱的符号约束在其中缺一不可。

在交叉迁移实验中,将 HiSkill 的图结构灌入 GoS 的检索调度机制中(OurG+GoSUse),其表现大幅超越了原版 GoS,印证了分层图谱表示本身的优越性;反之,将 GoS 的图注入 HiSkill 的运行时机制(GoSG+OurUse),同样取得了明显优于原生 GoS 的结果。然而,这两类半迁移变体均未能达到完整 HiSkill 的高度,说明图谱结构的设计必须与在线调度状态机进行深度协同,才能释放出最大潜能。

超参数敏感性分析:检索权重与种子预算对成功率的影响

参数敏感性与工程取舍

在工程实践中,框架的超参数敏感度直接决定了其迁移到新场景时的调优代价。HiSkill 重点考察了两个核心超参数对验证集任务成功率的影响:一是平衡密集语义与稀疏词法的检索权重 $\lambda$,二是初始种子节点的召回预算 $K$。

实验表明,单纯依赖 Dense 向量检索($\lambda = 1$)或单纯依赖 BM25 词法检索($\lambda = 0$)均无法达到最优状态。在各类交互环境中,适度融合两者的混合检索策略($\lambda$ 在 0.25 至 0.5 之间)表现最为平稳,它既保证了对长程任务意图的语义理解,又锁定了具身操作中对具体物体名称的高精度定位。

对于种子节点预算 $K$,直觉上候选越多理应提供越充足的动作参照,但实验数据揭示了一个清晰的倒 U 型曲线。当 $K$ 从 2 增加到 6 时,任务成功率稳步爬升,表明丰富的候选节点降低了漏检关键技能的概率;但当 $K$ 进一步扩大至 8 或 10 时,WebShop 与 ScienceWorld 的表现反而出现了不同程度的下滑。这是因为过多的种子节点经图水化后会导致任务子图体积过大,引入了大量相似但不相关的干扰路径,加剧了大模型的决策噪声,同时也徒增了 Token 开销。最终研究选择 $K=6$,在候选覆盖度与上下文纯净度之间取得了极佳的工程平衡。

对智能体架构演进的启示

纵观 LLM Agent 领域的发展路径,研究范式经历了从“单步 Prompt 工程”到“外部自然语言记忆库”,再到“技能库自进化”的数次跃迁。然而,长期以来业界对 Agent 经验沉淀的理解仍普遍偏向非结构化的文本积累。许多系统在处理复杂交互时,倾向于盲目堆叠上下文长度或指望更大参数规模的模型凭借“涌现”能力自行解决参数填充与长程容错。

HiSkill 的工作为这一技术路线提供了一个具有说服力的转向信号:在多步骤交互任务中,经验的高效复用本质上是一个结构化编译问题。

通过将高层策略编译为由具身操作模板构成的分层图谱,并将脆弱易错的试错过程凝固为包含前置支持和失败恢复的类型化边,HiSkill 成功地让大模型从“全能的盲目探索者”转变为“在结构化轨道上进行敏捷微调的操作员”。这种架构不仅大幅提升了动作执行的确定性与容错能力,还直接击中了当前大模型端侧落地与长程推理中最为敏感的 Token 成本痛点。

对于未来智能体系统的演化,无论是构建更复杂的自动化具身机器人、更通用的 GUI 操作 Agent,还是支持深层次科研推理的系统,HiSkill 展现出的分层图谱建模与轻量级运行时协同理念,都提供了一套极具借鉴价值且可落地的工程范式。