HyperSkill:用超图重构智能体记忆,复杂任务最高提升11.5分

HyperSkill: Self-Evolving LLM Agents via Hypergraph-Structured Skill Memory

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

HyperSkill:用超图重构智能体记忆,复杂任务最高提升11.5分 论文图示

随着大语言模型智能体(LLM Agent)逐步进入长程网页导航、多步骤科学推理以及真实操作系统的交互场景,仅仅依靠单次上下文窗口已经无法胜任复杂的工作流。为了让智能体不至于“每次面对新任务都从零开始”,社区开始广泛引入经验记忆(Experiential Memory)机制,试图把智能体在过去交互轨迹中踩过的坑、积累的步骤,沉淀为可复用的知识。

ArXiv URL:https://arxiv.org/abs/2608.16114v1

然而,现存的经验记忆方案普遍存在一个严重的结构性缺陷:它们要么把完整的历史轨迹打包成扁平文本,要么简单提取零散的技能(Skill)或反思(Insight)存入向量数据库。这种设计切断了“子任务分解”与“执行技能”之间的组合关系,导致智能体检索时只能依赖泛化的语义相似度,不仅难以应对表面提问不同但底层解题逻辑相通的任务,更经常因为错误记忆的无序累积而引发性能倒挂。

针对这一瓶颈,来自西北大学、伊利诺伊大学芝加哥分校与南加州大学的研究团队提出了 HyperSkill。该框架将智能体的经验记忆形式化为一个超图(Hypergraph),用超边把单次轨迹中的子任务序列、可复用技能与反思教训强绑定在一起,并通过子任务与轨迹级双路检索及基于高阶拓扑的记忆演化,实现了记忆的高效复用与自进化。在 GAIA、WebWalkerQA 和 xBench 三大高难度智能体基准上,HyperSkill 显著超越了 10 种主流记忆机制,在开源模型 Qwen3-30B-A3B 上最高取得了 +11.51 的任务成功率增长,同时大幅压低了调用步数与 Token 开销。

经验记忆系统的三大设计维度

现有经验记忆的“三维困境”与结构性根源

要理解 HyperSkill 的创新之处,必须先回到经验记忆系统的本质问题。一个合格的自进化智能体记忆系统,必然要同时回答好三个核心问题:记忆到底该存什么、怎么组织与检索、以及如何随时间演进。

现存方案往往只能给出局部的解答。在“存什么”的维度上,早期的方案倾向于保留原始交互轨迹,这种方式虽然保留了上下文,却夹杂了巨量的执行噪声与冗余交互;后来的方案转向提炼抽象的工作流或推理策略,这固然增强了通用性,却丢弃了具体的程序化细节;最近的一些工作尝试抽取原子技能,但又把每个技能孤立看待,彻底丢掉了任务本身的组合分解结构。

在“怎么组织与检索”的维度上,绝大多数系统依赖扁平的向量数据库或 JSON 文件,仅靠任务描述与记忆条目之间的 Embedding 相似度来进行检索。即便少数系统引入了图结构,也局限于普通的成对二元边(Pairwise Edge),无法直接表达一条轨迹中多个子任务、多个工具技能以及最终成败之间的高阶多元关系($n$-ary association)。当一个新任务的文字描述与历史任务完全不同,但其内部第二步、第三步的子任务流程高度一致时,单纯的语义向量检索几乎必然漏检。

在“如何演进”的维度上,多数系统采取无节制的被动堆积策略。随着运行任务的增多,历史库中充斥着过时、低质甚至曾经导致失败的执行片段。少数加入了修剪或去重机制的系统,也仅仅是在单条记忆层面做局部的余弦相似度过滤,缺乏结合全局图拓扑结构和执行质量信号的动态维护手段。

这三个维度的脱节,根源在于传统数据结构表达力的匮乏:一条解决问题的智能体轨迹,天然就是一个由多个子任务节点、技能节点和结果反馈交织而成的高阶超图单元,用扁平列表或普通二元图来存储,必然会发生严重的信息折损。

核心架构:以超图为底座的技能记忆

HyperSkill 彻底抛弃了扁平存储的假设,将外部记忆显式建模为一个超图 $\mathcal{G} = (\mathcal{V}, \mathcal{E})$。超图相比普通图的最大不同,在于一条超边(Hyperedge)可以同时连接两个以上的任意数量节点,这恰好与一条执行轨迹天然契合。

HyperSkill 整体架构图

在 HyperSkill 的记忆图谱中,节点集合 $\mathcal{V}$ 被划分为两类:子任务节点 $\mathcal{V}_u$ 和技能节点 $\mathcal{V}_s$。每一个节点 $v_i$ 包含其具体内容 $c_i$、节点类型标签 $\ell_i \in {\texttt{u}, \texttt{s}}$,以及一个动态更新的效用评分 $\gamma_i$。该效用评分综合考量了该节点被引用的成功率与平均执行耗时:

\[\gamma(\cdot) = \beta \cdot \frac{\sigma(\cdot)}{\nu(\cdot)} + (1 - \beta) \cdot \left(1 - \frac{\bar{T}(\cdot) - T_{\min}}{T_{\max} - T_{\min}}\right)\]

其中 $\sigma(\cdot)$ 为该节点参与并成功的任务数,$\nu(\cdot)$ 为总调用次数,$\bar{T}(\cdot)$ 为平均消耗步数。这意味着一个既能保证成功率又能缩短推理步数的技能,将获得更高的效用权重。

超图中的每一条超边 $e_j \in \mathcal{E}$,则直接对应智能体过去经历的一条完整轨迹 $\tau_j$。该超边绑定了该轨迹所涉及的所有子任务节点集合 $V_j^u$ 与技能节点集合 $V_j^s$,并附带原始任务描述 $d_j$ 以及由大模型从该次轨迹中提炼出的反思性经验 $\ell_j$。为了兼顾表面文字匹配与底层经验泛化,超边的向量表征 $\mathbf{h}_e = \boldsymbol{\phi}(d_j \,|\, \ell_j)$ 将原始任务描述与蒸馏出的经验串联编码。不同轨迹中通用的技能节点被共享挂载在不同的超边上,使得整个超图自然形成了程序化知识复用的网络。

双路检索与共现排序:如何精准捞出解题套路

当智能体接收到一个全新的目标任务 $d_q$ 时,HyperSkill 并不直接去向量库里泛泛地寻找最相似的历史问题,而是执行一种“从子任务到轨迹、再从轨迹到技能”的两级检索逻辑。

在第一阶段,智能体首先借助自身策略将当前输入任务初步拆解为一组子任务序列 $\mathcal{P}0$。此时系统开启双路检索:第一路是子任务级检索,将拆解出的子任务向量与记忆库中的历史子任务节点 $\mathcal{V}_u$ 计算相似度,找出最匹配的历史子任务,并顺藤摸瓜定位到包含这些子任务的历史超边集合 $\mathcal{E}{\mathrm{sub}}$;第二路是轨迹级检索,直接使用全局任务描述匹配历史超边,得到语义相似的超边集合 $\mathcal{E}_{\mathrm{traj}}$。

这两路超边的并集 $\mathcal{E}^* = \mathcal{E}{\mathrm{sub}} \cup \mathcal{E}{\mathrm{traj}}$ 构成了一个高相关的候选经验子图。子任务路负责捕捉“表面看起来八竿子打不着、但底层办事流程一致”的深层结构经验,而轨迹路则负责兜底捕捉高层语义相近的常规经验。

在第二阶段,系统从候选超边集中提取所有相关的候选技能集合 $R_s$。以往系统往往在这个阶段又退回到简单的向量匹配,但 HyperSkill 充分利用了超图的共现特性:它统计每个候选技能 $v \in R_s$ 在检索到的相关超边集 $\mathcal{E}^*$ 中出现的频次 $\kappa(v)$:

\[\kappa(v) = \bigl\vert{}\{\,e \in \mathcal{E}^* \mid v \in V_e\,\}\bigr\vert{}\]

这个频次 $\kappa(v)$ 构成了一个极其强烈的结构性信号:如果某个技能被多条成功解题的超边反复引用,即使它的文字表述与新任务相隔甚远,它也是解决此类子任务模式的核心套路。系统截取共现频次最高的 Top-$k_s$ 个技能,连同从候选超边中提炼的经验教训 $\mathcal{L}_q$,共同注入到当前智能体的提示词中引导执行。

任务执行结束后,大模型会分析本次交互轨迹,抽取出新产生的技能节点与反思教训。在插入新技能节点前,系统先通过语义去重合并邻近项;随后构建一条新的超边连接本任务的子任务与技能,并基于最终执行结果更新相关节点的效用评分 $\gamma$。

结构感知演化:让记忆越用越精炼

如果仅仅依靠存入与检索,随着任务量的持续激增,记忆超图必然会逐渐臃肿。更危险的是,某些曾经误导过智能体的错误模式如果长期停留在库中,会在检索阶段形成记忆污染。

HyperSkill 每隔固定数量的任务周期($N_{\mathrm{maint}}$),就会启动一次全局的结构感知记忆维护。这一过程主要由两个互补的算子驱动:

第一个算子是质量驱动的剪枝(Quality-Driven Pruning)。对于访问频次已达到统计显著门槛($\nu(v) \geq N_{\min}$)但效用评分持续低于阈值 $\tau_{\mathrm{prune}}$ 的边缘节点,系统会判定其为容易导致误导的劣质资产,直接从超图节点库中予以物理剔除。

第二个算子是结构感知的合并(Structure-Informed Merging)。很多在不同任务中提炼出来的技能节点,其字面表述可能略有差异,但由于它们反复协同出现在相同的子任务拓扑上下文中,实质上代表的是同一类通用能力。普通的向量去重很难准确识别这种高层语义同义性,HyperSkill 借助图上的质量加权随机游走传播来融合拓扑关系与质量信号。

系统首先根据节点间的共现超边规模与效用极小值构建出加权拓扑矩阵 $W_{ij}$,通过对归一化拉普拉斯算子实施多跳传播,将节点的原始语义向量映射为融合了局部图拓扑与质量属性的平滑表征 $\tilde{\mathbf{Z}}$。当两个技能节点在平滑空间中的相似度超过阈值时,系统判定它们在系统流程中承担相同功能,进而执行节点合并。这种依靠图上传播的去重策略,不仅能够压减冗余节点数量,还能自动让高质节点的经验逐步吸收并覆盖长尾低质节点的特征。

实验评测:在全面胜出的同时压低推理代价

为了验证 HyperSkill 的实用价值,作者在包含工具调用、网页交互与多步骤长程推理的三个经典基准上进行了全面评测:涵盖多任务规划的 xBench、需要复杂多模态工具协同与网络检索的 GAIA,以及高度依赖开放网页环境漫游的 WebWalkerQA。实验选用了闭源的 GPT-4o 以及开源轻量化但长文本能力优秀的 Qwen3-30B-A3B 作为底座模型,对比了包括 ExpeL、Voyager、ReasoningBank、PlugMem 等在内的 10 个代表性智能体记忆基线。

从任务成功率(Success Rate, SR)来看,HyperSkill 几乎在所有基准和底座的排列组合中均位居榜首。在 GPT-4o 上,HyperSkill 在 xBench、GAIA 和 WebWalkerQA 上相较于次优基线分别取得了 +3.00、+2.30 和 +0.59 的绝对百分点提升。而在参数规模相对较小的开源模型 Qwen3-30B-A3B 上,HyperSkill 展现出的增益更为惊人:相较于不带任何记忆模块的原始智能体(No Memory),HyperSkill 在 xBench 上提升了 6.00 个百分点,在 GAIA 上暴涨 4.85 个百分点,而在结构极其复杂的 WebWalkerQA 上,成功率直接实现了 +11.18 的跃升。这充分证明了超图结构带来的程序性经验复用,对开源模型的规划短板具有极强的补强效果。

更为关键的一个发现是记忆带来的执行开销对比。在智能体系统中,单纯提高准确率是不够的;如果为了检索经验而在提示词中注入大量无用上下文,往往会导致推理步数冗长、工具滥用、甚至让智能体陷入死循环。

实验数据显示,在 GPT-4o 运行 xBench 的测试中,HyperSkill 取得最高成功率的同时,平均任务步数仅为 5.27 步,工具调用仅 6.52 次,与轻量级的 ExpeL 并列为步数最少的系统。反观 Voyager 和 ReasoningBank 等基线,其平均步数高达 8.22 步,工具调用膨胀至 12.27 次,成功率却明显落后。许多朴素的记忆系统由于缺乏结构剪枝,反而出现了“负迁移”:Voyager 在 GPT-4o 的 xBench 上比无记忆基线倒退了 7 个百分点,Cheatsheet 在 Qwen3-30B 上倒退了 9 个百分点。这一对比明确证明了:没有高阶结构过滤的低质记忆积累,对智能体是毒药而非补品。

在综合考虑任务性能与平均消耗 Token 量(K Tokens)的“性能/Token比”分析中,HyperSkill 在所有基准中均稳居最优区域。虽然如 PlugMem 等系统也尝试了图结构,但由于在轨迹运行中需要反复多轮调用大语言模型去标注状态转移、子目标和即时奖励,其 Token 消耗量极度膨胀,综合效率远逊于 HyperSkill 这种通过超边自然隐式捆绑并在周期阶段统一维护的机制。

消融与拓扑分析:超图结构到底带来了什么?

为了剥离超图设计中各模块的实际贡献,研究团队针对超边检索路径、图演化以及图拓扑进行了针对性消融实验。

当剥离双路检索中的“子任务检索路径”时,系统在各基准上的成功率均出现了直线下跌,这证明仅仅使用高层任务文本进行匹配,确实会漏掉大量跨场景、跨领域的程序执行共性。而当完全移除超图拓扑结构、将技能节点降维回普通的成对图或向量数据库时,不仅检索命中率明显下降,后期记忆库去重合并的精度也大幅滑坡。

对 xBench 形成的超图进行局部子图可视化,可以直观看到 HyperSkill 的运转机制:在真实轨迹形成的超图里,子任务节点多与具体问题高度特异性绑定,分布在网络外围;而诸如“跨信源验证”(Cross-Source Validation)和“定向数据库排查”(Targeted Database Search)等技能节点,则作为高阶枢纽被多条成功的超边共同锚定。更值得注意的是,那些来自失败轨迹的超边,会将“过早做实体假设”(Premature Entity Assumption)等典型错误模式归拢为反面技能簇。当后续任务分解出类似易错的子任务流时,系统会自发将这些负面教训作为警戒上下文提供给智能体,真正实现了从失败轨迹中吸取教训。

局限与未来演进

尽管 HyperSkill 在多个复杂场景下展现出了优异的自演化潜力,但该方案目前仍存在必须正视的工程权衡。

HyperSkill 在新任务接入时的子任务解构、轨迹结束后的经验技能提取,以及周期性记忆合并决策中,仍依赖额外的 LLM 推理调用,这带来了一定的离线计算开销。其次,超图共现机制的核心优势建立在“拥有足够数量的探索轨迹”这一前提之上;当系统处于极低样本冷启动阶段、记忆超图极度稀疏时,高阶拓扑信号能提供的收益相对有限。未来如何将这类超图记忆与模型内部权重参数的持续微调(Continual Fine-Tuning)深度融合,让智能体不仅在外部图数据库中沉淀技能,还能将超边知识内化为核心参数能力,将是通往终身学习智能体极具价值的演进路径。