AMD:分层记忆蒸馏小模型Agent,AppWorld提升27.2%p反超教师

Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

在大语言模型向自主智能体(Agent)演进的路线中,记忆系统一直被视为让模型实现“自我进化”与复杂工具调用的关键支柱。通过记录过去的成功探索、沉淀反思结论,智能体能够避免重蹈覆辙,更精准地编排 API 调用链路。然而,现有的记忆增强机制几乎完全建立在 GPT-4 等超大参数规模的闭源底座之上;一旦将这套机制直接下放到 4B 至 8B 的小型语言模型(SLM)上,系统往往会迅速失效。

ArXiv URL:https://arxiv.org/abs/2608.07169v1

小模型在独立探索复杂环境时,单任务成功率极低,导致其自身的记忆库里充斥着错误轨迹与死循环,根本没有足够的高质量经验可供提取。更棘手的是,若直接将顶级大模型(如 GPT-5 级别)生成的成功轨迹“生吞活剥”地喂给小模型,效果同样微乎其微——大模型往往只给出一句高度抽象的宏观指引,如“先登录账户再同步播放列表”,而小模型根本不具备独立补全具体登录接口参数的能力,巨大的“能力鸿沟”(Capability Gap)使其在抽象提示前彻底迷失。

AMD的提出动机、核心概念与主要性能表现

为了攻克这一难题,来自韩国科学技术院(KAIST)与 DeepAuto.ai 的研究团队提出了一种无需重新训练参数的全新框架:Agent Memory Distillation(AMD,智能体记忆蒸馏)。该方法的核心不再强求小模型在黑暗中自我摸索,而是借助强大的教师智能体,将其成功轨迹自顶向下解构成“工作流-子任务-函数”三层互补记忆,并在推理时按需注入小模型。

实验结果令人瞩目:在极具挑战的多应用调用基准 AppWorld 上,4B 至 8B 规模的学生模型平均准确率绝对提升了 27.2 个百分点,部分 4B 级别模型(如 Gemma4-E4B 达到 54.17%)甚至超越了 GPT-5-mini 教师模型本身的基准表现(50.00%)。这一成果打破了“小模型必须依赖高成本监督微调或强化学习蒸馏才能用好复杂工具”的固有认知,为端侧与轻量级智能体的实用化开辟了全新的低成本落地路径。

小模型做智能体,为何卡在“记忆”这道坎?

智能体面对现实环境中的多步交互任务,通常需要生成一连串包含动作与环境反馈的交互轨迹 $\tau = ((a_1, o_1), \dots, (a_T, o_T))$。在以往的研究中,像 Reflexion、AWM 或 MemP 这类记忆框架,大多假设底层模型本身具备及格线以上的规划与纠错能力:模型做错了,反思一下为什么错;做对了,就把经验沉淀到情境记忆(Episodic Memory)或程序记忆(Procedural Memory)中。

但把这套逻辑搬到 4B 或 8B 模型身上时,现实却极为残酷。

一方面,小模型的基础推理和指令遵循能力薄弱,面对复杂 API 环境时零样本探索成功率往往跌至 10% 到 20% 以下。这意味着记忆库中绝大部分内容都是失败记录,模型在缺乏正向样本参照的情况下,即便进行反思也极易陷入伪归因,甚至把错误的调用模式当成经验不断固化。

另一方面,很多研究者自然会想到引入“教师大模型”来跑出成功轨迹。但实验证明,朴素的记忆迁移几乎没有带来增益。传统知识蒸馏中存在的“能力鸿沟”,在智能体交互场景中被进一步放大。大模型写出的经验通常停留在宏观策略层面(Task-level Workflow),例如“查询订单、计算差价、执行退款”。这种高层次抽象对于参数充沛的模型而言是极佳的提示,但对小模型而言却是无法执行的空中楼阁。小模型不仅缺乏从抽象步骤映射到精确代码实现的上下文学习(In-Context Learning)能力,还会因为过长的反思文本消耗宝贵的上下文窗口,最终在细节参数配置或异常处理上频频崩溃。

直接微调小模型的参数(如 SAD 或 SCoRe 等蒸馏方案)虽然可行,但不仅需要收集海量轨迹并耗费昂贵的计算集群,还会导致模型丧失在通用任务上的灵活性。AMD 的出发点正是:在完全不更新小模型权重的无训练(Training-free)前提下,怎样重构教师模型的记忆形态,才能让“消化不良”的小模型真正把大模型的经验转化为执行力?

三层分层记忆架构:从宏观蓝图到微观避坑

AMD 的解法体现了对小模型认知边界的深刻拆解。它摒弃了将教师轨迹视为单一扁平文本的旧做法,提出将教师智能体的成功轨迹集合 $\mathcal{D}^T_+$ 结构化提炼为三种粒度互补的记忆模块:工作流记忆(Workflow Memory)、子任务记忆(Subtask Memory)与函数记忆(Function Memory)。

AMD的分层记忆构建与双阶段注入机制

首先是处于最顶层的工作流记忆 $\mathcal{M}^{wf}$。它负责为任务确立全局战略蓝图。教师模型解析成功轨迹后,会生成一段结构化的自然语言描述,涵盖该类任务涉及的核心工具集、必要的前提条件、关键分支决策规则,以及必须规避的典型失败陷阱。为了保证泛化性,AMD 在这一层对具体运行时的动态值进行了严格的类型占位符抽象,将诸如具体账户 ID、文件路径、敏感密码等替换为 <ID><FILE_PATH> 等格式。当小模型接收到新任务指令时,工作流记忆通过稠密向量检索,以最高相似度前摄性地注入到系统提示词中,帮助小模型在一开始就建立起清晰的高阶计划,知道先做什么、后做什么。

其次是处于中间层的子任务记忆 $\mathcal{M}^{st}$。这是整个 AMD 框架中最为核心、也是后续实验证明贡献最大的“桥梁”。宏观工作流解决了“做什么”,但小模型常常倒在“具体怎么做”的每一步骤上。AMD 利用教师模型将一条完整的长交互轨迹切分为若干个语义自洽的子任务片段 ${e_{i, 1}, \dots, e_{i, K_i}}$,比如“调用认证接口获取 Token”或“遍历未读邮件并提取验证码”。每一个子任务记忆条目不仅包含简短的意图描述与标签,更直接打包了教师模型在该步骤执行时的具体代码块及对应的环境返回观测。小模型在分解任务后,针对每个子任务独立检索最匹配的执行代码样例。这相当于直接为小模型提供了局部的 Few-shot 代码范本,将抽象的规划动作具象化为清晰可套用的 API 调用链。

最后是位于底层的函数记忆 $\mathcal{M}^{fn}$。如果在执行过程中仍然发生 API 报错怎么办?小模型往往缺乏在大段错误日志中定位 Bug 并自我修正的能力。函数记忆直接以具体函数名称为索引,存储了该函数在教师轨迹中的正确调用实例、上下文约束、返回格式解析以及官方 API 文档模式。这一层知识并不在初始阶段填入上下文,而是作为一种防御性资产静默待命。

双阶段协同注入:前摄规划与响应式排错

构建出高质量的分层记忆只是第一步,如何将其优雅地送入小模型有限且脆弱的上下文窗口,是 AMD 的另一大技术看点。AMD 采取了“前摄性注入(Proactive Injection)”与“响应式检索(Reactive Injection)”相结合的双轨策略。

在任务刚启动的零时刻,小模型需要的是方向感和参照系。此时系统执行前摄性注入:系统利用任务指令检索出 Top-1 的工作流记忆,放在系统提示的最前部,框定任务骨架;随后,小模型在工作流指引下,将当前任务分解出至多 6 个按序执行的子任务标签。系统以这些标签为独立 Query,在子任务记忆库中进行去重检索,将最相关的真实代码交互范例直接拼接进系统提示。至此,小模型在尚未发出第一个动作前,脑中既有了大局观,手中又有了具体的代码示例。

而在执行过程中,AMD 遵循极简原则,坚决不向上下文追加无关信息,防止上下文膨胀压垮小模型的注意力。只有当智能体在与环境交互中触发了工具调用报错(Tool-calling Error)时,响应式机制才被激活。系统提取报错信息中的函数名称,在函数记忆库 $\mathcal{M}^{fn}$ 中瞬间完成名称定位,并通过计算当前任务指令与备选记录中推理链的余弦相似度进行重排,挑选出最契合当前情境的正确调用范本。该范本被封装为一个轻量级的“Hint Block”(提示块),直接追加到错误返回信息之后。这种即时点拨机制,使得小模型在遇到参数类型不匹配、必填字段缺失或权限异常时,无需凭空猜测,只需参照大模型的正确示范即可在下一轮交互中精准自愈。

实验评测:全线大幅提升,4B模型逆袭反超

为了全面验证 AMD 的通用性,研究团队选用了 Qwen3-4B、Qwen3-8B、Gemma4-E4B 和 Llama3.1-8B 四款极具代表性的小型开源模型作为学生,以 GPT-5-mini 作为教师,在三大多轮工具调用基准上展开了严格测试。

在最为硬核的多应用协同基准 AppWorld 上,智能体必须在模拟的真实手机与 Web 环境中编写 Python 代码,调用覆盖邮件、聊天、支付等多个服务接口,并由后端数据库单元测试判定最终状态是否达标。在这一高难度场景中,四个学生模型的零样本(Zero-shot)平均准确率仅有 16.52%。引入扁平化反思记忆的 ReasoningBank 反而让 Qwen3-4B 的准确率从 14.88% 跌落至 10.71%,程序记忆框架 MemP 与子任务检索框架 SASM 的表现也极不稳定。原因显而易见:未经分层剪裁的长篇反思文本对小模型构成了严重的认知过载和注意力干扰。

而搭载 AMD 之后,四个小模型的平均准确率跃升至 43.75%,实现了 27.2 个百分点的惊人绝对增幅。尤为震撼的是个体模型的表现:Gemma4-E4B 凭借 AMD 取得了 54.17% 的准确率,Qwen3-8B 达到了 51.79%,双双超越了教师模型 GPT-5-mini 本身的水平(50.00%);即便是参数最小的 Qwen3-4B,准确率也直接从 14.88% 飙升至 49.40%,逼平了教师模型。在另外两个基准中,AMD 同样展现了统治力:在多轮精确参数传递基准 BFCL V3 上,平均绝对提升 11.2 个百分点,且三款学生模型的综合表现超越了教师;在依赖复杂世界状态同步的 ToolSandbox 基准上,AMD 同样取得了稳健的正向提升。

小模型超越教师模型,是否意味着数据泄露或死记硬背?深入分析表明,学生模型并不是在机械地逐字复刻教师的轨迹。在 AppWorld 和 BFCL V3 这样解空间宽广的环境中,教师提供的子任务代码与工作流本质上是一种“解题思路与范例元语”。学生模型在自身固有的归纳偏置(Inductive Bias)驱动下,将这些分层知识重新实例化,往往走出了比教师探索期更简洁、甚至避开了教师某些冗余步骤的最优路径。

这一点在交互轮数(Interaction Turns)的统计上表现得尤为明显。在零样本状态下,缺乏先验的小模型在 AppWorld 中像无头苍蝇一样疯狂试错,Qwen3-4B 平均需要交互 23.8 轮才能结束任务(且大多以失败告终);而 GPT-5-mini 教师模型仅需 10.1 轮。当接入 AMD 后,Qwen3-4B 的交互轮数被迅速压缩至 14.9 轮,Gemma4-E4B 更是降至 7.2 轮。AMD 不仅教会了小模型“如何做对”,还教会了小模型“如何高效地做对”,使其行动模式向高水平智能体高度收敛。

为什么是子任务记忆?深层机制与消融分析

为了弄清各个组件究竟在系统内部扮演了怎样的角色,研究团队开展了详尽的消融与参数分析,挖掘出若干对智能体系统设计极具指导意义的核心发现。

在记忆类型的消融实验中,如果将工作流(WF)、子任务(ST)和函数(FN)三种记忆逐一剥离,可以发现子任务记忆对整体性能的贡献占据了绝对统治地位。当仅保留子任务记忆时,模型依然能保留大部分增益;而一旦剔除子任务记忆,整体成功率便发生断崖式下跌。这证明了智能体任务的核心瓶颈并不在于高高在上的顶层规划,也不单纯在于单个 API 的语法细节,而恰恰在于由若干个 API 组合而成的“局部业务逻辑块”。小模型最渴求的,正是这种将意图转化为连续可执行代码的中等粒度先验。

另一个极其反直觉却至关重要的发现来自检索数量 $k$ 的调节。在传统 RAG 或向量召回系统中,从业者往往倾向于召回 Top-3 或 Top-5 个范例以保证信息覆盖面。然而在 AMD 的实验中,无论是工作流、子任务还是函数记忆,检索数量 $k=1$ 几乎都是性能的全局最优解

随着子任务检索数量从 1 逐渐增加到 5,Qwen3-4B 在 AppWorld 上的表现呈现出单调断崖式下跌,准确率从 49.40% 直接滑落至 33.34%。这一现象深刻揭示了小模型的本质缺陷:小模型的注意力机制非常脆弱,上下文抗噪能力极差。一旦向提示词中注入排在后面的弱相关示例,不仅无法提供补充信息,反而会直接分散模型对核心逻辑的注意力,诱发严重的代码幻觉。这表明在面向小模型的记忆设计中,“高精度、单点突破”的强确定性提示,远比“大而全”的多路召回更为致命和关键。

此外,记忆的表达载体同样存在明确的分工定律。研究团队对比了“纯自然语言文本”与“代码优先(Code-centric)”两种记忆表征形式:

教师选择与模型规模:能力对齐的微妙平衡

在探讨知识蒸馏时,通常的共识是“教师越强,学生越好”。但在基于记忆的非参数迁移中,AMD 揭示了一种更为复杂的动态机制:迁移效果既取决于教师的绝对能力,也取决于教师与学生之间的“认知兼容性”。

当使用能力更强的 Qwen3-8B 作为学生时,规律完全符合直觉:教师的准确率越高,学生最终获得的表现越好。从 Qwen3-32B(教师 34.42%,学生 39.29%)、GPT-5-mini(教师 50.00%,学生 51.79%)、DeepSeek V4 Pro(教师 81.55%,学生 57.14%)一路攀升至 GPT-5.5(教师 91.08%,学生 58.93%)。更强大的教师贡献了海量高质量且无冗余的成功轨迹,为 8B 模型提供了极佳的知识养料。

然而,当面对参数规模更小、理解能力更弱的 Qwen3-4B 学生时,这一规律却被打破了。GPT-5-mini 作为教师时,Qwen3-4B 拿到了最高的 49.40% 准确率;而面对更强大的 DeepSeek V4 Pro 教师时,Qwen3-4B 的准确率反而骤降至 38.10%。究其原因,超大模型在解决极端复杂问题时,常常使用极其凝练、高度跳跃或采用了小模型极不熟悉的高级语法特性,导致生成的代码模式与 4B 模型的底层先验出现排异反应。在为更轻量的模型选择记忆源头时,一味追求极致的教师能力未必能取得最佳效果,契合学生理解能力的“阶梯式教师”往往才是更优的选择。

从学生模型本身的尺寸来看,AMD 在 4B 级别模型上展现出了最为陡峭的增益斜率。随着模型尺寸从 4B 扩大到 8B,基线零样本能力随之上升,记忆蒸馏带来的边际绝对增幅会自然趋于平缓。这一特征精准契合了当下端侧部署的痛点需求——它让原本在 Agent 领域几乎被判定为“不可用”的极小规模模型,无需高昂的重新训练成本,凭借外置分层记忆库,便能瞬间具备匹敌中大型闭源模型的实际生产力。

总结与展望

Agent Memory Distillation(AMD)的研究为智能体记忆系统的演化提供了全新的视角。它证明了小模型在复杂工具调用场景中的溃败,很大程度上并非其绝对代码生成能力的不足,而是缺乏结构化、可落地的经验调用范式。

通过将强大的教师智能体经验解构成“指导宏观规划的工作流”、“提供局部代码模版的子任务”以及“负责被动容错的函数库”,并在推理侧精准实施前摄规划与响应自愈,AMD 以一种极度轻量化、完全免训练的方式,填平了大小模型之间原本难以逾越的能力代沟。在计算资源受限、数据隐私敏感的边缘计算与私有化交付场景中,这种通过分层外置记忆来赋能轻量级模型的技术架构,无疑为未来实用化 Agent 的规模化落地提供了极具启发性的工程蓝本。