不是经验越多就越聪明:PATH-Bench揭示终身智能体的路径依赖困境
PATH-Bench: Path-Dependent Evaluation of Lifelong Agents
让大语言模型(LLM)具备“终身学习”(Lifelong Learning)能力,是迈向自主智能体的必经之路。在绝大多数实际落地场景中,频繁全量微调大模型的参数既昂贵又容易导致灾难性遗忘,业界普遍选择“冻结骨干模型、外挂学习状态”的路线:通过 Agent 外挂支架(Agent Harness)维护外部知识库、检索式记忆(Memory)或可复用代码技能库(Skill),让智能体在与环境的持续交互中动态累积经验。
ArXiv URL:https://arxiv.org/abs/2608.01149
然而,这种机制潜藏着一个长期被学术界忽视的漏洞——经验的积累具有强烈的“路径依赖性”(Path Dependence)。同一个智能体在面对同一批任务时,仅仅因为任务出现的先后次序不同、中途遭遇了干扰信息或是劣质反馈,其最终表现就可能天差地别,甚至在基准测试中的相对排名都会发生逆转。现有基准测试通常采用固定序列或随机打乱顺序,既无法解释先验经历如何塑造后续能力,也无法精确度量智能体在长程交互中的知识迁移与遗忘规律。
针对这一评估盲区,来自学术界的最新研究提出了首个专门用于受控评估终身智能体路径依赖特性的评测框架 PATH-Bench。该框架利用多模型上下文学习(ICL)预先估计任务之间的有向迁移关系,构建以固定“探针任务”(Probe Task)为核心的受控历史序列,高效追踪智能体的平均性能、前向迁移、后向迁移与遗忘程度。基于对八类代表性终身智能体的深度评测,研究团队进一步提出了“选择性经验使用”(Selective Experience Use, SEU)策略,使智能体能够在推理阶段动态过滤与抽象历史经验,在多个基准上将遗忘率最高降低了 16.84 个百分点。

顺序一变,榜单洗牌:终身学习中的路径依赖困境
传统深度学习评测往往假设样本之间满足独立同分布(I.I.D.),但在终身智能体语境下,该假设彻底失效。智能体在时刻 $t$ 的决策,严格取决于此前遭遇的有序交互历史 $H = (t_1, t_2, \dots, t_{t-1})$。外部学习状态(无论是向量数据库中的交互片段、工作流图谱还是代码技能库)会随着历史任务的推移不断更新。
如果前序任务注入了高质量、可迁移的策略,智能体能展现出显著的正向迁移;但如果历史任务中充斥着误导性记忆、过时的工作流或产生逻辑冲突的代码片段,这种负面经验就会在外置状态中持久驻留,对后续看似无关的任务产生干扰。
研究人员在现有代表性终身智能体基准 LifelongAgentBench 上进行了一项概念验证实验。他们保持测试任务集合完全一致,仅仅改变任务输入的先后路径,便观察到了剧烈的性能震荡。如图 1 所示,从路径 1 切换到路径 2 时,不同智能体在平均性能(AP)、前向迁移(FWT)、后向迁移(BWT)以及遗忘率(FGT)上的相对排名发生了实质性洗牌。一个在路径 1 下名列前茅的系统,换一条路径可能迅速滑落至垫底。
这就引出了评测方法学上的重大挑战:若想完整刻画智能体的路径依赖,传统终身学习评估要求在每一个新任务处理后,都要对历史上所有任务进行全量重测。然而,大模型智能体的单次任务执行动辄涉及多轮环境交互、外部工具调用与反思循环,计算开销极其庞大。在庞大的任务组合空间中,穷举所有路径在计算上完全不可行,而完全随机采样又无法提供受控的因果归因。

PATH-Bench 的破局设计:有向关系矩阵与单探针纵向追踪
为了打破组合爆炸与评测成本的死锁,PATH-Bench 提出了两项核心机制创新:以基于多模型的有向关系估计替代经验盲测,以“纵向单探针追踪”替代全量任务回溯。
整个评测框架的构建流程分为三个严密的阶段:
1. 任务筛选与有效裕度(Headroom)控制
评测选用了两套交互范式截然不同的公开基准:代码生成任务采用单轮交互但逻辑复杂的 BigCodeBench,评估智能体在复杂指令和多样化函数调用下的代码编写能力;工具调用任务采用多轮交互、面向复杂长程规划的 WildToolBench,评估智能体跨工具分解与解决子任务的比例。为了确保终身学习系统有足够的进步空间,框架引入了持续学习领域的“裕度原则”(Headroom Principle),剔除了强基座模型在零样本下已完全饱和或无法提供任何观测信号的任务,最终在两个基准中各筛选出 $D = 120$ 个具有充分学习空间的评估任务池。
2. 多模型上下文学习构建有向迁移增益矩阵
任务 $t_i$ 的先验经验是否对任务 $t_j$ 有益,本质上是一个有向关系。PATH-Bench 通过度量在上下文包含 $t_i$ 的示例时,模型在 $t_j$ 上的表现相较于零样本基线的变化:
\[M_{i,j} = S(t_j \mid t_i) - S(t_j \mid \varnothing)\]为了消除单一模型作为评估者的偏置,研究团队联合引入了 DeepSeek-V4-Flash、GPT-5.4-mini 和 GLM-5.0 三个异构主流大模型,每个模型独立在 5 个随机种子下测算增益矩阵 $\mathbf{M} \in \mathbb{R}^{D \times D}$。各模型根据自身增益的正负进行投票(正增益、中性、负增益),只有当至少两个模型达成共识时,才确定两任务间的最终关系标签 $V_{i,j}$;分歧过大的组合则被标记为混合样本并从采样池中剔除。
3. 探针中心序列生成与多维动力学度量
获得有向转移矩阵后,PATH-Bench 可以按需合成具有确定转移倾向的序列。评测协议首先选定一个目标任务作为探针任务 $T_{\mathrm{probe}} = t_j$,依据矩阵将其余任务划分为正向、中性与负向迁移集合。系统随后构建包含受控比例的干预任务序列,并将 $T_{\mathrm{probe}}$ 周期性地重新插入到历史流中。
需要强调的是,只有中途穿插的干预任务才会触发智能体外置状态的写入与更新;多次重复出现的探针任务仅用于评估当前状态下的表现,不沉淀任何新记忆。通过监测同一个探针在不同历史厚度下的得分轨迹,PATH-Bench 能够以极低的推理代价解耦出多项终身学习经典指标:
-
平均性能(Average Performance, AP):衡量序列上所有执行任务的综合准确率:
\[\text{AP} = \frac{1}{L}\sum_{\ell=1}^{L}p_{\ell}\] -
前向迁移(Forward Transfer, FWT):度量热身阶段之后,探针任务在经历各种干预历史后的平均表现相对于初始“冷启动”表现 $p_{\mathrm{cold}}$ 的提升幅度:
\[\text{FWT} = \frac{1}{n-2}\sum_{i=3}^{n}(p_i^{\mathrm{probe}} - p_{\mathrm{cold}})\] -
后向迁移(Backward Transfer, BWT):度量在积累更多经验后,探针表现超越“刚热身完的基准点” $p_{\mathrm{warm}}$ 的正向强化总量:
\[\text{BWT} = \frac{1}{n-2}\sum_{i=3}^{n}\max\bigl(0,\, p_i^{\mathrm{probe}} - p_{\mathrm{warm}}\bigr)\] -
遗忘程度(Forgetting, FGT):度量后续介入经验导致探针能力低于热身基线 $p_{\mathrm{warm}}$ 的衰退滑坡:
\[\text{FGT} = \frac{1}{n-2}\sum_{i=3}^{n}\max\bigl(0,\, p_{\mathrm{warm}} - p_i^{\mathrm{probe}}\bigr)\]
经验的双刃剑:来自八大智能体的实测启示
在评测实验中,研究团队以统一的 DeepSeek-V4-Flash 作为底层推理模型,横向对比了业内涵盖检索增强生成(如通用 RAG、HippoRAG-v2)、智能体记忆系统(如 Mem0、AWM)以及可复用技能库(如 AutoSkill、SkillClaw)等 8 种代表性终身智能体架构。在控制正向主导(70% 正向迁移任务)与负向主导(70% 负向干扰任务)的历史长河中,模型展现出了多项反直觉的行为模式。
首先,经验的效用严重依赖于其表征形式与任务交互结构的匹配度。在单轮代码生成任务(BigCodeBench)中,直接检索历史代码段的文本或向量往往弊大于利。由于代码语法高度严格、上下文变量命名各异,检索引入的代码往往带来严重的语义漂移与幻觉注入。而在多轮工具调用场景(WildToolBench)中,环境不仅容许试错,还依赖复杂的步骤拆解,此时以工作流、API 规范形式存在的程序性记忆展现出了更高的稳健性。
其次,强大的即时迁移能力并不能保证知识的长期保留,迁移与留存呈现明显的解耦状态。部分智能体在刚接触前置正向任务后,能在第一次探针复现时表现出惊人的性能跃升(极高的即时 FWT);但随着干预任务队列拉长,即便这些干预任务依然属于正向类别,探针的表现也会不可逆转地出现下滑(FGT 持续飙升)。这表明现有的智能体记忆库缺乏类似于人脑的海马体巩固机制,检索空间在持续被稀释,早期建立的高信噪比表征很容易被后续涌入的海量“次优经验”所掩埋。
更为严峻的是,后序经历会动态重塑甚至抹除早期获得的红利。在受控的路径转移实验中,研究者让智能体先经历一段正向任务积累,随后无缝切入负向干扰任务。监测发现,负向任务不仅直接压低后续任务的胜率,还会污染智能体的全局索引结构,导致早期沉淀下来的正确解题逻辑在召回阶段被抑制。这种不可逆的退化证明,当前依赖全量追加存储(Append-only)的外挂记忆方案极其脆弱。
从被动接受到主动挑食:选择性经验使用(SEU)
如果经验本身就是一把双刃剑,那么终身智能体就不应该无差别地把所有召回内容统统塞进上下文窗口。基于 PATH-Bench 揭示的病灶,研究团队提出了一种轻量级即插即用的 Agent Harness 增强方案——选择性经验使用(Selective Experience Use, SEU)。
SEU 并不颠覆智能体原有的检索机制,而是作为一层过滤与适配网关,嵌在检索模块与基座大模型的生成模块之间。当检索系统调出与当前任务相关的历史经验时,SEU 调用判断单元,执行分级过滤机制:
-
保留(Preserve):当检索到的经验与当前目标任务在逻辑粒度、工具链调用上高度重合,且具备直接复用价值时,保留其完整的具体实现细节直接注入上下文。
-
抽象(Abstract):当经验背后的具体代码或参数无法复用,但其高层规划、避坑指南或反思结论具有启发性时,SEU 会在运行时将其压缩提炼为紧凑的任务指导原则,隐去具体细节,阻断干扰性变量名的迁移。
-
忽略(Ignore):当检测到候选经验存在潜在逻辑冲突、无效噪声或负向转移风险时,坚决将其剔除,不予输入基座模型。
在相同的受控测试序列上,引入 SEU 的智能体展现出了立竿见影的防御与强化效果。如表 2 的统计结果所示,SEU 在跨模型、跨数据集以及跨历史路径的绝大多数实验组中均一致降低了遗忘率(FGT)。在干扰严重的 BigCodeBench 任务中,HippoRAG-v2 的遗忘率大幅下降了 16.84 个百分点,AWM 的遗忘率降低了 13.07 个百分点。
与遗忘率骤降相伴随的,是前向迁移与平均任务表现的普适性上升。在部分配置下,AWM 在 BigCodeBench 上的平均得分提升了 4.77 个百分点,前向迁移暴增 8.39 个百分点。值得深思的是,SEU 对后向迁移(BWT)的改善并不显著,这进一步印证了其本质定位:它是一套优秀的前端干扰阻断器(Interference Filter),通过“挑食”阻断了毒性经验的输入,但要实现对已存记忆的深层后向巩固,依然需要底层状态维护机制的进一步演进。
走向更稳健的持续自适应智能体
PATH-Bench 的提出,将大模型终身学习的评测重心从单纯的“记忆容量”与“静态得分”,拉回到了“时间序演进”与“动态干预”这一更具真实工业价值的维度。评测数据表明,单纯扩大检索 Top-K、盲目累积任务轨迹,并不能自然孵化出更聪明的终身智能体,反而常常因为路径污染而自毁长城。
对于从事智能体架构设计的工程师与研究者而言,这项工作释放了清晰的信号:设计终身智能体时,必须将 Agent Harness 从一个单纯的“存储与检索系统”,升级为一个具备自我净化、遗忘淘汰与抽象升华能力的“动态认知系统”。在模型参数冻结的前提下,如何根据任务流的路径拓扑实时调节经验的准入与沉淀,将是下一代自演进 Agent 突破能力瓶颈的关键所在。