PAST-Bench:个人Agent真能自我进化?204个任务揭开跨Session经验复用真相

PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

PAST-Bench:个人Agent真能自我进化?204个任务揭开跨Session经验复用真相 论文图示

让大模型通过自身运行产生的经验持续变强,即递归自我改进(Recursive Self-Improvement, RSI),一直是智能体演进的核心叙事之一。虽然从底层修改模型权重或重写学习算法的高阶自省仍处于探索期,但个人智能体(Personal AI Agents)已经在工程上为这种自我进化铺平了物理路径。现代 Agent 框架往往具备跨越会话的持久化工作区:它们读取用户的邮件、记录操作偏好、沉淀脚本工具,并在数周甚至数月的跨度内累积记忆。当上下文窗口不再随着对话结束而清空,智能体理论上便拥有了“在线自我演化”(online self-evolution)的基础——利用旧会话沉淀的经验,在不重新微调权重的前提下,让后续任务执行得更准、更快。

ArXiv URL:https://arxiv.org/abs/2608.04003v1

然而,累积了经验,是否就等于获得了能力的持续演进?当前社区对这一问题的回答充满模糊性。很多所谓的自我提升,在严格审视下往往经不起推敲:模型在后续任务中的表现改善,究竟是因为真正复用了过往沉淀的状态,还是仅仅得益于底座模型的单次推理能力、提示词巧合,抑或是评测集本身存在的信息泄露?为了厘清这一因果机制,研究人员构建了专门面向持久化个人 Agent 的归因基准 PAST-Bench,并在其诊断指导下设计了增强运行时框架 Hermes+。这项研究不仅揭示了当前主流大模型与智能体框架在跨会话经验复用上的严重失衡,也为 Agent 如何从“单纯堆积历史”走向“系统化自我改进”确立了严格的归因评估体系。

PAST-Bench 架构总览

为什么现有 Benchmark 测不出真正的“自我演化”?

长期以来,社区评估 Agent 的主要范式依然停留在单轮、隔离的任务上。从 SWE-bench 到各类复杂环境交互评测,其核心打分逻辑基本都是:给 Agent 一个全新的干净会话,输入任务描述,然后计算单次执行的最终分数。这种评测完全将任务视为孤立事件,忽略了跨时间维度的状态沉淀。

少数关注记忆与持续学习的基准,又往往滑入另一种困境:它们要么依赖长上下文窗口或不断追加对话历史,使早期信息始终暴露在注意力机制中;要么采用连续无间断的任务流,让内部状态随运行时自然传递。这两种设计本质上测试的都是模型的“上下文内处理”(In-context Propagation),而不是真正的持久化跨会话进化。在实际工业级应用中,无限膨胀上下文不仅成本昂贵,还会导致严重的注意力分散。真正的个人 Agent 必然要面对会话重置(Fresh Session)——每次被唤醒时,内存中的易失上下文已被抹去,它必须主动将过往经验存入外部介质,并在下一次遇到同类问题时自主检索、辨别、采纳或覆盖。

更深层的挑战在于“性能归因”(Performance Attribution)。当一个 Agent 在第十次任务中的表现优于第一次时,传统评估指标给出的整体增益往往具有欺骗性。Agent 可能在文件系统中写入了复杂的经验流程,但在解决后续任务时根本没有触发读取逻辑,得分上升完全是因为底层大模型碰巧输出了更优的推理链条;又或者,Agent 在检索时召回了错误的陈旧记忆,却凭侥幸规避了错误。缺乏对执行路径与内部介质交互的显式检验,使得过往的评测无法区分模型到底是“掌握了经验复用闭环”,还是仅仅在“黑盒碰巧奏效”。

任务家族与严格清除:PAST-Bench 的双轨评测设计

PAST-Bench 的核心突破,在于将评估单元从“单个离散任务”重构为“任务家族”(Task Family)。评测套件涵盖了 26 个精心设计的应用场景和 204 个具体交互回合(Episode),从设计之初就贯彻了严格的会话清空(Context-clearing)协议:在同一个家族的连续任务之间,智能体的挥发性对话上下文会被强行重置为零,任何信息的继承都必须经由外部持久化基质(存储文件、技能脚本、记忆记录等)来完成。

PAST-Bench 评测套件分布与能力维度

为了测透 Agent 在不同复杂度下的状态操作能力,PAST-Bench 锁定了四个核心能力维度:

  1. 记忆能力(Memory):测试 Agent 能否在早期会话中隐式捕捉用户的持久偏好或环境潜规则,并在后续全新会话中主动调取,而无需用户在提示中重复强调。

  2. 程序化复用(Procedural Reuse):考验 Agent 能否将一次性成功探索出的工具链、操作脚本或复杂业务流程封装为可复用资产,在面对同类操作时直接调用,避免重复踩坑。

  3. 信息收集(Information Gathering):重点考察对预埋基准参照物或长线背景信息的按需触发检索,判断系统能否在关键决策节点精准翻查历史档案。

  4. 状态更新(Update):这是整个基准中最具挑战性的环节,专门测试当环境规则、外部 SOP 或用户意图发生权威修正时,Agent 能否利用第二次写入精准覆写旧规则,且完全避免陈旧信息(Stale State)的泄漏与干扰。

在任务家族内部,评测设计了精密的角色编排。系统首先通过冷启动任务(Cold)确立无外部先验时的基准水位,接着由学习任务(Learn)或更新任务(Update)提供沉淀经验的契机,随后通过评估任务(Evaluation)检验状态复用效果。与此同时,评测集内嵌了多组严格的对照任务(Control Episodes):包括故意注入看似相关实则无关的干扰噪声(Distractor Controls)、提供已过期的废弃配置(Stale Controls),以及故意诱导使用错误介质的陷阱环境(Wrong-mechanism Controls)。

在此基础上,PAST-Bench 抛弃了粗糙的单点绝对值对比,确立了双轨制指标体系。核心行为指标是“自主演化增益” $\Delta$(Self-evolution Gap),即固定底座模型、提示词、评测脚本和环境种子,对比开启持久化状态(w/-evolve)与彻底剥离持久化状态(w/o-evolve)时的净表现差值:

\[\Delta_{f} = S^{\text{w/-evolve}}_{f} - S^{\text{w/o-evolve}}_{f}\]

另一条轨道则是机制证据得分(Mechanism-Evidence Score, 简写为 Mech)。该指标深入 Agent 运行时的遥测日志与底层文件系统,严格追踪写入与读取操作的配对情况、技能补丁应用轨迹、会话检索调用链以及文件差异(Diff)。如果某个 Agent 的 $\Delta$ 分数大幅增加,但监控显示它从未检索过写入的文件,或者把更新数据写错了存储载体,系统将明确拒绝将这一增益归功于自我演化。

实验发现:看似相同的整体增益,掩盖了巨大的机制断层

在针对 7 款主流底层大语言模型和 4 个代表性 Agent 框架(如 ZeroClaw、nanobot、Agent-Zero 和 Hermes 等)的横向评测中,PAST-Bench 测出了一系列高度一致却又极具分化的现象。总体来看,持久化机制确实为智能体带来了确定性的正向收益,整体平均增益 $\Delta$ 普遍落在 $+0.13$ 到 $+0.24$ 之间。但一旦拆解到具体能力和调用链路上,不同模型与框架的底层能力呈现出断崖式的落差。

最直观的发现是:增益的分布高度取决于底座模型固有的能力结构偏向,单一的宏观 $\Delta$ 完全遮蔽了真实瓶颈。在 Hermes 框架保持不变的设定下,不同底层大模型在各能力维度上的增益流向截然不同。例如,GPT-5.4 的增益极为均匀地分布在记忆读取(贡献占比 $38\%$)与状态更新(贡献占比 $35\%$)上;GLM-5.1 将其全量正向变动中的 $46\%$ 集中在 Update 任务中;而 Kimi K2.6 则有接近一半($49\%$)的增益来源于基础 Memory 任务。模型原本在哪些基础推理维度更具优势,持久化经验往往就会在该领域被最大化放大,而在基础能力较弱的维度,外部经验甚至可能沦为增加幻觉的冗余负担。

更为触目惊心的是框架层面的虚假繁荣。当固定使用 MiniMax-M2.7 作为底层模型、变换不同 Agent 框架时,评测捕捉到了极具警示意义的对照案例:nanobot 与基础版 Hermes 的整体自主演化增益均为 $\Delta = +0.13$,若仅看这一表层数字,二者的演化能力看似平齐。然而,深入机制证据指标却发现,Hermes 的 Mech 得分为 $0.64$,而 nanobot 仅有 $0.57$。

进一步解构发现,nanobot 的整体增益有高达 $60\%$ 孤注一掷地堆叠在单一的 Update 维度,且其内部追踪日志显示,大量任务在没有建立完整“写入-检索-应用”闭环的情况下偶然达成了解题目标;在其余维度如 Memory 上,nanobot 几乎毫无建树,其程序复用甚至出现了负增长($\Delta = -0.04$)。另一个极端是 Agent-Zero,在多项能力上表现出明显的退步,整体增益呈现负向滑落($\Delta = -0.08$),其机制得分更是跌落至 $0.39$。这充分证明:不加控制的状态堆积不但不会促成自我进化,反而会破坏智能体原有的决策逻辑。

状态为何无法演化?Hermes+ 的五阶段靶向干预

通过深度审计那些“有分数、无机制”或“经验写入失败”的交互轨迹,研究团队将 Agent 自我演化链路的典型断裂精确定位在五个执行环节:

针对上述五大断裂点,研究人员在 Hermes 运行时的五个核心切入点实施了独立插拔式的针对性改造,构建了 Hermes+ 架构。

在规划环节(E1 Plan),系统强制注入跨会话先验核对机制,确保 Agent 在下达第一条指令前必须扫视索引;在上下文呈现环节(E2 Render),强化了跨会话状态的规范化组装,阻止记忆格式的劣质泛化;在路由环节(E3 Route),引入了显式的技能入库协议,确保执行过的高频有效序列能够升格为可调用子工具;在门控环节(E4 Gate),设置了行动前的检索准入控制,迫使模型在调用核心工具前比对历史依赖;在收尾环节(E5 Close),构建了严格的状态版本闭环,确保在会话结束持久化时彻底注销废弃项,杜绝陈旧状态外溢。

消融实验印证了这种结构性干预的有效性。Hermes+ 将整体自主演化增益从基础版的 $+0.13$ 稳步推升至 $+0.15$,更重要的是,其全生命周期的机制证据得分从 $0.64$ 跃升至 $0.73$。这表明提升不仅仅体现在外在分数上,而是真实地走通了经验沉淀与提取管道。

这一架构最惊艳的表现在于对复杂更新(Update)任务的“超加性协同”(Super-additive Composition)。在面对陈旧规则更替与动态例外条款时,单独开启收尾机制(Close)能带来 $+0.16$ 的增益,单独开启检索门控(Gate)仅贡献 $+0.06$;然而,当这套五阶段机制完整协作时,Update 任务的演化增益爆发性地达到了 $\Delta = +0.24$,远超各个模块单独提升的代数叠加。这直接验证了一个智能体系统设计的关键命题:状态更新从来不是一个简单的“存储写覆盖”问题,它需要从规划防呆、检索过滤到退出校验的全流程协同,才能彻底驱逐幽灵状态的干扰。

迈向可持续自主演化:从“拥有记忆”到“学会迭代”

PAST-Bench 带来的最重要启示在于打破了长久以来社区对“记忆 Agent”的浪漫想象。很多开发者误以为只要为模型挂载一个向量数据库(Vector DB)或写入一个本地 Markdown 文件夹,系统就自然具备了“越用越聪明”的自我成长能力。但评测数据冷酷地表明,如果缺乏严格的运行时协议与状态流转机制,堆积的历史信息充其量只是数字废料,甚至在多轮交互后成为误导大模型的毒药。

真正具有自我演化能力的 Agent,不仅需要底座模型具备强大的推理抗噪素质,更需要运行时架构对经验的状态转移拥有工程化的控制力。智能体必须清楚地知道什么经验值得固化、以什么规格固化、何时必须强制调取,以及最为关键的——何时坚决推翻旧有的错误经验。

PAST-Bench 将经验演化从玄奥的黑盒表象拆解成了可测量、可隔离、可对齐的性能归因工程。它所提供的对照设计与机制审计标准,为后续研究划定了清晰的边界:唯有通过无上下文污染的严格对照,并辅以底层系统调用的完整证据链,我们才能断言一个智能体真正踏上了递归自我改进的漫长阶梯。