清华等提出AgentRewind:长程智能体双重状态回退,成功率提升25.6%

AgentRewind: Recoverable Execution for Long-Horizon LLM Agents

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

清华等提出AgentRewind:长程智能体双重状态回退,成功率提升25.6% 论文图示

在大模型驱动的自主智能体(LLM Agent)向复杂现实场景落地的过程中,长程任务(Long-Horizon Tasks)始终是一道难以逾越的高墙。无论是跨代码库的软件重构、复杂的系统运维,还是多步骤的科学计算流程,智能体往往需要连续执行数十甚至上百步的工具调用与环境交互。在这样的长执行链条中,一个极具破坏性却长期被忽视的现实问题是:智能体的错误具有不可逆的级联扩散效应。

ArXiv URL:https://arxiv.org/abs/2608.14380v1

当智能体在任务早期做出了一个细微的错误决策——例如误删了一个依赖文件、用错误的参数覆盖了测试数据,或者走入了一条死胡同分支——这个错误不仅会永远滞留在智能体的上下文窗口中,还会直接污染真实的物理环境状态。面对这种局面,当前主流的做法往往是将希望寄托在事前规划(Plan Refinement)或者运行时的安全审计(Safety Review)上。然而,统计概率决定了哪怕每一步操作的准确率达到 99%,在长达几十步的链条中,累积失败率依然会急剧攀升。一旦不可逆的环境损坏已经发生,单纯在现有上下文中追加补救指令往往无济于事,甚至会导致上下文膨胀和更严重的幻觉。

为了打破这种“一步走错、全盘皆输”的单向死局,来自中科院自动化所、清华大学交叉信息研究院以及中关村学院的研究团队提出了 AgentRewind。这是一个面向长程智能体的运行时恢复框架。该工作彻底改变了智能体只能向前线性推进的交互范式,通过在关键决策点对智能体内部上下文与外部受控环境进行联合检查点对齐,赋予了智能体“随时撤销错误、返回历史节点换条路重走”的能力。在最新构建的长程工程基准 MettleBench 上,配备 AgentRewind 的 GPT-5.4 成功率从基准的 62.2% 飙升至 87.8%,实现了超过 25 个百分点的显著提升。

为什么长程智能体总会卡死在死胡同里?

要理解恢复机制的必要性,首先需要审视现有智能体与外部环境的交互本质。在标准的交互框架下,智能体根据当前的上下文生成决策,调用工具作用于外部环境,环境发生状态转移并返回观测结果,随后上下文继续追加新的内容。这种模式在数学上被形式化为一个单向向前增长的轨迹:

\[\tau = \big((c_0, s_0), u_0, o_1, (c_1, s_1), \dots, (c_T, s_T)\big)\]

在这个序列中,$c_t$ 代表第 $t$ 步的智能体上下文状态,$s_t$ 代表外部环境状态。系统在结构上只支持追加操作。这就带来了一个致命的不对称性:环境状态的物理改变往往具有高度的单向破坏性,而大模型在面对复杂的混乱状态时,其推理能力会显著退化。

举例来说,当智能体在重构代码库时不小心运行了一条格式化脚本,直接覆盖了原始的脏数据测试集。此时,环境状态 $s$ 已经被破坏。即使环境校验给出了报错反馈,智能体也只能在当前的破坏性状态之上尝试补救。它可能会尝试重新手写一份测试数据,但往往无法完全还原原始环境的微妙边界条件;同时,大量冗长的报错和无意义的试错历史堆积在上下文 $c$ 中,不断挤占有限的注意力窗口,最终导致智能体在错误的泥潭中越陷越深,触发死循环。

以往的研究并非没有意识到错误累积的严重性。学术界曾尝试过事前多路径搜索、事中安全拦截(如识别高危 bash 命令并阻断),或者基于反思机制(如 Reflexion)在彻底失败后清空环境全盘重跑。但这几条路径在长程任务中都暴露出明显的软肋:

智能体真正缺失的,是一种类似人类程序员开发软件时的核心工作流:在进行危险或探索性重构前随手打一个 Git Commit;一旦发现方案彻底不可行,可以一键执行 Reset 回到那个干净的节点,并带着“此路不通”的吸取教训,换一个参数或分支重新展开。

软硬状态协同对齐:AgentRewind 的核心机制

AgentRewind 的核心构想,正是在智能体运行层与外部环境之间架设一层透明的恢复拦截机制。它并非单纯对 LLM 上下文进行文本层面的修剪,也不是只依赖底层的沙盒快照,而是构建了上下文与环境状态的双重对齐检查点(Aligned Checkpoints)

在具体实现上,AgentRewind 在智能体的每一个决策边界点记录一个可恢复的状态元组:

\[d_t = (c_t, s_t)\]

其中 $c_t$ 完整捕获了 LLM 的输入输出历史与工具调用记录,而 $s_t$ 则跟踪受控外部环境在该时间点的确切状态。为了让智能体能够理解并选择历史节点,系统还会为每个检查点生成元数据 $\eta_t$,精简地概括从 $d_t$ 到 $d_{t+1}$ 之间发生的工具行为与环境变化。

在整个执行生命周期中,AgentRewind 为智能体额外开放了一个显式的控制动作:Rewind。当智能体接收到环境反馈、意识到当前的推进行为已经陷入死循环或由于早期误操作导致后续测试无法通过时,它可以主动发起回退请求。此时的恢复流程包含三个紧密交织的步骤:

  1. 目标检查点抉择与环境硬回退:智能体根据当前的交互轨迹、各节点的元数据摘要以及报错反馈,自主挑选出最合适的目标检查点 $d_k$(其中 $k \le T$)。确认回退后,底层的环境恢复器介入,将工作区文件树硬重置到状态 $s_k$。在这项工作中,受控环境明确界定在工作区的文件系统树内,AgentRewind 能够撤销此后的文件修改、恢复被删除的文件并清除新增的垃圾文件。

  2. 上下文剪枝与历史前缀恢复:与环境回滚同步,智能体的上下文直接裁剪回 $c_k$。这意味着 $k$ 步之后所有走偏的尝试、杂乱的报错信息和失败的工具调用全部被剥离出上下文,彻底杜绝了错误信息对大模型后续注意力的长程污染。

  3. 经验注入(Rewind Memory):这是 AgentRewind 区别于简单环境快照恢复的关键所在。如果仅仅将环境和上下文机械地还原到第 $k$ 步,智能体在面对相同的输入分布时,极大概率会重复生成此前失败的决策分支。为了打破这种确定性死循环,AgentRewind 要求智能体在离开失败分支前生成一份“回退记忆” $m$。这份记忆被高度概括,提炼出刚刚被证伪的假设、失败的根本原因以及下一步应当避开的陷阱。随后,系统将累积的历史回退记忆集合 $\mathcal{M}$ 动态注入到恢复后的上下文 $c_k$ 中,形成新的起点:

\[c'_k \leftarrow \text{Inject}(c_k, \mathcal{M})\]

通过这一机制,智能体得以从 $(c’_k, s_k)$ 启程,既拥有早期正确步骤积累下来的物理环境资产与上下文先验,又携带了刚刚试错得出的反思结论,从而能够高效探索全新的行动分支 $\tau’$。

MettleBench:为长程工程任务建立细粒度标尺

为了能够严格且客观地评测这种恢复机制在长程复杂场景下的有效性,现有的很多基准测试显得有些力不从心。诸如 SWE-bench 等传统基准,虽然包含多步交互,但大多围绕单一的核心需求展开,评估结果通常是一个二元的“通过或失败”(Pass/Fail)。一旦智能体在最后一步功亏一篑,传统的指标无法区分它是自始至终毫无头绪,还是已经扎实完成了前面 90% 的复杂前置依赖。

为此,研究团队构建了专门的长程工程任务基准 MettleBench。该基准整合了来自 Terminal-Bench 2.0、ProgramBench、SWE-bench、ProjectEval 和 GitTaskBench 五大源头的 82 项高难度工程任务。与传统基准最本质的区别在于,MettleBench 将现实工程实践中的“复合型长程任务”抽象为具有显式依赖链的有序验收准则集:

\[G = (g_1, g_2, \dots, g_n)\]

每个子目标 $g_i(s)$ 对应一个可执行的二元校验函数。在任务设定中,一个真实的复杂工程任务(例如服务迁移)往往环环相扣:升级底层依赖、迁移旧配置与数据模型、维持向下兼容性接口、重写自动化部署脚本、验证服务联通性、补充变更日志。这些子任务共享同一个物理环境状态,满足前一个条件可能为下一个条件创造前提,但也极易因为后续的不当操作导致先前已经通过的检查点再次失效。

在评测交互时,MettleBench 对智能体隐藏完整的 Checklist 规则,智能体每次提交时,后台按固定顺序线性执行校验,且仅向智能体反馈第一个未满足的检查点报错。这种设计极具真实感地模拟了复杂系统的渐进式调试过程。

为了捕捉任务的局部进展,除了最终的任务成功率(Task Success Rate,要求全部准则在终止前同时为 1)之外,本文定义了 Checklist 前缀进度指标:

\[\rho(s_T) = \frac{\ell}{n}\]

其中 $\ell$ 代表从 $g_1$ 开始连续满足的最长前缀长度。通过这一指标,即便任务最终未完全攻克,评估系统也能精准量化出智能体究竟在多大程度上推进了复杂工程的实现,为长程能力的衡量提供了极具信息增量的细粒度标尺。

实验结果与关键发现

在 MettleBench 上的全面评测展现出了令人信服的实验结论。实验首先在标准的向前单向执行(Continue)模式下摸底了主流模型的原生表现。在包含 GPT-5.4、Qwen3.7-Max、GLM-5.1、DeepSeek-V4-Flash 等七款顶尖或高代表性模型的横向对比中,没有任何一个模型能够完全攻克该基准。Qwen3.7-Max 取得了最高的向前单向基准成功率(73.2%),而大部分模型的成功率集中在 30% 到 60% 之间,留出了极其充裕的算法改进空间。

更有趣的一个现象是执行轨迹长度(Trace Length)与任务成功率之间的背离。部分模型的平均执行交互步数超过了 300 步,但最终成功率却显著低于仅耗费 50 步左右的 GPT-5.4。这强有力地说明:在缺乏纠错恢复机制的长程任务中,盲目增加交互轮数并不等同于进展,反而往往意味着智能体早已陷入了无效的死循环和自我欺骗。

在以 GPT-5.4 和 GPT-5.4 mini 为底座的策略横向对比中,AgentRewind 与三种代表性策略进行了针锋相对的对抗实验:

实验数据揭示了清晰的发展轨迹。在交互早期,所有策略的成功率曲线都在同步上升,但当面对深层嵌套的复杂逻辑分支时,策略之间出现了急剧分化。Continue 策略最早触顶停滞,表明在破坏性状态发生后,原位修复的收益迅速衰减为零;Safety Review 在实际任务中表现低迷,在 GPT-5.4 上甚至显著拉低了表现,原因在于严苛的安全拦截往往误伤了合法的工程清理行为,束缚了模型的探索手脚;Restart with Experiences 虽然借助全盘重试提升了最终成功率,但其 Checklist 进度的方差极大、波动剧烈,智能体在重复前面步骤时经常由于随机性在其他地方踩坑。

唯有 AgentRewind 展现出了稳健且持续的抬升态势。在 GPT-5.4 上,任务成功率达到了绝对领先的 87.8%(基线仅为 62.2%),Checklist 平均进度推至 94.3%;在轻量级的 GPT-5.4 mini 上,成功率同样实现了从 33.7% 到接近翻倍的飞跃。

为了深入探究收益到底来自何处,研究人员将任务按照执行难度(通过基准执行步长分位点划分)拆解为短程、中程与长程三个梯队。分析显示,在短程任务中,由于错误发生的频次原本就低,AgentRewind 的优势相对温和;但一旦任务跨入中程与长程,AgentRewind 相比最强基线的净胜幅度急剧扩大。这充分印证了论文的核心判断:执行链条越长,累积错误对单向执行的扼杀效应越严重,而局部检查点恢复的杠杆效应也就越巨大。

经典案例:天文数据处理中的“降维打击”

为了直观展现三种策略在遭遇不可逆错误时的行为分化,本文给出了一个极具代表性的 Astropy FITS 数据管道维护案例。在该任务中,智能体需要修复 FITS 图像处理库中的缺陷,生成一组包含正常数据和 6 个预设畸变测试样例的数据目录,并且必须严格保留这 6 个原始的坏样例,以便后续检验修复后的代码库能否正确拦截异常格式。

面对这个任务,三类策略在目录生成阶段呈现出了截然不同的命运走向:

这个案例生动地揭示出:在长程软件与运维任务中,“局部状态隔离与定向回滚”是远比“全局蛮力试错”高效得多的生产力范式

恢复能力的边界与消融洞察

一个关键的系统级问题是:AgentRewind 的收益是否高度绑定在特定的智能体框架上?为了验证通用性,研究人员将该恢复层接入了三种截然不同的运行脚手架(Agent Harnesses):偏向工程长程修复的 mini-SWE-agent、采用原生函数调用的 FnCallAgent(Qwen-Agent),以及轻量级的代码级智能体 CodeAgent(smolagents)。

实验结果显示出惊人的一致性。无论底层的工具分发逻辑是基于纯文本 ReAct 循环、标准 JSON 工具调用,还是将整个执行逻辑写成 Python 代码块,引入 AgentRewind 之后,任务成功率均取得了 15 到 25 个百分点的绝对提升,Checklist 进度同样均突破了 90% 的门槛。这证明该框架具备很强的即插即用属性,它抽象的是执行流的生命周期控制,而非具体的提示词技巧。

而在随后的组件消融实验中,系统的内部贡献度被彻底剖白。当研究人员分别剥离环境回退、上下文回退或回退记忆时,系统的崩溃程度呈现出清晰的层级:

在另一项针对 50 个已经陷入持续报错绝境的死局轨迹进行的“残局抢救”测试中,单纯依靠提示词要求 Continue 重新换个思路的挽救成功率只有可怜的 8.0%;而启动 AgentRewind 从共享错误节点展开恢复的成功率达到了 30.0%,在相同的极端逆境下展现出了近 4 倍的破局能力。

当然,这项技术也有其明确的现实边界。正如论文在环境恢复边界中所坦诚讨论的那样,AgentRewind 的有效性依托于一个受控的工作区文件树。在涉及外部不可逆副作用的场景中——例如已经发出去的外部 HTTP 网络请求、写入了第三方不受控云数据库的数据、或者已经向物理打印机发送的任务——简单的文件级快照无法逆转这种外部物理现实。如何在混合着不可逆副作用的分布式开放网络中构建语义级的“补偿事务(Compensating Transactions)”,将是智能体恢复技术未来必须攻克的下一座堡垒。

从“事中步步惊心”到“允许试错撤销”,AgentRewind 为长程智能体的系统架构设计推开了一扇新的大门。在迈向更高自主性的 Agentic AI 演进路上,大模型的单步智能固然重要,但给予系统一个可以随时承接失败、回溯状态并汲取教训的健壮运行时环境,或许才是真正让自主智能体走出玩具演示、承担现实复杂工程重任的关键基石。