不是盲目压缩上下文,而是依赖回溯!ReTree让搜索Agent准确率提升25.6%

Self-Correcting Long-Horizon Search Agents via Tree-Structured Memory

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

不是盲目压缩上下文,而是依赖回溯!ReTree让搜索Agent准确率提升25.6% 论文图示

在大模型驱动的自动化搜索与多步推理任务中,Agent(智能体)通常需要像调查员一样在外部环境中不断检索、阅读并提出新的查询。然而,随着交互步数的增加,这种长步长(Long-Horizon)搜索暴露出一个致命缺陷:如果让模型完整保留整条交互轨迹,其上下文长度会不可逆地迅速膨胀并充斥大量噪音;但如果采用常见的滚动摘要或工作区重写来强行压缩上下文,模型往往在压缩信息的同时抹平了原始证据的来源指针。更严重的是,搜索过程随时可能检索到互相矛盾、陈旧或错误的信息,一旦某个前置事实出现偏差,基于它做出的所有后续推论和搜索分支都会全盘偏航,形成难以挽回的“错误级联”(Error Cascade)。

ArXiv URL:https://arxiv.org/abs/2608.10676v1

针对这一矛盾,上海交通大学的研究团队提出了一种名为 ReTree 的自纠错树状工作记忆机制。ReTree 并没有将搜索历史简单视为线性文本流或单向压缩的草稿,而是将搜索过程建模为带有依赖演化关系的证据树。在保证单步决策上下文处于有界常数规模的前提下,ReTree 赋予了 Agent 精准的溯源定位和自我回退能力:当新检索到的事实推翻了此前引入的某个前提时,Agent 可以沿着依赖链精确定位到最初引入该事实的节点,完成替换与摘要重构,并将受其污染的所有下游推理分支全部剪枝作废,随后沿着修正后的状态重新展开搜索。在涵盖 2,149 道长程多跳推理问题的四个公开基准测试上,ReTree 相较于保留完整轨迹的 ReAct 范式,答案准确率最高提升了 25.6 个百分点,并将单步最大推理上下文大幅降低。

全轨迹Agent与ReTree在错误级联处理上的对比

为什么线性和滚动压缩上下文总会失败?

为了看清 ReTree 的设计精妙之处,必须先回到多步搜索 Agent 所面临的状态管理困局。标准的 ReAct(Reasoning + Acting)范式本质上是一个不断追加交互记录的“单向转录本”。当 Agent 面对复杂的跨跳问题时,可能需要经历数次乃至数十次“思考—查询—阅读”的循环。每一次循环返回的网页切片都会被硬塞进提示词,导致后续每一步的阅读负担呈线性甚至超线性上升。这种无节制的上下文累积不仅极其浪费推理算力,还会让注意力机制被长文本中的海量非关键细节所稀释。

为了压制上下文的快速膨胀,业界近年来的通用做法是采用“滚动摘要”(Rolling Summary)或构建不断重写的“研究报告”(如 ReSum 和 IterResearch 等方案)。这类方案要求 Agent 在每一轮检索后,将最新证据合成进一个紧凑的工作记忆中。然而,这种将事实反复融合成扁平文本的操作,带来了严重的副作用:证据的不可溯源性与依赖断裂。当模型反复润色文本时,最初来自哪篇网页的哪句话往往被抽象丢失;更致命的是,一旦早先检索到的某条信息是虚假或过时的,后续所有的子查询与推论都是基于这个错误地基搭建而成的。扁平压缩机制哪怕在后续检索中发现了矛盾,也最多只能修改当前段落中的那个错误字眼,却根本无法甄别并撤销那些“基于错误事实而延伸出来的推论多米诺骨牌”。

这就解释了为什么现有长程搜索 Agent 经常在中间某一步被带偏后,就再也无法回到正轨。长程搜索所需要的记忆系统,绝不能只是单纯地缩短输入长度,而必须同时满足三个硬性要求:第一,提供给策略模型的单步推理上下文必须有严格的长度边界;第二,每一个被采纳的主张必须与底层原始证据建立稳固的双向指针;第三,当某个底层事实被修正时,记忆系统必须能够识别并废黜所有由它衍生出来的派生状态。

ReTree 的核心抽象:证据演变树与有界单步上下文

为了解决上述问题,ReTree 将 Agent 的工作记忆解构为一个显式的演变树(Evidence Tree)。需要特别澄清的是,ReTree 绝不同于经典的“思维树”(Tree of Thoughts, ToT)。思维树是在解空间中并行探索不同的候选推演路径,而 ReTree 是一棵状态依赖与修订历史树:树中的每一条父子边,都明确记录着“子搜索状态是基于父节点的有效证据推演而来的”这一因果依赖。

在形式化定义中,经历 $t$ 步检索与更新后,Agent 的外部工作记忆表示为 $M_t = (\mathcal{T}_t, n_t)$,其中 $\mathcal{T}_t$ 是以根节点为起点的树形结构,$n_t$ 则是当前处于活跃状态的叶子节点。树中的每个节点 $n$ 都由一个四元组构成:

\[n = (s_n, E_n, H_n, p_n)\]

其中 $s_n$ 是当前节点对任务状态的有界高层摘要;$E_n$ 是当前节点本地引入的原子证据集合(每个证据都带有全局唯一标识符和来源网页指针);$H_n$ 是该节点所承载事实的历史修改记录;$p_n$ 则是指向父节点的指针。顺着根节点一路走到活跃节点 $n_t$ 的路径,构成了当前状态所依赖的“活跃证据全集”:

\[A(n) = \bigcup_{v \in \operatorname{path}(r, n)} E_v\]

为了实现推理开销的有界约束,ReTree 在向决策策略策略模型 $\pi_\theta$ 提供输入时,并不会将整棵树或者整条路径倾倒进提示词,而是通过上下文构建函数 $\mathcal{C}_k$ 进行动态剪裁:

\[\mathcal{C}_k(M_t, q) = s_{n_t} \;\|\; \operatorname{TopK}_k(A(n_t), q \| s_{n_t})\]

该设计将提示词划分为两部分:当前节点精炼的任务状态摘要 $s_{n_t}$,加上从整条活跃证据路径中根据问题和当前状态检索出的前 $k$ 个最高相关度的原子证据(在论文实现中 $k=5$)。由于摘要长度被严格限定,原子证据数量又被硬性截断,策略模型在每一步看到的输入上下文长度在整个长程搜索中都维持在 $O(1)$ 的常数级别,成功解耦了外部检索深度与单步计算成本。

ReTree总体架构与处理流程

依赖回溯:如何优雅地拆除“错误多米诺”

当外部环境返回新的检索段落时,ReTree 的关键创新机制——基于矛盾触发的依赖回溯(Contradiction-Triggered Backtracking)开始介入。这一设计深受经典真值维护系统(Truth Maintenance Systems, TMS)中“依据依赖驱动修改”(Dependency-Directed Revision)原则的启发,将其无缝移植进了基于大模型的推理闭环中。

整个更新流程分为两套截然不同的分支逻辑:

首先,当环境返回新的搜索段落后,信息抽取模块会从中提取出最多 6 条与问题相关的原子事实 $\Delta E_t$,并自动绑定其来源段落索引。随后,系统会调用冲突检测逻辑,将新提取的事实与已存储的相关证据进行横向比对。

为了防止大模型因为同义词替换、叙述视角不同或细节微调而产生虚假冲突警报,ReTree 制定了极为严格的冲突定义:只有当新旧两条事实在同一实体、同一属性、同一范围(Scope)和同一时间窗口下给出了互不相容的值时,才允许提议冲突。对于单纯的事实细化、不同语义维度的描述或互不排斥的候选选项,系统仅仅将其视为证据扩展。

一旦初筛提议发生冲突,ReTree 会启动具备上下文感知能力的二次确认调用。这个确认步骤会同时参考当前问题的全貌、该分支的高级摘要、目标旧事实的修改历史以及新事实的来源强度。只有确认新事实具备更强支持且真正排斥旧事实时,系统才会正式触发破坏性的状态回溯与修复。

状态修复的具体执行过程展现了依赖树结构的强大威力:

  1. 精准定位归因点:系统顺着当前活跃节点的祖先链条向上遍历,准确找到最初引入该失效事实的“原罪”节点;

  2. 就地替换证据与重写摘要:在原罪节点处,将过时被推翻的事实替换为经过验证的新事实,并在其历史列表 $H$ 中追加变更说明,同时重新生成该节点的紧凑状态摘要;

  3. 彻底剪除下游受污染分支:由于该节点的所有子孙节点均是基于原先的错误假设演进推导而来的,ReTree 会直接将这些受污染的下游子树全部剪枝丢弃;

  4. 状态复位并重启搜索:将当前活跃节点重置到刚刚完成修复的原罪节点,策略模型基于修复后的证据与更新后的摘要,重新决定下一步该去向何处检索。

通过这种方式,ReTree 从根本上切断了错误假设在后续链路中无限传递的可能,避免了在错误的方向上白白浪费搜索步数。

事实落地:逃离幻觉的可信归因机制

长程搜索的另一大顽疾在于引用生成的虚假归因。在很多追求生成完整研报的 Agent 系统中,模型经常在生成阶段生造出看似合规、实则根本不包含该内容的 URL,或者将主张引用到了错误的段落上。

ReTree 在底层证据抽取阶段就切断了这种幻觉通路。当环境返回原始检索切片时,抽取器严禁直接生成 URL 字符串,而是必须通过离散的段落数字索引完成事实与来源的绑定。所有的原子证据对象 $e_j = (j, x_j, u_j)$ 都包含固定的全局证据编号 $j$、原子陈述文本 $x_j$ 以及真实的网页标识 $u_j$。

在任务最终生成阶段,答案生成器必须将其推理分解为若干原子主张 $c_i$,并强制为每一个主张标注其依赖的证据编号 $j$。由于整个回溯剪枝过程严密维护了证据与来源的映射链路,最终系统的评估闭环可以严格沿着主张向下穿透:

\[c_i \to j \to (x_j, u_j) \to \operatorname{Passage}(u_j)\]

研究团队引入了基于自然语言推理(NLI)的第三方裁判模型,直接比对最终主张 $c_i$ 与原始网页文本 $\operatorname{Passage}(u_j)$ 之间的蕴含关系(Entailment)。这种设计彻底消除了事后猜测或“盲搜匹配”所带来的伪溯源,让生成的每一条结论都经得起原始文档的核查。

实验评测:准确率与上下文效率的双重胜利

研究团队在四个具有互补特性的权威多跳搜索基准上对 ReTree 进行了详尽验证:测试集包括考察信息缺口识别的 Bamboogle(全量 125 题)、复杂长步长多约束问答 FRAMES(全量 824 题),以及跨跳事实推理基准 2WikiMultiHopQA(固定 600 题子集)和 HotpotQA(固定 600 题子集),共计 2,149 道高难度题目。基座模型选用开源高性能的 Qwen3-8B(FP16 精度),并使用强大的前沿大模型作为盲测打分裁判。

在对比基线方面,实验不仅设立了最为核心的对照组——保留完整交互轨迹的标准 Full-Trajectory ReAct,还设立了两个强有力的状态压缩变体:ReportMemory(类似于 ReSum 等系统,将检索逐步融合进单一全局报告中,仅保留无序 URL 列表)以及 FlatUpdate(仅在平面字典中更新键值,不保留因果依赖树)。

实验结果展现了结构化记忆回溯的巨大优势:

在最终答案质量方面,ReTree 在所有四个基准上均大幅超越了标准 Full-Trajectory ReAct,LLM 裁判准确率提升幅度在 8.3 至 25.6 个百分点之间。在汇总了 2,149 道问题的总体指标中,ReTree 的准确率达到了 44.0%,相较于 ReAct 实现了 13.9 个百分点的综合跃升,精确匹配率(EM)亦提升了 7.4 个百分点。

更具说服力的是与同类压缩方案的横向对比:相较于将所有信息揉碎重写的高级报告模型 ReportMemory,ReTree 在综合准确率上依然稳步胜出 3.0 个百分点,并在除 2WikiMultiHopQA 表现基本持平(相差仅 0.3 个百分点)之外的所有数据集上保持全面领先(在 FRAMES 上领先 1.7 个百分点,在 HotpotQA 上领先 7.2 个百分点)。这有力地证明了一个关键结论:仅仅把长上下文压缩成漂亮的报告是远远不够的;一旦缺乏精细的依赖溯源与回溯剪枝机制,紧凑的摘要同样会被早期渗入的隐蔽噪声所扼杀

在单步推理上下文的控制上,ReTree 展现出了教科书般的稳定性。

推理步数与单步策略上下文长度变化趋势

从步数与上下文长度的变化曲线中可以清晰看出,随着检索步数从第 1 步递增至第 5 步以上,Full-Trajectory ReAct 的单步提示词长度呈现近乎失控的线性暴增,在 2Wiki 和 HotpotQA 上两步后便突破 2,800 字符,在长程的 FRAMES 任务上四步后更是轻松冲破 5,600 字符。与此形成鲜明对照的是,ReTree 始终将其单步策略上下文锚定在一个极其紧凑且波澜不惊的区间内。综合来看,Full-Trajectory ReAct 在单步决策时所承受的最大推理上下文长度,达到了 ReTree 的 1.27 至 1.51 倍

尤为值得注意的是,在实际测试过程中,ReTree 在 9.6% 至 17.5% 的任务运行中真实触发了基于矛盾检测的依赖回溯。这个统计数据揭示了现实世界搜索场景的残酷真相:在复杂问答中,将近五分之一的任务都会在中间步骤检索到充满噪音或冲突的信息。ReTree 正是凭借这套在运行时“敢于认错、精准止损、局部重构”的树状骨架,将那些原本注定滑向错误级联深渊的轨迹一次次拉回了正途。

架构权衡与技术演进思考

从计算代价与系统开销的角度审视,ReTree 并非一种“免费的午餐”。它所取得的性能突破,本质上是用少量的外部调用开销换取决策质量的纯度。

因为引入了抽取过滤、冲突探测、二次确认以及局部的摘要重新生成,ReTree 相较于不带剪枝修复的 FlatUpdate,在总体调用次数上增加了约 7% 至 11%,总 Token 消耗增加了 10% 至 13%。然而,考虑到大模型长文本处理所带来的显存带宽开销与注意力计算瓶颈,用这种受控的外围小调用,去替换动辄数万 Token 且充满幻觉风险的超长单步上下文,在工程落地与部署性价比上显然是一笔极其划算的买卖。

当然,目前的 ReTree 仍存在一定的优化空间。在现行策略中,研究团队采取的是一种较为激进的“硬子树剪枝”(Hard Subtree Pruning)策略——只要某个祖先节点的证据被篡改,其下属的所有子孙节点都会被无差别全部废黜。但在某些复杂的交叉推理分支中,下游的某些子事实可能恰好是独立的客观信息,这种“株连”式的全量剪除可能会误伤部分有效上下文。未来的演进方向之一,是引入更加细粒度的有向无环图(DAG)或显式因果图,实现更加精准的选择性依赖剥离。

ReTree 的研究成果向整个大模型应用领域传递了一个极其深刻的技术信号:面对复杂的长程任务,Agent 所需要的记忆绝不仅仅是一张被反复压缩的便签纸,也不是一条毫无节制向后追加的事务流水账,而必须是一个结构严密、因果清晰、且具备原地外科手术式编辑能力的知识依赖系统。从被动接受长上下文的“阅读机器”,进化为能够根据新证据主动清理陈旧偏见、不断重塑自身认知结构的“自省型决策者”,这或许正是搜索 Agent 迈向真正可靠落地的必由之路。