G-ReAct:图引导深度搜索打破线性困境,1.9K轨迹微调达79%精度
G-ReAct: Graph-Guided Deep Search via Structure-State Co-Evolution
在开放域复杂问题的解决过程中,深度搜索(Deep Search)正迅速成为大模型 Agent 的关键能力。面对需要多轮检索、复杂多跳依赖、实体关系交叉验证的难题,OpenAI Deep Research 等前沿系统展现出强大的长程探索能力。然而,主流开源社区在复刻这一能力时,几乎都沿用了经典的 ReAct 框架范式——即“思考(Thought)— 行动(Action)— 观察(Observation)”的扁平线性交互循环。
ArXiv URL:https://arxiv.org/abs/2608.01324
线性历史记录在短程任务中表现尚可,但在动辄数十轮调用的长程深度搜索中,其底层表征缺陷暴露无遗:扁平的上下文堆叠极易导致注意力稀释与上下文遗忘,造成早已查明的子问题被重复检索、多跳约束顾此失彼、以及由上下文噪声引发的严重“推理漂移”。尽管研究者尝试引入知识图谱来生成更难的问题,但在实际求解过程中,图谱蕴含的结构化先验却被抛弃,迫使模型再次退化为“试错式”的线性文本探索。

为了从根本上改变这一表征维度的瓶颈,本文提出了 G-ReAct(Graph-guided Reasoning and Acting)框架。该工作不再寄希望于依靠纯粹扩大模型规模或堆叠数万条轨迹的强化学习(RL)来硬抗长文本退化,而是重新设计了推理的承载基质:将深度搜索形式化为固定拓扑查询图上的状态演化。模型在结构保持不变的图骨架上动态维护实体候选、验证事实与全局一致性。令人瞩目的一组对比数据直接印证了结构化表示的威力:仅使用 1.9K 条图引导合成轨迹进行全量微调,参数量 30B 的 Qwen3 就在 XBench-DeepSearch 上取得了 79.0% 的准确率,在 BrowseComp-ZH 上取得 52.6%,显著超过了参数量高达 600B+ 的前沿模型以及依托十余万条轨迹训练的开源系统。
线性 ReAct 的根本症结与非对称悖论
深度搜索与传统检索增强生成(RAG)存在本质不同。RAG 侧重于针对静态提示词进行单次或少数几次局部检索注入,而深度搜索要求 Agent 在未知的动态开放网络中扮演自主调查员,持续分解目标、探索多条候选分支、交叉验证矛盾,并在多步骤中维持逻辑约束。
目前构建复杂深度搜索基准时,研究人员普遍利用知识图谱通过随机游走构造具备多跳依赖的难题,确保问题背后存在一条确切的推理主线。然而在模型求解端,通行的做法却是让模型把所有的思维链、调用参数与页面返回内容,全部以自然语言按时间先后平铺写入对话上下文。这种“生成端有图、求解端无图”的做法构成了鲜明的非对称悖论。
随着交互轮次拉长,扁平的线性历史会不可避免地触发三重系统性失效。其一是冗余检索(Redundant Retrieval),模型无法清晰追踪各子问题的解决进度,常因无法定位前期已得出的局部结论而反复发起相同意图的查询。其二是约束丢失(Constraint Loss),复杂问题通常附带多重互斥或联动约束,当上下文增长至数万甚至数十万 Token 时,模型满足了当前步骤的约束,却容易破坏上一步骤已满足的前提条件。其三是推理漂移(Reasoning Drift),由于搜索引擎返回结果中充斥着海量无关信息与语义噪音,多轮线性累积的偏置会让 Agent 的后续决策完全偏离最初的核心目标。单纯依靠扩大训练样本或进行后验格式过滤,并不能消除这种由线性表征机制带来的固有信息损耗。
结构不变与状态演化:G-ReAct 的核心机理
G-ReAct 的核心直觉在于:在解决复杂问题时,问题的约束逻辑拓扑应当是稳定锚定的,而需要改变的仅仅是对各节点实体的认知进度与确定性。为此,该框架提出了“结构不变性(Structure Invariance)”与“状态演化(State Evolution)”的双层设计,将搜索过程映射为一个图约束的状态空间决策过程。

在拿到用户输入的问题 $q$ 之后,G-ReAct 首先由初始化模块 $\phi$ 解析生成一个基础查询图 $G_0 = (V_0, E_0)$。为了防止模型在解析阶段凭空捏造不存在的先验知识,该图的构建遵循严格的文本锚定原则:图中所有的节点 $V_0$ 和边 $E_0$ 所对应的锚点,必须严格子属于输入问题 $q$ 的连续子串。节点代表待求解的目标实体或抽象核心概念,边则表示它们之间的逻辑依赖与属性约束。在后续的整个搜索推理生命周期中,$G_0$ 的拓扑结构始终保持固定,作为全局的防漂移“约束骨架”。
附加在固定骨架之上的,是随轮次推进而动态演进的结构化状态 $S_i = (F_{\leq i}, \mathcal{C}_i, \Sigma_i)$。这一状态由三个关键子集构成:
-
累计已验证事实集 $F_{\leq i} = \bigcup_{s=1}^{i} F_s$,记录搜索过程中被工具观察结果证实无误的原子事实,起到防止重复检索的天然备忘录作用;
-
节点候选实体域 $\mathcal{C}_i$,为每个抽象节点维护一份经过筛选的候选实体清单,并显式标注支持证据、违规证据及置信度等级;
-
全局一致性状态 $\Sigma_i$,跟踪各条约束路径的满足情况、矛盾检测结论以及整体推理进度。
在每一轮局部的“思考—行动—观察”探索中,Agent 并不是直接面对无边无际的原始历史长文本,而是接收一份由 $G_0$ 和最新状态 $S_{i-1}$ 序列化而成的结构化提示。Agent 清晰地知晓当前未解决的图节点位于何处、哪些事实已被锁定无需重查、以及哪些候选实体仍存有疑点,从而生成极具针对性的检索动作。一旦本轮探索结束,状态转移函数 $\Psi$ 会从新生成的轨迹中抽取新的原子事实,刷新候选池置信度,并将更新后的状态 $S_{i+1}$ 传递给下一轮。
单调递增定理:长程搜索防退化机制
在多轮长程交互中,另一个普遍存在的隐患是“灾难性遗忘”——后期的更新过程可能覆盖或稀释掉前期的有效证据。为了保证搜索过程不仅在形式上图谱化,且在数学性质上具备单调收敛性,G-ReAct 在状态转移过程中引入了三项显式的抗退化保护机制:
-
事实集合的“纯追加”(Append-only)合并:新提取的事实 $F_i^{(\mathrm{new})}$ 仅在与既有集合不产生语义冗余时并入,历史已确认事实绝不允许被直接剔除。
-
候选实体置信度单调更新:对于重复出现的候选实体,其置信度取历史最高评级 $\gamma^{(i+1)} = \max(\gamma^{(i)}, \gamma^{(\mathrm{new})})$,证据集合同样取并集累加。
-
高置信度候选强制保护:凡在前期轮次中已被标定为“高置信度”的候选实体,若在后续某一轮的局部抽取中偶然缺失,系统会自动将其重新注入候选池。
基于这套机制,本文给出了一个极为优雅的理论性质——单调状态演进(Monotonic State Progress)。该命题证明了:在严格文本锚定的图拓扑约束下,已验证事实集随轮次单调不减;候选实体的置信度评级单调非降;且所有高置信度实体均得到持久保留。鉴于针对具体问题的可验证原子事实总量是有限的,且置信度评级取值在离散有界集合内,该状态空间决策过程必然在有限步骤内收敛至不动点。相比之下,传统的线性推理没有任何只增不减的确定性保证,长上下文窗口膨胀越厉害,早期重要细节被“冲刷覆盖”的风险就越大。
仅用 1.9K 样本打破规模神话的实证表现
为了隔离轨迹结构化本身带来的增益,作者并未依赖海量爬虫数据进行盲目预训练,而是采用了严格受控的实验对比策略。基座模型选用了 Qwen3-30B-A3B-Thinking-2507,训练方式仅采用标准监督微调(SFT),硬件环境为 2 台 8 卡 A100。最具说明性的对比来自相同问答对池的受控实验:研究团队从知名开源项目 OpenSeeker-v1 中严格采样了 1,898 个问答对,仅将其推理轨迹从原先的线性格式重构为 G-ReAct 的图状态演化格式。
在由复杂多跳网页任务构成的权威评测集 XBench-DeepSearch 上,经过这 1.9K 样本微调后的 30B 模型,取得了惊人的 79.0% pass@1 准确率。这一成绩不仅大幅领先原始的 OpenSeeker-v1-SFT(74.0%),更是以超过 20 倍的参数量差异,直接超越了 DeepSeek-V3.1-671B(71.2%)等顶尖超大规模开源模型。在中文高难基准 BrowseComp-ZH 上,G-ReAct 取得了 52.6% 的高分,战胜了参数量高达 357B 的 GLM-4.6(49.5%);在全英文的多模态与长程综合评测 GAIA(文本子集)上,它亦达到 64.2%,全面压制了 WebDancer、WebSailor 与 MiroThinker。
数据效率的对比同样具有说服力。以开源深度搜索模型 MiroThinker 为例,后者堆叠了多达 147K 条轨迹(数据量高出 77 倍)并结合了复杂的强化学习管道,但无论在 BrowseComp 还是 XBench 上,其表现均不及仅靠 1.9K 轨迹纯 SFT 微调的 G-ReAct。在针对 DeepDive 的平行对照中,相同的 618 个底层问答对经 G-ReAct 流程重构后,在 BrowseComp、BrowseComp-ZH 和 XBench-DS 上的表现分别暴涨了 15.8、24.2 和 26.0 个百分点。这充分说明,过去许多依赖超大规模轨迹训练与强化学习探索所试图获取的推理能力,很大程度上是在修补线性 ReAct 状态漂移造成的内耗;一旦在表示层赋予 Agent 显式的图约束与状态追踪,监督信号的有效传递效率便会发生质的飞跃。
推理期即插即用:更少步骤,更高准确率
除了作为生成高质量微调轨迹的数据范式,G-ReAct 另一大极具工程价值的特质在于其对纯推理期(Inference-time)的原生支持。这意味着无需对外部黑盒大模型做任何参数调整,仅通过外置的图初始化与状态演化提示词流转架构,就能作为插件直接赋能业界现有的顶级模型。
实验对包括 OpenAI-o3、Claude-Sonnet-4.5 以及 doubao-seed-2.0-pro 在内的前沿闭源模型进行了推理期外挂评测。结果显示,G-ReAct 在 BrowseComp-ZH 上带来了全面的性能拉升:doubao-seed-2.0-pro 的准确率由 64.71% 跃升至 71.28%(净增 6.57 个百分点),Claude-Sonnet-4.5 提升 4.84 个百分点(达到 43.94%),即便推理能力极强的 o3 也提升了 2.54 个百分点。
更重要的是,精度的攀升并未伴随调用成本的膨胀。评测显示,在准确率提升的同时,上述三款主流模型在完成任务过程中的平均工具调用次数(Avg. Tool Calls)分别降低了 1.10 次、1.41 次和 1.49 次。在以往的 Agent 系统中,性能提升往往是靠“更多轮次的暴力搜索与重试”换取的;而 G-ReAct 展现出的“精度提升与调用步数下降并存”,完美呼应了其设计初衷——由于状态演化显式阻断了针对已验证事实的重复检索,并把后续思考严格约束在未闭合的图分支上,Agent 因而能够迅速直击证据要害,以极高的步数效率达成全局收敛。
消融实验揭示的系统取舍
为了剖析框架中各组件的实际作用,研究团队在基准上进行了组件剥离与超参数敏感度测试。
当从框架中移除作为全局支架的“查询图(Query Graph)”时,模型在信息高度分散的 XBench 上出现了剧烈性能滑坡,而在相对更依赖单点事实检索的 BrowseComp-ZH 上降幅稍缓,这证实了拓扑图在引导复杂多源信息归纳聚合时的骨架作用。反之,当剥离“状态演化(State Evolve)”模块、退回到静态图约束时,两个基准上的表现均出现显著衰减,证明动态维护候选集与抗退化状态对于抑制长程推理漂移不可或缺。
在关于状态更新颗粒度的窗口设计实验中,作者对比了 32K、64K、96K 和 128K 四种不同的滑动窗口大小。数据表明,64K 窗口在所有指标上均达到了最优峰值。过小的窗口(32K)会导致状态整合过于频繁,粗暴打断模型在当前子目标上的思考与探索连贯性;而过大的窗口(128K)则重蹈了长上下文衰减的覆辙,使得模型在状态被重新结构化前就已陷入局部信息丢失与噪声干扰。在长程推理中,计算效率与状态整合频率之间存在着清晰的工程平衡点。
从单纯依赖规模到重构推理基质
长期以来,提升大模型在复杂任务上的推理上限主要有两条路线:在预训练期堆叠参数量与高质量语料,或在后训练期通过强化学习鼓励长思维链自我修正。然而,随着长程 Agent 任务复杂度的指数级上升,完全依赖模型内在注意力在扁平上下文空间中维持超长跨度的多维状态,正遭遇越来越严峻的边际效应递减。
G-ReAct 的出现给社区带来了极具启发性的思考:在追求更大模型、更强算力、更长 Token 窗口的同时,推理基质(Reasoning Substrate)本身的表征范式同样是一条决定性的演进维度。通过把无序的、线性的文本历史,转化为拓扑守恒、状态单调更新的双层图结构,深度搜索系统能够在极小的训练代价下获得强健的抗退化能力,并以更高效率将多跳逻辑一一闭环。这一结构与状态共演化的设计,不仅重塑了深度搜索的技术实现路径,也为未来各类需要超长交互周期、强状态追踪与严格逻辑一致性的自主 Agent 系统,提供了兼具理论自洽性与工程实用性的落地蓝图。