Harness-G:别再让搜索Agent自由写Query!图结构导航让小模型提升10.74分
Harness-G: A Graph-Structured Harness for Search Agents
在强化学习驱动的大模型搜索智能体(RL Search Agent)研究中,一个长期被默认的设定是:智能体应当像人类一样,自由生成自然语言检索词(Free-form Query),通过搜索引擎拉回文档,再根据最终生成的答案正确率通过强化学习(如 GRPO)更新策略。从 Search-R1 到诸多后续工作,研究重心大都放在了如何设计更密集的奖励函数、如何做过程监督,或是如何让思考链变得更长。
ArXiv URL:https://arxiv.org/abs/2607.27652
然而,最新的一篇研究《Harness-G: A Graph-Structured Harness for Search Agents》直击了这个架构底层的盲区:让大语言模型自由生成 Query,可能在根本上破坏了强化学习的探索机制。作者团队发现,在常规训练过程中,搜索智能体看似生成了措辞迥异的丰富检索词,但实际检索返回的证据集合重合度却极高——模型陷入了虚假的“检索等价坍塌”。这导致在同一道题目采样的多条轨迹中,检索层面的有效差异被抹平,组内相对优势(Within-group Advantage)彻底消失,强化学习算法根本分不清到底哪次检索更优。
针对这一系统性缺陷,本文提出了 Harness-G 框架。它彻底重构了策略与检索环境之间的交互接口,将开放式的“自由写 Query”转变为在“段落-句子-实体”三部图上的“有限离散动作选择”。智能体不再被允许天马行空地写搜索词,而是在环境呈现的候选菜单中执行句子确认(Select)、实体钻取(Lookup)或直接作答(Answer)。在此基础上,团队提出了结构化非短视信用分配机制(SNC),通过只读预览直接量化同状态候选动作的相对优劣,并将下游的多跳增益反向传导给早期的“铺路”动作。实验结果表明,在六大公开问答基准上,Harness-G 在 1.5B 模型上相比最强基线 Graph-R1 取得了高达 10.74 点的平均 F1 提升,在 3B 模型上也取得了 3.98 点的稳定提升,充分证明了离散动作空间对提升搜索智能体推理质量的巨大价值。
自由 Query 的幻象:什么是“检索等价坍塌”?
要理解 Harness-G 的设计初衷,必须先看清当前大语言模型在做检索增强推理时遇到的本质困境。在类 GRPO 算法中,模型需要针对同一个输入问题采样多条轨迹,通过组内各轨迹回报的对比来确定优势函数,进而更新策略分布。这套逻辑成立的前提是:采样的轨迹必须在决策空间中具备真正的对比度。
但在自由文本检索的设定下,这种对比度往往是虚幻的。自然语言具备极高的同义冗余,大语言模型可以轻松生成形形色色但语义完全等价的 Query。例如,针对“某导演的第一部电影拍摄于哪一年”,模型在不同采样中可能分别生成“某导演 处女作 年份”、“某导演 第一部电影 拍摄时间”、“某导演 早期作品 历史”。从生成概率和 Token 多样性来看,模型的探索非常活跃;但将这些检索词送入现存的密集检索引擎(如 BM25 或向量召回)后,返回的文章切片几乎是一模一样的。
论文将这一现象定义为检索等价坍塌(Retrieval-equivalence collapse)。研究人员在监控 Search-R1 的训练过程时发现,尽管模型在字符串层面的 Query 多样性始终保持在较高水平,但按照实际召回证据集聚类得出的检索结果多样性却遭遇了断崖式下跌。在训练仅仅进行到第 30 步时,采样轨迹能够覆盖多个检索结果等价类的比例,就从最初的约 $86\%$ 暴跌到了 $10\%$ 以下。
这种坍塌给强化学习带来了双重打击:
-
组内优势消失:如果所有采样轨迹召回的证据高度重合,最终答对或答错往往高度一致,组内不同轨迹的回报几乎相等,算法无法计算出有效的梯度信号。
-
检索信用被严重混淆:如果两组拿到相同证据的轨迹最终给出了不同答案,这种回报差异其实完全源自下游生成或推理过程中的随机扰动,而不是检索决策本身更优。此时强行将最终答案的奖励折算给检索动作,反而会给策略提供完全错误的信用反馈。
许多学者尝试引入信息增益奖励或更密集的过程打分模型(PRM)来挽救训练,但论文尖锐地指出,只要“自由 Query 到检索结果”的多对一映射本质没有改变,单纯在下游修补奖励信号就无法根本解决探索坍塌的问题。唯一的根治方法,是重新定义策略与环境的交互边界。

重新定义接口:从自由创作到图上离散导航
Harness-G 的核心思想可以用一句话概括:将非结构化的自由文本检索,降维为图结构知识网络中的有限离散动作选择。
正如上图所示,在传统的自由 Query 接口中,策略模型需要同时承担“决策要查什么”和“组织检索语句”两项职责,这极易引发语言表述上的混淆。而在 Harness-G 框架下,检索环境主动接管了检索词的拼装与检索状态的追踪,策略模型每一步只需要面对一个严格受限的菜单,通过输出离散的动作 ID 来完成交互。
整个系统建立在一个纯程序化构建的三部图(Tripartite Graph)之上。与常见依赖昂贵大模型做信息抽取的 GraphRAG 不同,Harness-G 的建图过程完全不需要调用大模型提取三元组,而是通过句子切分、基础命名实体识别(NER)以及向量编码在近线性时间内完成。图中包含三类基础节点与四类边:
-
段落与句子节点:段落作为宏观上下文,句子则是最小证据粒度,段落与句子之间连边。
-
句子与实体节点:记录实体在句子中的提及情况,实体在此充当了跨文档、跨句子跳跃的语义桥梁。
-
句子与相邻句子节点:允许在不直接暴露整个冗长段落的前提下,沿着文本流进行局部上下文扩展。
-
实体与实体节点:仅基于字面归一化、标题锚点和向量相似度连接高同义实体,仅作为候选召回的补充。
在这一底层图结构的支撑下,智能体与环境展开多轮交互。在每个决策时刻 $t$,智能体的观测状态包含问题 $q$、已确认证据集合 $C_t$、当前可见的候选句子集合 $U_t$、已访问实体集合 $V_t$ 以及历史动作轨迹 $H_t$。环境会根据当前状态,动态生成一个去重、过滤后的有限动作菜单 $M_t$。策略模型在此只能执行三类严格定义的动作:
-
$\textsc{Select}(s)$:从当前可见的句子候选池 $U_t$ 中选中句子 $s$,将其固定加入已确认证据集 $C_{t+1}$ 中。最终作答时模型只能基于已确认的证据作答,从而锁动作答依据。
-
$\textsc{Lookup}(e)$:针对某一实体 $e$ 进行深度探查。此时策略模型只需要选定实体 ID,环境会自动将问题 $q$ 与当前已确认证据拼接为规范检索词,在实体周围的关联句子和邻居子图中拉取候选,填充到下一次的可见句子集合中。
-
$\textsc{Answer}$:终止检索流程,直接结合已固化的证据集给出最终答案。
这个接口设计带来了三个极其关键的环境性质:有限性(Finiteness),菜单大小受预设上限严格约束;可校验性(Verifiability),非法或重复的动作在菜单生成阶段就被物理剔除,模型无法生成语法错误或死循环的检索;最重要的是可预览性(Previewability),由于所有图操作都是确定性的只读索引变换,环境可以在不修改真实全局状态的前提下,直接计算出如果执行菜单中某一项将会引入哪些新增证据。这一特性,为后续极其优雅的信用分配打下了基础。

破解多跳归因难题:结构化非短视信用(SNC)
在多跳复杂推理场景中,强化学习面临的最大痛点之一就是“早期铺路动作难以获得即时奖励”。在一个需要跨越三步的推理链条中,智能体在第一步检索出来的中间实体可能本身不包含任何答案信息,但如果没有这一步的搭桥,后续的决定性证据就永远无法被拉取出来。如果完全依赖最终答案的稀疏奖励,策略在长链条下极难收敛;如果仅凭单步的新增信息量做即使奖励,模型又会陷入短视,偏好那些表面包含答案关键词但实际并不相关的干扰项。
依托 Harness-G 的可预览性,研究团队提出了结构化非短视信用(Structured Non-myopic Credit, SNC)。SNC 由两个协同运作的分量构成,且全过程完全由环境通过离线模型打分计算,不需要任何额外的数据采样或单独训练的奖励模型。
第一个分量是前沿相对优势(Frontier-relative advantage, $r_t^{\mathrm{fr}}$)。它解决的是“当前动作是否比同状态下的其他选择更优秀”。环境利用一个参数冻结的问答打分器 $g(O) = P_{\bar{\theta}}(y^* \mid q, O)$,评估在观测证据 $O$ 下真实答案 $y^*$ 的生成概率。得益于动作菜单的可预览性,对于菜单中的任意候选动作 $a$,环境都能在毫秒级时间内算出如果执行它所能带来的边缘概率增益 $p_t(a) = g(O_t \cup \widetilde{U}(a)) - g(O_t)$。进而算出候选池的平均增益 $\bar{p}_t$,最终给出局部相对优势:
\[r_t^{\mathrm{fr}} = p_t(a_t) - \bar{p}_t\]这个设计的精妙之处在于:如果菜单中的多个选项引入的证据是冗余等价的,它们计算出的边际增益将完全一致,此时 $r_t^{\mathrm{fr}} \approx 0$。模型不会因为在几个同质化选项中做出了表面选择而获得廉价奖励;只有当它选出的动作切实压倒了同状态下的其他候选动作时,才能拿到正向信用。这在自由文本 Query 空间中是绝无可能实现的。
第二个分量是结构化赋能信用(Structured enablement credit, $r_t^{\mathrm{en}}$)。它专门用于奖励早期的“修桥铺路”行为。在整个交互轨迹中,环境记录了一张无环的因果依赖图 $\mathcal{D}_\tau$:如果步骤 $u$ 消耗的实体或句子是由早期的步骤 $t$ 检索引入的,系统就在步骤 $t$ 和 $u$ 之间连上一条溯源边 $(t, u)$。
当轨迹结束时,SNC 沿着这张依赖图,按照拓扑反向顺序,将下游步骤产生的增益衰减反哺给上游步骤:
\[R_u = p_u(a_u) + \gamma r_u^{\mathrm{en}}, \qquad r_t^{\mathrm{en}} = \sum_{u: (t, u) \in \mathcal{D}_\tau} \frac{R_u}{\lvert \mathrm{Pred}(u) \rvert}\]其中 $\mathrm{Pred}(u)$ 代表步骤 $u$ 依赖的所有前置决策步骤集合。通过这种跨步信用传导,一个在第一步看似没有增加任何答案概率的实体检索动作,如果后续直接催生了关键事实的发现,就能分得下游的丰厚奖励。
在与 GRPO 算法整合时,SNC 并不篡改轨迹本身的最终结果奖励(Token 级 F1 计算出的 $R_i^{\mathrm{out}}$),而是将 SNC 步骤优势平摊到该步骤的模型输出 Token 上,经过全局批次归一化后,以加权双流的形式与结果优势相加:
\[\hat{A}_{i,k} = \hat{A}_i^{\mathrm{out}} + \lambda \hat{A}_{i,k}^{\mathrm{SNC}}\]这种机制在保留强化学习对终局目标优化的同时,为每一步离散图决策注入了极低方差、极具对比度的中间引导信号。
实验评测:小模型的大幅度性能跃迁
为了检验 Harness-G 的真实威力,论文在六个极具代表性的开放问答基准上进行了全方位评测,涵盖了以 2WikiMultiHopQA、HotpotQA、MuSiQue 为代表的多跳长链推理,以及以 NQ、PopQA、TriviaQA 为代表的单跳开放域检索。基线覆盖了从标准 RAG、Search-R1、IGPO 到最新的 Graph-R1 以及基于 GPT-4o-mini 构建的各类 GraphRAG 变体。
实验的核心结论展现了极强的技术说服力。在 Qwen2.5-3B 规模下,Harness-G 取得了 55.24 的平均 F1 分数,全面超越了此前最先进的图检索强化学习基线 Graph-R1(高出 3.98 个点)。而在长链多跳任务上,这种优势被进一步放大:在 2Wiki、HotpotQA 和 MuSiQue 上,F1 相比 Graph-R1 分别提升了 7.97、9.12 和 5.95 个点,三个多跳数据集的平均涨幅达到了惊人的 7.68 个百分点。
更值得关注的是模型在 1.5B 极小参数规模下的表现。在过去,参数量较小的模型由于指令遵循和语言生成能力受限,在面对自由检索任务时往往极易陷入乱查、重复查和幻觉崩塌的死循环。但在 Harness-G 严格约束的图菜单环境下,Qwen2.5-1.5B 的平均 F1 从 Graph-R1 的 40.09 飙升到了 50.83,绝对提升幅度高达 10.74 个点,在所有评测数据集上均完胜 Graph-R1。这一现象有力地证明了一个常被忽视的系统设计原则:当模型计算容量有限时,与其强求它在开卷状态下做自由生成,不如将检索世界结构化为一个可验证、可执行的离散空间,让模型把宝贵的算力集中在纯粹的决策判断上。
在关于零优势组(Zero-Advantage Groups)的消融分析中,Harness-G 的训练动态呈现出与 Search-R1 截然相反的健康曲线。传统的 Search-R1 训练初期,零优势组占比迅速上升,但绝大多数属于“全答错”导致的无效探索;而 Harness-G 的零优势率在第 10 步左右触底(约 23%),随后逐步回升,而后期的回升几乎全部是由“全答对”驱动的。这说明模型经历了一个真正的从高多样性探索到高质量收敛的演进过程。
同时,针对 SNC 的成分剥离实验也验证了双分量设计的必要性:完全移除 SNC(即仅依赖最终 F1 结果奖励)会导致 2Wiki 和 HotpotQA 的 F1 分别下跌 3.08 和 4.55 个点;单独剥离前沿相对优势 $r^{\mathrm{fr}}$ 或赋能信用 $r^{\mathrm{en}}$ 都会带来可观的性能滑坡,说明同状态动作横向对比与跨步骤纵向回传在多跳决策中缺一不可。
系统开销与跨领域泛化:工程落地是否现实?
对于工业界落地而言,很多建立在图结构之上的方案往往伴随着高昂的索引成本和缓慢的在线响应。Harness-G 在这方面展现出了反直觉的工程优势。
由于 Harness-G 的图谱完全是程序化、规则驱动构建的,没有任何依赖大模型抽取三元组的环节,其建图阶段的 API 费用为 0 美元,在 2Wiki 语料上建图耗时仅为每千 Token 0.12 秒;相比之下,基于大模型提取实体关系的传统方案不仅需要消耗数美元的 API 额度,耗时往往高出数倍甚至数十倍。在线交互阶段,尽管 Harness-G 倾向于进行更多轮次的精细交互(平均交互步数达到 3.6 步),但由于它每次交互只需输出极其简短的动作 ID,其端到端生成的响应 Token 长度(约 2.5k Tokens)反而远低于自由 Query 方案(往往超过 4k Tokens)。模型不再需要写下一长串废话去组织检索词,整套系统的吞吐效率更高。
而在算法鲁棒性与迁移能力层面,Harness-G 同样通过了严苛的考验:
-
底座与算法解耦:当将底层骨干模型切换至 Qwen3.5-4B 或 Llama-3.2-3B 时,Harness-G 保持了完全一致的性能优势;将其背后的优化算法从 GRPO 替换为 PPO、REINFORCE++ 甚至最新的 DAPO 时,训练动态均保持高度稳定,未出现恶性崩溃。
-
域外(O.O.D.)强泛化:在“单数据集训练、全六数据集跨域测试”的 30 个零样本迁移评测组合中,Harness-G 在其中 21 个组合上击败了 Graph-R1,将跨域平均 F1 从 44.10 提升至 47.38。这表明智能体在图结构中学到的是通用的跨跳跃导航策略,而非对特定数据分布的文本死记硬背。
总结与技术启示
Harness-G 的价值,绝不仅仅在于多跳问答基准上那几个百分点的指标刷新,而在于它对当前智能体系统架构的一次深刻审视与修正。
当业界沉迷于让大语言模型“像人一样自由思考、自由写检索词、自由调用工具”时,往往忽略了强化学习算法本身的数学本质——RL 需要明确的动作空间、可区分的状态转移和具有对比度的探索分布。将一切工具调用包装成无序的自回归文本生成,表面上保留了交互的灵活性,实则在底层引入了巨大的语言冗余、检索等价坍塌以及灾难性的信用归因难题。
Harness-G 告诉我们,给大模型带上合理的“马鞍”(Harness),把检索环境封装为结构明确、可验证、可预览的离散动作图谱,不仅没有阉割模型的推理能力,反而为其提供了精准探索的高速通道。这种“离散导航决策归模型,规范执行与状态追踪归环境”的软硬解耦范式,或许正是搜索智能体走向工业级可靠与高效的关键破局点。