SearchMaster:零人工标注下自我博弈,搜索智能体准确率提升13.3分
SearchMaster: Grounded and Regulated Self-Play for Search Agents
让大语言模型学会自主调用搜索引擎,已经成为解决长尾事实错误、降低幻觉的核心路径。然而,构建能够胜任复杂多跳检索任务的搜索智能体(Search Agent),面临着极度严苛的数据瓶颈。这类模型不仅需要面对真正需要跨文档整合信息的复杂问题,还需要学会如何高效地使用搜索、打开网页、文本定位等浏览器工具。以往的训练管线往往极度依赖高成本的人工标注问答对、人类专家演示轨迹(如早期 WebGPT 的做法),或是昂贵且更强专有模型的知识蒸馏。
ArXiv URL:https://arxiv.org/abs/2608.01822
为了摆脱对昂贵外部标注的依赖,自我博弈(Self-Play)机制被寄予厚望。如果一个模型能够在本地搜索环境中自行提问、自行检索解答,并在此过程中不断自我强化,搜索智能体的扩展门槛将大幅降低。然而,直接将自我博弈搬到搜索场景时,系统往往会陷入一系列极具欺骗性的陷阱:模型生成的看似复杂的“多跳”问题往往是单篇文档就能解答的“伪多跳”;传统的任务难度评估机制很容易误把浅层检索任务当成优质训练样本;而在交互轨迹中,模型甚至会退化出疯狂打开文档、却不做针对性检索的低效行为。
针对这一系列痛点,来自开源社区的研究者提出了 SearchMaster,这是一个兼具“落地约束(Grounded)”与“行为规范(Regulated)”的搜索智能体自我博弈框架。SearchMaster 仅依靠一个参数量为 9B 的开源单模型(Qwen3.5-9B),让其同时担任“出题者”(Proposer)和“解题者”(Solver),在完全没有人工问答对与专家轨迹的前提下,仅依托本地离线检索环境完成强化学习训练。在六个深度搜索基准测试中,SearchMaster 将底座模型的平均准确率从 38.19% 提升至 51.52%,在离线基准 BrowseComp-Plus 上取得了 30.1 个百分点的绝对提升,并且展现出直接迁移至真实开放互联网检索的强劲泛化能力。

自我博弈做搜索,模型究竟在哪些地方“作弊”?
大模型在自我博弈中生成数据并不罕见,但搜索场景与纯数学推理或代码生成有着本质差异。在数学或代码环境中,验证逻辑是形式化且封闭的;但在搜索环境中,环境是非结构化的海量文本,工具交互链条极长,这导致模型很容易在“虚假繁荣”的轨迹中自我迷失。作者在论文中指出了三种典型的失效模式:
第一种是伪多跳问题(Pseudo Multi-hop Questions)。即使在 Prompt 中严格要求 Proposer 浏览多个网页并提出需要交叉验证的难题,模型在探索时依然倾向于“偷懒”。常见的情况有两种:一是模型虽然先后检索了多个文档,但生成的问题实际上只需要第一个种子文档的内容即可回答;二是模型虽然在探索轨迹中触达了相关文档,但在合成问题时丢失了跨文档的逻辑桥梁,导致解题者在答题时通过单个文档的内容就能绕过推理、直接命中答案。这种数据喂给强化学习,无法教会模型真正的多步跳跃检索。
第二种是失真的难度估计机制。在以往的自我博弈框架中,出题者生成的题目难度通常直接用解题者的成功率(Success Rate)来代理——例如,成功率在 50% 左右的题目被视为难度适中、信息增益最大的优质样本。但在搜索任务中,成功率中等并不等同于任务需要深层检索。一个仅仅涉及冷门偏僻实体、只需单次关键词匹配却容易看漏的浅层任务,其解答成功率可能也很低;相反,一个逻辑链条清晰、但必须连续发起四五次搜索才能拼接出证据的深度检索任务,反而可能被模型稳定解出。单纯以成功率为指标,会导致训练数据充斥着浅层生僻题,而非真正的深搜题。
第三种是工具调用的结构性异化(Over-Opening)。为了解答问题,搜索智能体通常配备了 search(搜索关键词)、open(打开特定网页)和 find(页内定位)三类工具。在试错探索中,打开文档往往能直接暴露出大量正文信息,模型很容易产生局部依赖:频繁地 open 搜索列表里的前几个网页,或者反复打开已经浏览过的文档,而吝于通过重新规划关键词发起更有针对性的 search。这种轨迹虽然表面上步数很长、消耗了大量 Token,但其检索视野极为狭窄,属于长而浅的无效浏览。
三大支柱:如何约束出题与解题轨迹?
SearchMaster 的核心思想并不在于一味放大合成数据的吞吐量,而是通过规则与奖励函数对自生成的监督信号进行“锚定”与“规范”。整个框架由三大机制构成:证据链生成器、搜索深度奖励以及过度打开惩罚。

1. 证据链生成器(ECG)
为了彻底杜绝伪多跳问题,SearchMaster 强制出题者在探索阶段必须显式地构建跨文档证据链(Evidence Chain)。出题者以未标注的种子文档 $d$ 为起点,在与环境交互的过程中,逐步记录每一个步骤的检索依据,并将多个文档中的核心事实拼接为一个连贯的因果或属性推导链条 $c$。
随后,出题者被强制要求基于完整的证据链 $c$ 衍生出最终问题 $q$ 与参考答案 $y^\star$。在进入解题阶段前,候选任务必须通过严格的质量过滤:过滤掉未能形成有效证据链的任务、格式残缺的任务,以及那些无需调用工具直接靠模型内部参数知识就能回答的无检索任务。通过将证据链显式化并作为强制前置条件,框架从源头上阻断了单文档信息的泄漏。
2. 搜索深度奖励(SDR)
为了让模型学会面对真正需要深层探索的难题,SearchMaster 摒弃了仅凭成功率筛选任务的传统做法,引入了搜索深度奖励机制。对于通过初筛的任务,由解题者独立执行 $K_S$ 次求解轨迹(Rollout)。系统不仅记录解答正确的次数 $C=\sum_{i=1}^{K_S} z_i$(其中 $z_i \in {0, 1}$ 为冻结 Verifier 给出的对错判定),更关键的是记录每一次成功轨迹中的搜索深度 $h_i$——即轨迹中包含的不重复搜索查询(Unique Search Queries)数量。
如果一个任务在 $K_S$ 次尝试中完全无人解出($C=0$)或者全部轻松解出($C=K_S$),说明任务过难或过易,仅赋予基础的保底奖励 $r_0=0.2$。而对于有部分成功的任务,系统提取成功轨迹中的最小搜索深度:
\[h_{\min} = \min_{i:z_i=1} h_i\]进而计算出题者的搜索深度奖励:
\[r_{\mathrm{sdr}} = r_0 + (1 - r_0) \min\!\left(\frac{h_{\min}}{H_{\mathrm{sdr}}}, 1\right)\]其中 $H_{\mathrm{sdr}}$ 为预设的深搜上限阈值(论文中设为 10)。这一设计巧妙地构建了正向牵引力:出题者要想拿到高分,不能靠出冷门偏门题去刁难解题者,而必须构造出那些“解题者经过多步独立搜索后确实能够攻坚成功”的任务。出题者因此被迫演进出更强的信息组织能力,而解题者也获得了高难度的训练靶子。
3. 过度打开惩罚(OOP)
针对模型在工具调用中容易偏向“多看网页、少换词搜索”的低效退化,SearchMaster 设计了过度打开惩罚机制。该机制监控轨迹 $\tau$ 中的 open 调用次数与 search 调用次数之比:
这里的参数设置极具现实考量。框架并不是禁止模型打开文档(例如正常的搜索行为中,一次搜索后查看 1 到 2 篇网页完全合理),而是将起惩阈值 $\alpha_{\mathrm{oop}}$ 设为 1.5,峰值惩罚阈值 $\beta_{\mathrm{oop}}$ 设为 2.5。当文档打开与搜索的比例处于合理区间时,惩罚为零;一旦模型开始沉迷于不假思索地逐个打开文档、或者反复重读已有文档时,惩罚线性增加并从最终奖励中扣除:
\[r_j^P = b_j^P - \lambda_{\mathrm{oop}}\rho_{\mathrm{oop}}(\tau_j^P)\] \[r_i^S = b_i^S - \lambda_{\mathrm{oop}}\rho_{\mathrm{oop}}(\tau_i^S)\]这一项惩罚同时施加在 Proposer 和 Solver 两端,使得整个博弈生态在出题和解题两端都朝着“精准提炼关键词、少做低效冗余浏览”的方向演进。
联合优化架构:单模型双角色与 GRPO 对齐
在实现架构上,SearchMaster 没有采用多模型体系,而是由单一共享参数的策略网络 $\pi_\theta$ 承担出题者与解题者。这种单模型架构大幅节约了显存占用与维护开销,但带来了一个训练稳定性的挑战:解题轨迹的采样数量远多于出题轨迹,容易造成梯度主导权失衡。
每个种子文档 $d$ 会触发 Proposer 采样 $K_P=8$ 条出题轨迹,并通过四个过滤门控产生合格任务。每个合格任务又会触发 Solver 进行 $K_S=8$ 条独立解题采样。如果将所有 Solver 的轨迹全量投入强化学习,更新梯度将会完全被 Solver 淹没,出题策略的演进将被边缘化。
为了维持出题与解题能力的同步进化,SearchMaster 引入了种子级筛选网关(Seed-level Quality Gate):
-
如果一个种子文档所衍生出的所有任务,其最终奖励都未能突破基线奖励 $r_0$(即要么全错、要么全对、要么未通过过滤),则直接将该种子文档产生的所有数据废弃。
-
在保留的合格种子中,系统仅挑选出题奖励最高的那一个任务,并仅保留该任务对应的 $K_S$ 条 Solver 解题轨迹。
最终,每个保留下来的种子文档贡献且仅贡献两个样本组:包含 $K_P$ 条轨迹的 Proposer GRPO 组,以及包含 $K_S$ 条轨迹的 Solver GRPO 组。二者共同构成大小为 $K_P + K_S = 16$ 的样本集,并统一采用组相对策略优化(Group Relative Policy Optimization, GRPO)目标进行端到端微调:
\[\mathcal{L}(\theta) = -\mathbb{E}_t\!\left[\min\!\big(\gamma_t \hat{A},\ \mathrm{clip}(\gamma_t, 1-\epsilon_{\mathrm{low}}, 1+\epsilon_{\mathrm{high}})\hat{A}\big)\right] + \beta_{\mathrm{KL}}\,\mathbb{E}_t\!\left[\mathrm{KL}\!\left(\pi_\theta\,\|\,\pi_{\mathrm{ref}}\right)\right]\]通过这种对称配比,策略网络在每一轮迭代中都能均衡地学到“如何生成高质量的交叉检索难题”与“如何用最精炼的工具操作破解长程搜索任务”。
实验评测:不仅刷新离线基准,更成功迁移真实开放网络
为了验证纯自驱学习的有效性,作者在 OpenResearcher 提供的离线维基与网页语料库(约 1500 万篇文档、110 亿 Token)上构建了本地检索环境,并使用 Qwen3-Embedding-8B 构建 FAISS 检索索引。底座模型选用开源的 Qwen3.5-9B,整个强化学习过程仅历经 20 轮迭代,实际用于参数更新的合格种子文档仅有 1280 个,计算开销保持在极度精简的范围内。
评测覆盖了 1 个离线基准与 5 个基于实时互联网的在线搜索基准。离线基准 BrowseComp-Plus 包含了 830 道高质量浏览推理问题,且该基准使用的检索底层语料与 SearchMaster 训练环境来源完全独立;在线基准则包括 BrowseComp、GAIA(纯文本工具使用子集)、SEAL-0(长尾深度搜索)、WebWalkerQA(跨页面复杂导航)以及 XBench-DeepSearch。
实验得出了几组极具说服力的核心结论:
首先是离线基准的大幅跃升。在 BrowseComp-Plus 评测中,初始的 Qwen3.5-9B 底座模型的准确率仅为 30.12%,而在经过 SearchMaster 的自我博弈训练后,准确率直接翻倍达到了 60.24%,实现了 30.1 个百分点的绝对增益。这一表现不仅大幅超越了未加规范的朴素自我博弈基线,也显著领先于同等参数量下依赖监督微调(SFT)的模型。
更为关键的是离线训练向真实实时网络的泛化能力。很多在本地沙箱中训练的 Agent 容易发生环境过拟合,一旦放到充斥着噪音、格式不规范、链接失效的真实开放互联网中便手足无措。然而,SearchMaster 展现出了优异的迁移泛化性。在完全不接管上下文窗口管理机制、单条轨迹允许长达 200 次工具调用的严苛条件下,模型在 5 个实时网络基准上全部取得了稳健的性能提升:
-
在注重多页面复杂导航的 WebWalkerQA 上,准确率实现了 18.2 个百分点的显著提升;
-
在极其考验工具链综合执行能力的 GAIA 上,提升了 6.8 个百分点;
-
在长尾搜索基准 SEAL-0 与 XBench 上同样获得了全面增长。六大基准综合平均分从 38.19% 稳步拉升到 51.52%(净增 13.3 点)。这充分证明,模型学到的是本质的“搜索策略逻辑”,例如如何分解问题实体、如何根据返回摘要调整下一次检索词、何时该打开页面验证细节,而不是特定语料库的记忆。
消融实验进一步印证了三项核心机制不可或缺的协同效应。在去除 ECG 后,出题者生成的伪多跳问题比例大幅反弹,导致 Solver 的训练信噪比骤降;若将 SDR 替换回传统的“成功率倒置奖励”(让成功率在 50% 的任务拿最高分),模型平均准确率明显下滑,因为系统开始倾向于生成那些依靠生僻词匹配的浅层任务;而如果没有 OOP 机制,出题者与解题者两端的 open / search 比例在训练过程中会不可逆地持续攀升,模型逐步退化为冗长的浅层页面刷屏者。OOP 机制的介入,成功将两端的比例稳定压制在 1.5 至 2.0 的高效操作区间内。
对未来 Agent 自我演进的技术启示
SearchMaster 的成功,给当前大模型向自主智能体(Autonomous Agents)演进的路线提供了两点深刻启示:
第一,合成数据的核心矛盾已经从“量”转向了“轨迹规范”。大模型自我提问并不难,难的是如何建立物理世界或信息环境的“真实摩擦力”。通过引入基于真实文档图谱的显式证据链(ECG)与真实检索步数(SDR),SearchMaster 实际上为大模型的自我博弈构建了一道抗幻觉、防作弊的客观标尺。这种机制让模型在探索过程中,无法通过自言自语式的表面推理掩盖事实依据的断裂。
第二,离线高保真沙箱是低成本孵化通用能力的可行解。直接让智能体在开放互联网络上进行数万次强化学习探索,不仅会面临严重的网络波动、页面反爬风控、API 成本高昂等工程瓶颈,而且环境的不确定性极难保证强化学习梯度的平稳。SearchMaster 证明了完全可以在本地固化的海量语料上,通过高强度、高规范的自我博弈将模型的能力打磨扎实,再零样本迁移至复杂的在线真实网络中。
当然,该方案也存在进一步优化的空间。目前整个循环仍然依赖一个静态冻结的 Verifier 来进行事实落地检查与答案判决,在超长文本匹配时依然存在一定的验证开销与潜在漏判;同时,当前实验主要在 9B 级别模型上进行验证,更深尺度的模型规模扩展(Scaling)以及动态网络实时博弈,将是后续值得持续关注的研究方向。但毫无疑问,SearchMaster 为彻底摆脱昂贵专家演示、实现搜索智能体的自主“冷启动与进阶”打下了一根坚实的支柱。