SearchAuditor:近八成搜索失败不是没搜到!审计修复助准确率达45%

SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents

SearchAuditor:近八成搜索失败不是没搜到!审计修复助准确率达45% 论文图示

在大模型迈向“深度研究”(Deep Research)与复杂自主搜索的浪潮中,长程搜索智能体(Long-Horizon Search Agent)成了前沿应用的核心。无论是多跳事实核查、行业竞品穿透分析,还是复杂的科技情报检索,这类智能体通过自主生成检索词、反复翻阅数十个网页、动态更新候选答案,试图解决单次生成无法应对的难题。

ArXiv URL:https://arxiv.org/abs/2608.05212v1

然而,这种长程交互极其脆弱。来自 Joy Future Academy 与伊利诺伊大学厄巴纳-香槟分校(UIUC)的研究团队在最新论文中揭示了一个残酷的现实:搜索智能体的崩溃往往不是戛然而止的报错,而是一场“静默的雪崩”。一个在早期步骤对网页证据的轻微误解,会伴随数十次无意义的搜索逐步放大,最终输出一个语言极其流畅、逻辑看似严密却完全错误的结论。

更颠覆认知的是,研究团队深入分析后发现:高达 77.2% 的智能体失败根本不是因为“搜索引擎没搜到”,而是智能体“不会处理已有的信息”。在整整 25% 的翻车轨迹中,标准答案甚至早已一字不差地躺在智能体之前抓取的网页内容里,却被模型彻底忽视或丢弃;在关键错误发生后,智能体平均还要继续盲目调用 16.7 次工具,白白耗费全流程 47.1% 的生成算力和 45.4% 的工具调用。

为了攻克这一长程诊断难题,该团队不仅构建了首个包含 1,243 条超长失败轨迹的专家标注基准 SearchAuditBench,更提出了多视角审计框架 SearchAuditor。该框架通过并行视角探索与证据锚定裁决,打破了以往“依赖单一大模型硬看上下文”的幻觉困局,在让最前沿模型如 GPT-5.5 驱动的基线模型都止步于 26.6% 通过率的严苛审计任务中,实现了 32.3% 的端到端合格率;而将 SearchAuditor 生成的修复指令注入失败轨迹后,直接让 Kimi-K2.6 在全新评测集上的任务准确率从 34.0% 跃升至 45.1%。

轨迹审计任务示意图

长程搜索的诊断之困:没有测试用例的万字泥潭

为什么诊断搜索智能体的失败如此困难?

对比代码智能体(Code Agent)或工作流智能体(Workflow Agent),后者的执行结果通常有确定性的编译器、单元测试或固定的模式约束(Schema Invariants)作为检验“裁判”(Oracle)。代码跑崩了会有回溯追踪(Traceback),断言失败会直接报错。但在开放网络环境下,网页信息本身充满噪声且瞬息万变,智能体并没有确定性的真值参考。每一次搜索和点击究竟有没有走偏,取决于极其冗长且复杂的证据链推理。

人工排查一条失败轨迹的成本极其高昂。在真实的深度搜索任务中,智能体动辄交互数十轮,平均包含 73.1 条消息,上下文吞吐量高达 65.1K Tokens,其中绝大部分(平均 49.1K Tokens)是被抓取下来的网页原始文本。要在这片噪声海洋中找出哪一步推导出了差错、为什么出错,人类工程师往往需要翻看数十分钟。这种极低的可观测性,严重拖慢了智能体架构的迭代步伐。

若直接将整条轨迹塞给前沿大模型进行端到端审判,大模型往往会被轨迹后期的“表象症状”所吸引。例如,智能体在第 50 步由于无法吻合两份冲突的数据而强行胡说八道,单次阅读的大模型裁判往往会将第 50 步判定为错误根源,却全然忽视了早在第 12 步,智能体就已经错误地将无关实体绑定在一起,后续近 40 步的搜索本质上全是在错误假设下的无用挣扎。

SearchAuditBench:1243 条失败轨迹的“法医解剖室”

为了建立系统化、可复现的评测标尺,研究团队首先打造了专家级基准 SearchAuditBench

SearchAuditBench 概览:数据构建流程、核心统计与六大归因体系

数据源与统一脚手架

为了确保审计任务不仅停留在抽象评测,而是真正反映现实中的复杂模型行为,团队选取了两大类共 8 种具有代表性的开源模型:

  1. 大规模通用大模型:包括 GLM-5.2、Kimi-K2.6、DeepSeek-V4-Pro 以及 Qwen3.5-397B-A17B;

  2. 深度研究专用模型:包括 OpenSeeker、OpenResearcher、Quest-35B 以及 Tongyi-DeepResearch-30B-A3B。

为了剥离不同提示词脚手架(Scaffold)对模型行为造成的干扰,所有 8 个模型均运行在适配自通义 DeepResearch 的统一框架下,仅赋予 search(搜索关键词)和 visit(阅读具体网页)两个基础工具。测试问题来自 BrowseComp、BrowseComp-ZH、DeepSearchQA、Seal-0 以及 xBench-DeepSearch 等 5 个极具挑战性的深度检索基准。

在收集到数千条运行记录后,研究团队筛除了那些答案正确或无法通过轨迹证据确切定罪的样本,最终沉淀出 1,243 条严格可审验的失败轨迹,并在各模型间保持了均衡的分布。

三位一体的诊断要求

面对输入的查询问题 $q$、错误最终答案 $\hat{a}$ 以及完整轨迹 $\tau$,审计器 $\mathcal{A}$ 必须给出三元组输出 $(\hat{k}, \hat{c}, \hat{r})$,涵盖三项环环相扣的核心能力:

  1. 关键错误定位(Critical-Step Localization, $\hat{k}$):准确指出究竟是哪一个决策步骤(Decision Step)最早确立了不可逆的失败机制。鉴于长文本中语义转移的模糊性,标注不仅包含绝对黄金步骤 $k^*$,还划定了紧致的容忍区间 $[k_s, k_e]$。

  2. 根因归因(Root-Cause Classification, $\hat{c}$):从团队提炼的六大搜索专属错误分类学中做出判定。这六类根因包括:候选管理失误(Candidate Mismanagement)、搜索覆盖缺陷(Search Coverage Gap)、约束条件忽视(Constraint Neglect)、盲目采信未核实来源(Unverified Source Reliance)、实体与关系错位绑定(Entity-Relation Misbinding)以及无支撑答案生成(Unsupported Answer)。

  3. 修复指令生成(Repair Directive, $\hat{r}$):给出针对失败机制的过程级修改建议,而不是直接“剧透”最终答案。每个修复建议都被解构为 3 至 5 条原子级评分细则(Rubrics)。值得注意的是,评测机制采用了严格的诊断门控(Diagnosis-Gated):只有当审计器定位在容忍区间内且根因归因完全正确时,才会对其修复指令打分,杜绝了靠大模型猜测生成的幻觉修复。

颠覆直觉的失败画像:算力扩展遭遇“理解瓶颈”

在标注和统计完这 1,243 条失败轨迹后,团队提炼出了关于深度搜索智能体的一组极具冲击力的数据特征。

第一,绝大部分失败并非检索召回不足,而是信息消化不良。

在传统思维中,搜索任务失败往往被归咎于“检索器不行”或“没搜出关键网页”。但统计表明,真正的“搜索覆盖缺陷(Search Coverage Gap)”仅占 22.8%。换言之,77.2% 的翻车完全出在模型拿到信息之后的加工处理阶段。其中最典型的杀手是“候选管理失误”(占比 27.2%)与“约束条件忽视”(占比 19.1%)。更令人唏嘘的是,在所有失败轨迹中,整整 25.0% 的案例里,黄金正确答案早就清清楚楚地写在返回的网页片段中,且其中 83% 的情况是在关键错误步骤发生前就已被获取。智能体就像一个拿着藏宝图却把它当废纸扔掉的探险者。

第二,近半数算力在不可逆的错误后被白白挥霍。

深度搜索模型极其“执拗”。在关键错误步骤建立之后,它们平均还会盲目进行 16.7 次工具调用,足足有 47.1% 的生成 Token 和 45.4% 的工具调用发生在错误已经注定之后。这表明智能体严重缺乏自我反思与中途截断机制,亟需一套可靠的外部审计介入来避免算力黑洞。

第三,盲目增加搜索步数,只会让错误发生“空间转移”。

团队统计了不同模型的工具调用次数与根因分布的关系。随着智能体搜索预算从平均 5 次工具调用扩展到 70 余次,搜索覆盖缺陷的比例与调用深度呈现极强的负相关(Pearson 相关系数 $r = -0.88$)。大范围搜索确实能够“扫除盲区”,但这也意味着上下文急剧膨胀,随之而来的是候选混乱和约束遗忘比例的急剧攀升。测试期扩展搜索预算(Test-time Scaling of Search)本身存在自我限制——从“找不到证据”变成了“在海量证据中彻底迷失”。

SearchAuditor:多视角推演与证据锚定裁决

面对动辄 6 万 Token 且充斥着噪声网页的轨迹,哪怕是 GPT-5.5 这种级别的模型,如果只采用一次性判定(All-at-Once)、逐步前向筛查(Step-by-Step)或二分检索(Binary Search),也极易迷失。为此,研究团队设计了 SearchAuditor 框架,其核心哲学是将“假说提出”与“证据裁决”明确解耦。

SearchAuditor 架构概览:三路并行审计、证据锚定裁决与条件修复生成

整个框架清晰地分为三阶段展开:

阶段一:三路异构视角并行初筛

框架并不依赖单一的思考路径,而是调度同一大模型分别扮演三种不同的诊断角色,从互补维度提取潜在错误点:

阶段二:局部上下文聚焦与证据化裁决

三份报告难免产生分歧。常规的集成方法通常采用多数投票(Majority Voting),但这在长程逻辑定位中极其危险,因为多数模型往往会被后期的显性症状迷惑,形成“错误的共识”。

SearchAuditor 采用确定性规则提取出一个高度聚焦的裁决环境:

  1. 全局大纲($O$):保留每个决策步骤的位置索引与截断预览,提供宏观结构骨架;

  2. 证据窗口($W$):以三路报告提出的候选关键步骤为锚点,提取其前后紧邻的原始交互窗口(包括工具调用参数与具体返回内容),规避了几万 Token 的无意义噪声;

  3. 裁决者(Adjudicator):在审阅全局大纲、聚焦证据窗口与分歧总结后,做出最终的 $(\hat{k}, \hat{c})$ 判定。裁决者受三条严格铁律约束:必须依据上下文原始消息做事实引用;意见一致只是参考信号,支持充分的少数派报告完全可以推翻多数派;定位必须坚持“最早确立原则”,当错误出现在搜索返回中时,若调用本身错误则问责发出调用的步骤,若调用正常则问责首次误用证据的步骤,绝不可直接归咎于外部工具本身。

阶段三:基于确诊结论的定向修复

一旦关键位置与根因被牢牢锚定,修复合成器便接管流程。它不再重读冗长的无关轨迹,而是仅依托问题、最终错误、被确诊的根因理由以及关键步骤周围的证据片段,生成具有实操性的过程级引导指令(Process-level Directive),规定从这一步开始应该纠正哪些过滤条件、核实哪条线索,直接为智能体的自我复原指明方向。

评测对比:在严苛挑战中展现诊断韧性

为了全面衡量审计效果,研究团队在包含 1,243 条样本的 SearchAuditBench 上展开了全量评测。审计器的主干大模型涵盖了 GPT-5.5、Gemini-3.1-Pro 以及 Claude-Opus-4.8,均开启高推理规格(High Reasoning Effort)。

评测指标涵盖:定位绝对精确率(CS-Strict)、容忍区间精确率(CS-Loose)、根因分类准确率(RC-Acc)与宏 F1 值(RC-F1)、兼顾定位与归因的诊断合格率(Diag)、在确诊基础上的修复合格率(Rep@Diag),以及最核心的端到端完全通过率(FPS = Diag $\times$ Rep@Diag)。

实验数据揭示出两组极为鲜明的对照:

首先,长程轨迹审计任务对当今顶尖模型而言依然极具挑战

即便是最强基线方案(AgentRx 框架搭配 GPT-5.5),在严格定位指标(CS-Strict)上也仅有 39.02%,端到端完全通过率(FPS)只有 26.55%。若换用相对较弱的模型作为基线底座,FPS 甚至会暴跌至 10% 左右。这直接证实了在数万 Token 的高噪声交互中,仅仅依靠常规的提示策略根本无法理清长程依赖。

其次,SearchAuditor 在所有指标、所有底座模型上实现了全方位的稳定提升

在 GPT-5.5 底座下,SearchAuditor 将 CS-Strict 推高至 44.89%(提升 5.87 个百分点),CS-Loose 达到 58.73%(提升 6.84 个百分点),最终将端到端通过率(FPS)拉升至 32.26%(绝对提升 5.71 个百分点)。在 Gemini 与 Claude 底座上,SearchAuditor 同样展现出 4 到 5 个百分点的端到端稳步增益,且在诊断正确率(Diag)上每一项都超越最强基线 5 个百分点以上。

为了深入探究增益的内部来源,团队在 300 条样本上进行了详尽的消融实验:

实战检验:精准审计能否拯救翻车智能体?

在实验室中跑分只是第一步,审计的核心价值在于:它能否真正下场干预,把已经走入死胡同的搜索智能体拉回正轨?

为了给出无标注污染的硬核验证,团队选取了完全独立的基准集 LiveBrowseComp。该评测集包含 335 个极具时效性的问题,模型无法靠预训练记忆取巧,必须实时上网搜寻新近发布的事实。实验选用 Kimi-K2.6 与 Quest-35B 作为执行智能体。在未受干预的初始状态下,两个模型分别仅能答对 34.03% 和 8.96% 的问题,产生了大量的真实翻车轨迹。

团队采取的恢复机制非常简单:保留智能体从起点直至 SearchAuditor 所预测的关键错误步骤之前的前缀轨迹,将审计器生成的修复指令直接以用户身份注入,随后让智能体沿原脚手架继续探索。

结果令人振奋:

更有深度的一组对照实验显示:如果给智能体提供相同位置定位但内容模糊的泛化提示(Generic Hint),智能体的修复成功率便会断崖式下跌 11.74 个百分点,表现甚至不如彻底清空记忆从头再来的“无脑重跑”。这一现象揭示了智能体恢复过程中的“非对称陷阱”:智能体一旦继承了产生错误的上半段轨迹,就天然带有强烈的思维锚定偏差(Anchoring Bias)。只有直指病灶、限制其推理路径的精细化过程指令,才能帮助智能体摆脱先入为主的歧路;缺乏信息量的泛泛纠错,反而会强化模型对自己之前错误逻辑的深信不疑。

走向自省与自愈的下一代 Agent

SearchAuditor 的价值并不仅限于提出了一套更优的离线评估算法,它更像是为长程智能体研究推开了一扇通往“系统自省与在线纠偏”的窗户。

过去一年中,业界在“推理时扩展”(Inference-time Scaling)上投入了巨大的热情,试图通过让智能体多搜几次、多想几轮来单纯堆砌准确率。但本篇工作用详实的数据敲响了警钟:盲目扩展工具调用深度存在明显的收益天花板。如果不去提升模型在极长上下文环境下的证据甄别、实体绑定与候选管理能力,更广阔的探索只会带来更庞大的噪声,把原本可以一眼识破的答案深埋在失序的信息洪流中。

引入解耦的多视角审计机制,让我们看清了复杂系统“在何处失控、因何而溃败”。当这种高效的审计定位从“事后尸检”逐步演进为运行过程中的“伴随式轻量裁判”,未来的深度搜索智能体或将真正具备中途止损、动态回滚与自我纠错的能力。那样的智能体,才算真正跨过了从“不知疲倦的盲目蛮干者”通往“深思熟虑的研究员”的技术门槛。