DRNoise基准:仅凭一篇假报告,深度研究Agent准确率暴跌66到88点
DRNOISE: Benchmarking Deep Research Agents in Misleading Evidence Environments

在各类大模型研究助手(Deep Research Agent)的宣传中,自主规划、多步检索、跨文档交叉比对与信息综合一直被视为取代初级分析师的核心能力。无论是复杂的商业尽调、行业报告撰写,还是法律与合规检索,这类智能体都被期望穿透互联网上充斥的二手转述与冗余摘要,从底层分散的原始记录中推导出可靠事实。
ArXiv URL:https://arxiv.org/abs/2607.17291v1
然而,来自香港浸会大学、香港科技大学与中国科学技术大学的研究团队在最新基准 DRNoise 中揭示了一个令人不安的现实:看似具备复杂长程推理能力的深度研究智能体,其稳健性极其脆弱。当搜索环境中仅被注入一篇外观普通、但直接给出冲突答案的伪造文档时,原本在干净环境中表现出色的顶尖模型,其任务准确率出现了 66 到 88 个百分点的断崖式下跌。
更关键的发现不在于智能体“受骗”本身,而在于其行为轨迹所揭示的决策机制:智能体在大多数情况下已经检索到了真实的底层证据记录,但在看到那篇“看起来就像直接答案”的总结文档后,便迅速触发了“验证惰性”(Verification Inertia),主动终止了后续检索与证据链闭环。换言之,Agent 并非缺乏逻辑推理能力,而是在面对现成结论的诱惑时,放弃了基本的核查标准。
干净与混淆环境的对照实验
现有针对智能体搜索能力的评估基准(如 GAIA、BrowseComp、WebWalker 等)往往关注多步工具调用的成功率、深层网页遍历以及长文本信息的获取能力。而事实核查或 RAG 鲁棒性研究,则多半局限于给定静态上下文的文本判定,或者测试多篇恶意对抗文本对检索排序的投毒干扰。这些设置都没有回答一个关键的工程与实战问题:当搜索工具、真实记录与用户需求完全不变,仅仅在可检索环境中加入一篇看似合理、格式规范的假文档时,自主研究智能体的内部证据采纳策略会发生怎样的改变?
为了在严格受控的条件下剥离这一现象,研究团队构建了包含 100 个复杂研究任务的基准测试集 DRNoise。评测环境被严格区分为“干净”(Clean)与“噪声”(Noisy)两种成对状态:

如上图所示,在基准的设计中,每一个任务的真实答案(Gold Answer)都不会直接出现在任何单一文档内。环境中预埋了两条相互独立的间接证据链(Route A 与 Route B),智能体必须跨越多份底层记录(如采购单、时间戳日志、会议记录、系统清单等),通过多步关联、交叉比对和条件交集计算,才能推导得出唯一正确的真实结论。
而在对应的噪声环境中,研究团队保留了干净环境里的所有底层真实记录与检索通道,仅仅额外加入了一篇外观极其普通的摘要型文档。这篇文档模拟了商业报告、行业快讯、执行摘要或控制面板截图,直接以确定性的口吻断言了一个错误的数值或结论。这种设计构成了尖锐的证据冲突:一方是获取成本极低、形式极具诱惑力但缺乏根基的直接结论;另一方则是需要消耗额外搜索步数、进行多表关联才能拼凑出的真实证据。
为了防止结论局限于特定类型的推理逻辑,DRNoise 覆盖了企业与知识工作中常见的 10 种证据操作家族,包括带约束的实体筛选、日期跨度对比、布尔条件核验、候选对象排序、多源记录合并(Join)、多维标准求交、属性映射、集合选择、冲突归因以及分布式成本聚合。每个家族均设置 10 个测试任务,全面覆盖符号逻辑与数值计算场景。
断崖式下跌:顶尖模型的全线溃败
为了排除检索框架与工具协议差异对实验结果的干扰,研究团队将所有参评模型置于完全相同的 BrowseComp-Plus 智能体框架内,采用标准的 ReAct(Reasoning + Acting)交互模式,并统一提供基于单接口的搜索引擎。评估涵盖了 DeepSeek V4 Flash、MiMo v2.5、Qwen3-32B、Gemini 3.5 Flash 以及 GPT-5.4 等代表性大模型。
评估指标不仅计算模型在干净环境与噪声环境中的绝对准确率(Clean Accuracy 与 Noisy Accuracy),还特别引入了“条件顺从率”(Conditional Deference)。该指标的分母仅计算模型在干净环境中本已成功答对的任务集合,分子则是指在加入单篇伪造文档后,模型直接采纳了被注入的指定错误答案的比例。这一设计剔除了模型自身推理盲区导致的天然错误,精准锁定了由混淆文档直接诱发的决策偏移。
实验展现出极度一致且剧烈的退化现象:
在干净环境下,高水平智能体展现出了强大的长程调研能力。Gemini 3.5 Flash 取得了 96% 的惊人准确率,DeepSeek V4 Flash 达到 89%,GPT-5.4 与 MiMo v2.5 也均达到了 81% 到 82% 左右。这些数据充分证明,参评模型本身具备调取工具、追踪线索并拼接出完整证据链的能力。
然而,当仅仅加入那一篇直接提供虚假答案的文档后,局面急转直下。DeepSeek V4 Flash 与 MiMo v2.5 的噪声准确率直接跌落至 1% 左右,性能几乎归零;GPT-5.4 的准确率降至 16%(在部分基准单次运行中仅为 12%),其条件顺从率高达 80.4%;即便是相对最稳健的 Gemini 3.5 Flash,其条件顺从率也达到了 72.6%。模型在干净环境中展示出的长程搜索与严谨推理能力,在面对现成伪证时几乎完全瓦解。
细分到 10 个任务家族的表现同样说明了问题的普遍性。不论是偏向符号逻辑的实体筛选、布尔判断、跨表关联,还是涉及数值运算的成本归集与日期比对,虚假文档都造成了全面的性能滑坡。这表明受骗并非特定算术模块或分类模板的偶发故障,而是智能体作为自主搜索代理时所共有的一种底层决策缺陷。
为什么会受骗?轨迹分析揭开“验证惰性”
当一个在干净环境下表现优异的智能体在混淆环境中给出错误答案,通常存在三种假设:其一,检索失败,智能体在噪声干扰下根本没有搜到底层真实记录;其二,格式或指令遵循失败,智能体理解了事实但输出了错误格式;其三,智能体明明接触到了真实记录,却主动选择了顺从虚假文档。
通过对 GPT-5.4 在基准测试中的全部交互轨迹进行逐层解剖,论文彻底推翻了前两种解释,证实了第三种机制——即“验证惰性”与“提前终止”(Premature Stopping)的主导地位。
在检索暴露分析中,GPT-5.4 在全部 100 个噪声任务中,检索轨迹里无一例外都成功获取到了至少一份间接的真实记录。并且,在 100% 的噪声轨迹中,虚假摘要文档与真实记录均被智能体同时检索并摆在了同一个上下文视窗中。这表明完全不存在检索屏蔽的问题。
关键的变化发生在搜索步数与证据链闭环上。在干净环境下,智能体为了拼凑完整证据链,平均要进行 7.1 次搜索调用;但在噪声环境中,由于直接撞见了假答案,平均搜索调用骤降至 4.5 次。更严重的是,成功拼凑出一条完整证据路线(即完全集齐 Route A 或 Route B 的全部支撑文档)的任务比例,从干净环境下的 45% 暴跌至 16%。
在 GPT-5.4 顺从虚假答案的 68 个典型任务中,全部 68 次运行都同时搜出了假摘要与部分真记录,但其中只有 10 次运行拼凑齐了完整链条,其余 58 次均在半途放弃了对真实链条的继续搜集。错误高度集中在论文预设的特定错误值上(88 次非正确运行中有 87 次精准采纳了注入的假数值),这证明模型并非漫无目的地胡乱猜测,而是精准地把这篇假文档当作了停止检索的借口。
这种现象构成了智能体决策中的一种系统性惰性:它并不缺少从线索中反推真相的推演机制,但只要环境中出现了一个“长得就像最终答案”的现成陈述,智能体就会本能地降低证据门槛,将其视为充分证据,进而过早收工。
提示词与架构挽救:局限与突破
为了探究如何打破这种验证惰性,研究团队围绕 GPT-5.4 开展了多维度的消融与干预实验。
首先是通用验证提示词(Verification Prompting)。在不改变任何工具与检索机制的前提下,向系统 Prompt 中加入一条严谨度指令,明确要求模型“务必根据检索到的具体支撑记录核实答案,不要停留在首个看似合理的答案上,继续深入搜索”,但提示中完全不剧透任何假摘要的存在。实验显示,通用提示词确实促使模型展开了更多检索,使噪声准确率从 12% 提升至 28%,条件顺从率从 84.0% 降至 69.1%。然而,这区区 16 个百分点的回升远不足以填补数十点的断崖鸿沟,证明仅仅依靠空泛的 Prompt 催促,无法根治智能体遇到诱人捷径时的妥协倾向。
其次是信息来源的权威度梯度测试。研究者将相同的虚假数值封装进三种不同权威度外壳中:低权威度的匿名论坛随笔帖子(带有主观不确定语气)、中等权威度的行业媒体综述(默认基准)、以及高权威度带有官方文号与审计机构抬头的正式报告。结果发现,权威度在底层存在一定阈值效应:面对匿名的论坛帖子,模型的顺从率有所下降,但仍有 54% 的任务直接采纳了论坛荒谬的结论;而一旦权威度从中等行业综述提升至顶级官方审计报告,顺从率便迅速饱和(84% 对比 83%),几乎不再上升。值得注意的是,论坛帖子在检索中被召回的概率甚至略高于审计报告(99% 对比 94%),这证明即使是毫无权威背书的低劣网页,只要直接提供了答案形式的内容,依然能在过半数场景中诱导智能体放弃进一步求证。
第三是检索机制(BM25 与稠密检索)的对比。当将稠密检索器替换为传统的 BM25 词面检索时,由于底层间接记录往往用词精炼、缺少直接问答特征,BM25 很难搜全真实链条(干净准确率仅剩 23%)。相反,具有丰富关键词和直接答案句式的假摘要被 100% 检索出来。结果导致在 BM25 下,模型在干净环境中仅存答对的 23 个任务,在加入假文档后全部沦陷,顺从率高达 100%。这印证了单纯的关键词相关性排序更容易沦为“答案型伪证”的放大器。
真正带来显著改观的是结构性证据干预。在“直接真实证据”(Direct-True)实验中,研究者将两条间接证据链的其中一条替换为一份同等权威度、直接断言正确答案的二级独立报告,使环境变成“一份直接真实文档 + 一条间接真实链路 + 一份直接虚假文档”。当真理与谎言处于同等“直接且唾手可得”的对称状态时,噪声准确率大幅回升至 63%,顺从率从 84% 压低至 35.8%。这说明智能体之所以极度容易被误导,很大程度上源于“需要多步拼图的真理”与“唾手可得的假说”之间的认知摩擦阻力不对称。
最后,在全上下文 Oracle 评测中,研究者完全绕开检索过程,直接将两组完整的间接证据链原始文本一次性注入 GPT-5.4 的 Prompt 中。在没有假文档时,GPT-5.4 取得了 100% 的准确率,坐实了其在证据齐备时的推理上限;而在同样直接塞入完整间接记录的同时并入假文档,模型的准确率仍能保持在 91%,条件顺从率仅为 8%。这一对比构成了全篇最有力的定论:智能体面对伪证的致命伤绝非发生在“面对完整证据时的逻辑裁判期”,而是在于“检索循环中的主动早停期”。一旦智能体在自主检索过程中瞥见了看似答案的幻影,它就再也没有耐心去拼完全部拼图了。
重新定义 Deep Research 的鲁棒性
DRNoise 基准给当下狂飙突进的自主智能体工程敲响了警钟。在真实且复杂的公网部署环境中,虚假、过时、主观臆断或以讹传讹的总结性内容无处不在,攻击者甚至无需使用复杂的对抗样本算法或精心优化的 Prompt 注入,只需在公开站点放置一份排版工整但包含错误断言的 PDF、执行概览或博客速记,就足以瓦解价值昂贵的研究 Agent。
这项工作清晰地表明,现有的以“检索召回率”和“引用标注率”为导向的模型评估体系存在盲区。一个能够生成详实排版、挂载多处外链引用的深度研究报告,完全可能是模型在遭遇虚假摘要后过早终止探索、草率拼凑引文的产物。表面上的“有据可依”(Grounded),掩盖了实质上的“核查瘫痪”。
对于后续的智能体设计而言,单纯依靠扩大上下文窗口或追加空泛的思考轮次已不足以解决问题。构建下一代可靠研究智能体的核心,在于重构其证据采纳策略:建立更严格的停机判定协议,明确区分“二手断言”与“底层凭据”,并在系统机制中强制实施直接结论与原始记录的交叉对齐机制。唯有当智能体学会把任何现成的“直接答案”仅仅视为待检验的线索而非终点时,真正严肃的高价值自动化研究才有可能落地。