HAE-GEO:深度搜索Agent遭遇分层网页投毒,为何验证了也很难纠错?
Evaluating Deep-Search Agents under Hierarchical Web Evidence Poisoning

让大语言模型自主上网搜索、阅读多篇网页、交叉比对证据并给出决策建议,已经成为目前“深度研究(Deep Research)”和导购助手的主流范式。然而,这种能力的跃升也为对抗攻击敞开了大门。生成式引擎优化(Generative Engine Optimization,简称 GEO)投毒正在从理论变成现实:恶意攻击者不需要黑进模型本身,只需在开放互联网上批量投放精心设计的虚假评测、软文或伪造的多方讨论,就能无中生有地制造出一个品牌的“顶级声誉”,进而操纵 Agent 的最终推荐。
ArXiv URL:https://arxiv.org/abs/2609.06027v1
此前业界对这类攻击的评估,大多停留在静态、单轮或黑盒层面,只看最终输出是否包含了虚假信息,却无法弄清 Agent 究竟是在哪个环节“失守”的。针对这一空白,来自蚂蚁集团与浙江大学的研究团队提出了专门针对深度搜索 Agent 的端到端分层评估基准 HAE-GEO。该基准将原本不可见的交互过程拆解为从“暴露”到“恢复”的五阶行为轨迹,并在控制变量的真实网页环境中,测试了 10 款主流模型面对由浅入深的三层投毒时的真实表现。

这项研究揭示出一个反直觉且令人担忧的结论:Agent 在多轮搜索交互中表现出的抗投毒能力,本质上是一种“具有抵抗力却缺乏辨别力”的假象;更棘手的是,即便在防御提示词的引导下触发了严格的交叉核验,Agent 也很难将核验结果转化为对错误信念的修正,呈现出显著的“验证即停滞”瓶颈。
凭空捏造声誉:GEO 投毒的杀伤力
在真实的商业与消费场景中,GEO 投毒的破坏力早已显现。2026 年初的一起消费安全调查中,研究人员在网络上凭空捏造了一个名为“Apollo-9”的虚构智能健康手环,并同步散布了虚假的专家测评、权威榜单和用户开箱心得。结果,多家主流 AI 搜索与推荐应用在回答“推荐一款优秀的健康手环”时,毫不犹豫地将这款根本不存在的产品列入首选推荐名单。
传统搜索引擎面对的是关键词匹配和页面权重排名,而基于大模型的 Agent 则是理解、归纳并综合不同来源的内容。当攻击者利用大语言模型低成本批量生成风格专业、数据详实且语义连贯的网页时,Agent 会自然而然地将其视为高质量证据。更严重的是,当虚假信息不是孤立的一篇软文,而是以多个不同站点相互引用、交叉佐证的形式出现时,Agent 内置的交叉核对逻辑反而会被攻击者利用,落入虚假共识的陷阱。
要评估并防御这种威胁,仅看最终输出中有没有出现伪造品牌是远远不够的。研究团队指出,现存评估体系存在两大盲区:其一,它们将检索、引用和最终背书混为一谈,无法区分 Agent 是在初次接触时就轻信了谎言,还是在检索过程中发现了疑点却未能纠正;其二,它们没有在固定虚假实体和攻击主张的前提下,对谎言的包装难度进行梯度控制,导致我们无法得知 Agent 是被粗糙的硬广告骗过,还是只沦陷于深度的上下文伪装。
HAE-GEO:从暴露到恢复的全轨迹拆解
为了在严密受控的实验条件下观测 Agent 的真实心理与行为路径,研究团队构建了 HAE-GEO 评估基准。该基准包含三大支柱:受控的分层网页证据环境、标准化的多轮搜索与抓取交互接口,以及轨迹感知的细粒度评估体系。

在环境构建上,研究人员建立了一个包含 72,039 篇真实网页的基础语料库,覆盖 8 个消费电子与生活品类、154 个真实品牌,并保留了真实互联网环境固有的商业偏见、冗余信息和质量参差。在此基础上,研究人员设计了三层递进的投毒模式,每层严格控制投放相同数量(770 篇)的投毒页面,且每一任务的查询语句 $q_i$、虚构实体 $e_i^$ 和核心虚假断言 $c_i^$ 保持绝对一致:
-
L1 直接断言(Direct Poisoning):投毒页面以直接、露骨的宣传形式声称虚构品牌具有某种突破性优势,语调夸张,缺乏上下文铺垫;
-
L2 上下文伪装(Contextual Camouflage):将虚假信息自然嵌入到多品牌横评、购买指南或行业分析中,保留中立客观的技术讨论口吻,降低广告痕迹;
-
L3 表面多源佐证(Evidence-Enhanced Poisoning):不仅在单页内部精心伪装,还构造了看似独立的第三方评测、论坛讨论和参数表,形成一套彼此呼应的证据链条,模拟真实的公关操纵网络。
面对这个合成环境,被测 Agent 并不会一次性获得所有上下文,而是通过 Search(检索)与 Scrape(深入抓取网页正文)两项工具展开多轮主动探索。这模拟了人类在使用复杂搜索助手时的典型交互流程。整个探索与决策过程被结构化为包含五个状态的马尔可夫决策轨迹:
-
暴露(Exposure, $E$):Agent 在检索或抓取中首次看到了与攻击目标相关的虚假证据;
-
采纳(Adoption, $A$):Agent 在中间思考或草稿笔记中接纳了虚假断言,并将其作为推理前提;
-
严格核验(Verification, $V$):Agent 意识到信息存疑,主动调用工具从非攻击源获取关于该实体的独立证据;
-
最终背书(Endorsement, $Y$):在最终生成的回复中,正向推荐了虚构品牌或引用了虚假断言;
-
证据恢复(Recovery, $R$):Agent 经历了暴露和初步采纳,并在后续获得了反思与核验,最终在输出中排除了受污染的主张,完成了自我纠错。
除了确定性的行为指标(如暴露条件下的被骗率 $\mathrm{FR}$、严格验证产出率 $\mathrm{SVY}$ 以及采纳后恢复率 $\mathrm{V2R}$),研究还引入了基于双独立大模型裁判的六维语义评分(M1 至 M6),分别涵盖伪造品牌风险应对、投毒证据识别、采纳后恢复能力、证据独立性评估、不确定性校准以及合法任务实用性。为了避免标签泄露引入偏差,负责判定安全性维度的裁判能看到投毒标注,而负责评估回答质量和实用性的裁判则完全对攻击标注盲测。
核心发现一:“佐证陷阱”导致证据识别全面退化
在 10 款主流商业与开源大模型(覆盖国内外代表性模型族)的对比实验中,研究团队首先观察到了宏观层面上的“佐证陷阱(Corroboration Trap)”。

实验数据显示,随着投毒形态从 L1 演化至 L3,所有模型的虚假证据识别能力(M2)均出现了大幅下滑。在标准的 Base 提示词设置下,跨模型的 M2 平均得分从 L1 的 1.02 分暴跌至 L3 的 0.33 分(满分 2 分);哪怕加入了强调警惕网络谣言的防御性提示词(Def 提示词),M2 同样从 L1 的高位滑落了 0.51 分。
这种退化背后的机理极具启示性:现存大语言模型的安全与事实核查微调,主要训练其识别语言风格上的主观偏见、情绪化煽动或逻辑破绽。面对 L1 级别的粗劣宣称,模型凭借内部先验和表面语调就能轻松触发警觉;然而,一旦攻击者升级到 L3,将虚假信息用严谨的科技行话包装,并分散放置在由虚假权威机构、多方论坛与综合参数表构建的伪造网络中时,模型原有的“交叉比对”常识就会成为它的致命弱点。模型会误将“不同网站说了同样的话”等同于“事实确凿”,不仅无法识别投毒,反而会进一步强化对虚假结论的信任。
核心发现二:Agent 获得了抵抗力,却没有获得辨别力
深度搜索的一大卖点是赋予大模型自主权:如果一次搜索结果不可信,Agent 可以继续发起二次、三次搜索。那么,这种多轮交互究竟是增强了模型的明察秋毫,还是仅仅延长了被误导的过程?
为了回答这一问题,研究团队在部分核心模型上对比了两种形态:一种是允许多轮自主探索的 Agentic Search-Scrape 模式,另一种是一次性检索并拼接前排结果的静态全上下文模式(Static Full-Context)。
对比结果呈现出鲜明的解耦现象:多轮 Agent 交互确实显著降低了最终推荐虚假品牌的概率(被骗率 $\mathrm{FR}$ 显著下降),在某些开源大模型上的改善尤为突出。然而,这种最终结果上的“抵抗力(Resistance)”,并没有转化为对证据真伪的“辨别力(Recognition)”。在多轮交互模式下,模型对投毒证据的识别评分(M2)几乎没有提升,部分设置下甚至与基线毫无差异;同时,最终输出对于用户原本需求的实用性评分(M6)也没有改善,甚至出现了停滞或下滑。
深入分析交互日志后,研究人员发现了这种“脱节”的本质原因:多轮搜索赋予了 Agent 更多冲淡虚假信息的机会。随着交互轮数的增加,Agent 检索到了更多关于其他正规品牌的真实页面,这些海量的真实上下文在篇幅和信息密度上稀释了最初接触到的投毒页面。换言之,Agent 并不是因为看穿了“Apollo-9 是个骗局”而放弃推荐它,而仅仅是因为在漫长的搜索链条中被其他真实品牌转移了注意力,或者受制于上下文长度限制,在最后的总结阶段将该品牌当作低权重信息遗落了。这种靠信息稀释获得的安全性极其脆弱,一旦攻击者加大在特定细分领域的投毒密度,Agent 的防线就会顷刻瓦解。
核心发现三:核验不等于纠错,采纳后的恢复瓶颈
在 Agent 的认知流转过程中,最关键的一环莫过于:如果一个智能体已经初步相信了某个谎言,它还能通过后续的核查挽回错误吗?
HAE-GEO 的轨迹状态追踪给出了一组非常严峻的数据。在所有被投毒信息暴露并初步采纳($A=1$)的样本中,防御性提示词确实大幅激发了 Agent 的怀疑心理,促使其发起了更多的验证动作(严格验证产出率 $\mathrm{SVY}$ 上升)。但是,这部分验证动作能够成功转化为最终放弃虚假推荐(从 Verification 走向 Recovery, 即 $\mathrm{V2R}$)的比例却极低。
在 L1 攻击下,尚有 81.8% 进行了严格核验的防御轨迹最终完成纠错;但到了 L2 和 L3 阶段,这一转化率骤降至 66.7% 甚至更低。更为关键的是,即便在启用了严厉防御提示词的情况下,能够同时满足“初步采纳后主动展开独立非攻击源核查”的轨迹总数在整个数据集中也是极少数。
这种现象揭示了大模型 Agent 推理链条中的“认知惯性”。一旦一个虚构品牌在先前的思考轮次中被 Agent 赋予了正面评价并写入了工作记忆,后续的工具调用往往会被这种先验假设所带偏(Confirmation Bias)。模型在发起新的查询时,倾向于检索能够印证自己先前观点的证据,或者在面对模棱两可、缺乏负面报道的静默状态时,错误地将其解释为“未发现质量问题,值得推荐”。在长程推理中,推翻自己已经建立并部分论证的假设,其难度远远高于从一开始就保持警惕。
显式推理的增益与安全性的代价
面对复杂的投毒诱导,提升模型的推理深度是否有效?实验给出了肯定答复:开启显式思考(如 Chain-of-Thought 或测试时推理计算)能够全面改善对抗防御表现。例如,在 Kimi-K3 和 Qwen3.8-27B 上的测试表明,开启深度推理后,综合被骗率在两种提示词设置下均下降了 8 到 20 个百分点,且证据识别维度(M1、M2)均呈现出系统性回升。显式推理让模型有充裕的 Token 空间去审视上下文中的矛盾细节,部分缓解了前述的推理退化。
但这种安全性的提升绝非无偿赠予。研究团队统计了各模型在防御提示词介入后的资源消耗,发现防御机制平均为单次查询增加了 1.82 次工具调用,模型内的 Token 消耗量平均激增了 24.5%。在极端情况下,如 Claude-Opus-4.8,Token 消耗增幅达到了 52.0%。更不容忽视的是,防御还带来了不可避免的“实用性惩罚”:为了避免被骗,防御过度的 Agent 往往变得草木皆兵,拒绝正面回答用户的对比需求,或者在正规推荐中过度堆砌风险免责声明,导致最终答案对消费者的实际参考价值大幅降低。
对未来 Agent 设计的警示
HAE-GEO 的这项研究不仅为衡量生成式搜索的安全性提供了一套标准测试平台,更指出了当前以大模型为主导的 Agent 架构在处理开放网络信息时的结构性脆弱。
只关注最终端到端的成功率,会掩盖智能体“无意识抗毒”与“真核验”之间的本质差异。如果系统的安全仅仅建立在长上下文对少量噪音的稀释效应上,那么在未来对抗更加激烈的网络环境中,攻击者只需略微提高关键词覆盖率和多站协同水平,就能完全主导 Agent 的判断。
要构建真正具备反欺骗能力的深度研究系统,未来的工作必须聚焦于打破“核验却不纠错”的认知瓶颈。系统不仅需要具备在感知到疑点时主动跨域搜索的能力,更需要在核心提示词或认知架构中植入对早期采纳主张的“逆向证伪机制”。在开放互联网的信息汪洋中,学会如何谨慎地推翻自己几分钟前刚刚形成的结论,或许才是智能体走向真正可靠的最关键一步。