ACH:面包屑伪造互证链诱捕搜索Agent,攻击成功率达71.4%
Breadcrumbing Search Agents

在大模型从单次检索增强生成(RAG)迈向具备多轮规划能力的深度搜索智能体(Search Agent)之际,业界普遍认为只要 Agent 具备自主搜寻、多源交叉验证与深度推理的能力,就能自然免疫常见的恶意网页注入与提示词攻击。当 Agent 在网络中检索时,面对一篇充满偏见或恶意指令的网页,往往会通过后续补充搜索将其交叉比对并稀释剔除。然而,南洋理工大学与中国科学技术大学的最新研究《Breadcrumbing Search Agents》揭示了一个截然相反的结论:具备自主验证能力的搜索 Agent,反而更容易被一种长期协同的“面包屑”假证据链深度诱捕。
ArXiv URL:https://arxiv.org/abs/2608.04565v1
该团队指出,搜索 Agent 赖以与物理网络交互的工具返回通道是一个极其脆弱的安全边界。攻击者无需完全攻破搜索引擎,只需借助类似个性化赞助商广告的通道,在每次搜索返回中混入一条可控结果,并动态维护该链接背后的网页内容,就能在 Agent 的长程探索路径上布下连环陷阱。研究提出的“权威链劫持”(Authority-Chain Hijack, ACH)策略,通过在智能体推进检索时动态投喂看似来自不同独立信源、实则彼此印证的协同证据,直接破解了智能体的多源交叉验证防线,在 SafeSearch 基准测试上的攻击成功率比既有基线高出 13.0 至 36.1 个百分点。随后引入的“轨迹引导策略演化”(TGSE)机制更进一步利用历史执行轨迹自主迭代攻击策略,将留存测试集上的攻击成功率推高至 71.4%,单用例多次尝试下的最大命中率甚至高达 95.0%。
静态注入失效与工具中介威胁模型
此前学术界对搜索 Agent 安全性的评估,大多停留在静态网页注入的假设上。攻击者在互联网上提前放置包含注入指令或虚假陈述的页面,等待 Agent 检索命中。然而在面对类似 DeepResearch 这类基于 ReAct 范式、包含显式 Search 与 Visit 动作循环的先进 Agent 时,静态注入屡屡失效。这类 Agent 在发现某个页面存在异常或主观断言后,会本能地发起跟进搜索(Follow-up Query),调取更多客观信源进行比对,单条投毒结果极易在后续的多信源综合阶段被稀释或彻底舍弃。

为了评估更具现实威胁的攻击场景,本文提出了一个约束极严的“工具中介威胁模型”(Constrained Tool-Intermediary Threat Model)。在实际网络生态中,Agent 并不是直接肉身翻阅网页,而是通过搜索引擎的 API 获取结构化摘要,再决定是否抓取具体 URL。在现代搜索引擎普遍存在动态个性化推广结果的背景下,第三方广告主完全有能力基于搜索关键词动态调整推广条目的标题摘要,并实时生成对应的着陆页。
在该威胁模型中,攻击者拥有极小但致命的操作权限:对于 Agent 发出的每一次 Search 动作,攻击者最多只能在自然搜索结果中追加一条由其控制的条目;对于 Visit 动作,只有当 Agent 决定访问攻击者曾经引入过的恶意 URL 时,攻击者才能动态渲染该页面的内容。一旦 Agent 访问的是互联网原生的正常网页,或者阅读的是未被污染的自然搜索条目,攻击者完全无权篡改。整个攻击过程高度隐蔽,完全依附于合法的搜索交互协议。
在这一严苛设定下,缺乏状态记忆的攻击者很难奏效,因为单次孤立的恶意干扰无法应对 Agent 的连续多步探查。为此,研究团队设计了一套具备轨迹记忆与反思能力的攻击者运行时(Attacker Runtime)。每当 Agent 产生新的动作与观测,攻击系统中的记忆模块就会记录下此前的检索词、访问轨迹、原始返回内容以及此前生成的对抗载荷;规划器(Planner)则结合全局攻击策略与当前动作,实时计算出当前步骤应注入的伪造条目或对抗网页。
ACH机制:用面包屑逻辑顺应验证本能
长期交互攻击的核心难点,在于如何让伪造的断言经受住 Agent 的主动核实。直接给出夸张的结论往往会触发 Agent 的警觉并引发逆向求证。ACH(Authority-Chain Hijack)的核心设计哲学,正是顺应甚至利用 Agent 的交叉核实本能,将其一步步引入精心编织的信息茧房中。这一过程如同在森林中撒下面包屑,一步步牵引 Agent 走向攻击者预设的结论。
当 Agent 在初始搜索中接触到带有倾向性的信息并产生怀疑、进而搜寻对立证据或更权威的背景时,ACH 并不直接否定 Agent 的质疑,而是在后续搜索结果中动态追加一条看似中立但引入了新解释维度的“权威评估”。例如在测评净水器过滤技术的场景中,当 Agent 搜索到某款产品存在二次污染隐患时,ACH 会在下一次搜索中注入一篇看似独立行业第三方的深度综述,声称该负面评价属于早期批次的过时结论,并在正文中引用虚构的所谓最新行业认证标准。
通过在连续的搜索步骤中动态分发不同域名、不同文风的支撑证据,ACH 构建起一条伪造的“权威链”。每一环都在承接上一环的质疑,同时为最终的偏见结论背书。当 Agent 最终回到合成(Synthesize)阶段时,上下文窗口中已经积累了多个看似互相独立、实则全由攻击者规划器协同生成的共识证据。Agent 自以为完成了严格的多方交叉检验,实则其每一次核实动作都精准落入了攻击者预设的解释闭环。
轨迹双门控验证与显著性能提升
评估这种长程攻击是否成功,不能仅看 Agent 是否阅读了恶意内容,而要以 Agent 最终生成的正式回答是否落入攻击者设定的违规清单(Checklist)为准。论文在 SafeSearch 基准过滤后的开放网络子集上展开评测,涵盖广告误导(Ads)、偏见诱导(Bias)、虚假信息(Misinfo)、有害输出(Harm)以及传统提示词注入(Injec)五大风险门类。

实验将攻击过程分解为两个关键轨迹门控(Trajectory Gates):第一道门是“注入页面访问率”(Injected-Visit Rate),即 Agent 在面对混合搜索结果时,是否会主动点击注入的链接;第二道门是“受控访问后的条件成功率”(ASR Conditioned on an Injected Visit),即 Agent 在阅读了伪造网页后,该内容能否逃过交叉验证并在最终回答中得以保留。
如图 4 所示,传统的静态攻击基线往往折戟于其中一道门槛。以 GEO 为代表的静态网页优化方法,生成的页面虽然适合引用,但由于缺乏动态适应性,Agent 稍有怀疑转向其他搜索词,静态链接就无法再次出现,导致访问率与留存率双低;AgentDojo 这类偏向指令注入的方法仅在格式服从性较强的单纯提示词注入任务上有一定效果,面对证据权衡型任务几乎完全失效;而原生 SafeSearch 单页注入即便被访问,也极易在后续对比中被其他网页证伪。
与所有非 ACH 基线相比,ACH 在各类模型底座上的端到端攻击成功率(Overall ASR)全面领先,提升幅度达到 13.0 至 36.1 个百分点。诊断数据清晰表明,ACH 之所以具备压倒性优势,在于它同时打通了两个门控:它根据 Agent 的搜索意图动态定制高吸引力的搜索摘要,推高了首次访问率;在访问发生后,又持续通过后续搜索巩固前序观点的可信度,使得即便进行了多轮核验,条件成功率依然保持在高位。
模型角色分工与攻防异质性
为了深入理解攻击效能与底层大模型能力之间的对应关系,论文在统一的 ReAct 搜索脚手架下,测试了包括 Qwen3、Kimi-K2.5、MiniMax-M2.5、DeepResearch 专用模型以及 Gemma4-31B 在内的多种主流模型,让它们分别扮演攻击者规划器与受害 Agent。


跨模型实验揭示出极具价值的非对称特征。在攻击者一侧,策略落地质量高度依赖规划模型的综合推理水平。Kimi-K2.5 与 Qwen3 展现出极强的伪造连贯性,它们能够更自然地模仿不同学术机构、行业博客与新闻媒体的话语体系,不仅将受控访问转化为成功的概率显著更高(Kimi 达到 60.1%),而且倾向于采用多域名轮番佐证的高级渗透手段;相比之下,参数规模较小的 Qwen3.5-9B 作为攻击者时,多域名协同调用比例极低,很容易露出破绽。
在受害者一侧,模型的漏洞并不能简单用智商高低来解释,而是与其工具调用习惯和证据处理机制深刻绑定。如图 5 所示,所有受害模型接触到的恶意搜索条目比例几乎一致(均在 8.1% 至 8.6% 之间),但后续演变截然不同:
-
深度检索易感型:部分模型倾向于进行密集的 Search 与 Visit 动作,一旦落入连续伪造的证据链,其强大的上下文总结能力反而会更严密地把虚假证据整合进最终报告中,呈现出极高的后访问失守概率。
-
高辨识防御型:Kimi-K2.5 在作为受害者时表现出相对更强的鲁棒性。其在点击注入页面后的失守概率明显低于其他模型,说明其内部对矛盾信源的权衡更加谨慎,不容易被单一逻辑线索全盘带偏。
-
浅层检索脆弱型:Gemma4-31B 呈现出反常的数据形态,其在整个流程中极少调用 Visit 动作深入阅读网页,主要依赖搜索返回的简短摘要进行判断。虽然这一习惯使其很少真正“踩雷”访问恶意落地页,但由于其缺乏深入核实意识,仅凭摘要中的恶意片段就会受到显著干扰,属于工具利用能力不足导致的脆弱。
TGSE:从人工微调走向策略自主进化
ACH 证明了人工精心设计的证据链策略具有强大破坏力,但不同类型的安全风险具有完全不同的失效逻辑。例如在有害输出任务中,Agent 即使看完了伪造论据,在最终输出时仍可能被底座的安全对齐拉回;而在偏见任务中,关键在于防止对立信源抢夺话语权。完全依靠人工去针对每种情况调整宏观策略(Macro Strategy),不仅耗时费力,也难以穷尽对抗场景。
针对这一瓶颈,本文提出了基于轨迹引导的策略演化机制(TGSE)。该机制借鉴了达尔文式归档搜索理念,直接将攻击策略文本视为演化实体。TGSE 并不在推理时动态调整提示词,而是在离线训练阶段,将多轮测试中的成功轨迹与失败轨迹压缩整理成经验材料,交由进化器对攻击宏观策略进行结构化变异与优选。
通过在包含强校验提示的对抗环境(Adv-train)和包含历史优良种子的热启动环境(Adv-warm)中迭代,TGSE 演化出了能够精准应对不同失败模式的专门策略分支。在留存测试集(Held-out Test Split)的严格评估中,TGSE 的最佳配置取得了高达 71.4% 的平均 ASR,单用例 5 次尝试的最大命中率攀升至 95.0%。针对虚假信息与偏见任务,经过强对抗训练演化出的策略学会了更加隐蔽的“交叉预埋”手段,能够提前预测受害 Agent 可能发起的反向搜索关键词,并提前在潜在关键词的召回空间中布局伪证。
消融实验揭示的攻击内在支柱
为了厘清复杂运行时中各个模块的具体贡献,研究人员针对 Qwen3 展开了细致的消融分析。实验分别对攻击运行时的核心组件(反思模块、长程记忆模块、策略输入)进行剥离,并尝试替换不同的宏观指导策略。
消融结果显示,在维持 ACH 策略不变的前提下,完全移除单步反思机制对整体成功率的影响较为轻微;然而一旦清空长程记忆模块(Memory),攻击成功率便出现显著下滑;若进一步将全局策略指导(Strategy)完全抽离,系统性能将遭遇断崖式下跌。这一现象印证了研究的核心假说:面对多轮交互的智能体,攻击的本质不再是单点对抗样本的生成,而是长程状态与宏观意图的持续对抗。策略负责提供跨越多个事件的全局欺骗路线图,而记忆模块负责确保后续每一次新生成的证据在时间戳、实体指称和事实细节上与之前的言论保持严丝合缝。
这项研究从根本上重构了学术界对搜索 Agent 安全防线的理解。过去业内倾向于将防御重心放在输入端的提示词过滤和输出端的安全对齐上,默认中间的检索过程是获取真实客观事实的净土。然而,当搜索 Agent 被赋予越来越长的推理链条和越来越大的自主探索权限时,其依赖的外部观察通道本身就已经演变为最危险的攻击面。攻击者甚至不需要具备颠覆底层知识库的能力,只需顺应 Agent 的证据合成算法,用精心调制的连续面包屑完成认知塑形,就能让 Agent 在看似严谨的多源求证中,自信地交出一份完全被污染的答卷。对于正在快速推进的各类深度调研与自主网络智能体而言,如何对来源协同性进行对抗性审计,构成了比单纯过滤敏感词更为紧迫的系统级防范命题。