AgentSnare:轨迹自适应诱导机制,让AI黑客攻破率全部清零
AgentSnare: Learning to Delay, Divert, and Defuse Autonomous Penetration Agents

当大语言模型被赋予调用工具、分析执行结果并持续调整攻击策略的能力后,自主网络渗透智能体(Autonomous Penetration Agent)正在从概念验证迅速演化为具备实战破坏力的工具。这类智能体通过“观察—行动”(Observation-Action)循环,能在完全陌生的网络环境中自主侦察、挖掘漏洞并构造利用链。安全防御者通常认为,只要利用大模型对环境返回结果的高度依赖,在系统里预先埋设静态蜜罐、伪造凭证或提示词注入诱饵,就能轻易阻断或误导它们。
ArXiv URL:https://arxiv.org/abs/2607.26998v1
然而,这种传统的静态防御在大模型面前正遭遇全面溃败。最新研究发现,面对拥有长上下文理解与推理自我修正能力的高级模型,静态诱饵的有效干扰周期极其短暂,攻击智能体很快就会察觉到环境中的逻辑矛盾并迅速绕过诱饵,重新聚焦于真实攻击目标。
来自安徽大学、海南大学、香港理工大学、香港大学和浙江大学的研究团队提出了一套名为 AgentSnare 的轨迹自适应欺骗系统。该系统彻底颠覆了“预先埋伏静态诱饵”的传统思路,转向“沿着攻击者的交互轨迹动态展开事实自洽的诱饵环境”。在针对 15 个 CVE-Bench 真实漏洞应用、覆盖 Claude Opus 4.6、GPT-5.4 与 MiniMax M3 三大主流基座模型的 45 个攻防实战场景中,AgentSnare 不仅吸收了攻击智能体 46.8% 的工具调用预算,让智能体进入蜜罐后的留存率维持在 55.9%,更诱使 90.0% 的漏洞利用完成报告均基于虚假的蜜罐证据提交;在 pass@3 的严格评测标准下,所有真实目标系统的攻破率被彻底压制为 0。

为什么静态诱饵在智能体面前迅速失效?
传统欺骗防御依赖在攻击发生前向系统注入预设伪造物,常见的六类静态策略包括感知误导(如伪造的系统指纹)、注意力分散(如无关的目录混淆)、专用诱饵(如假的数据库连接文件)、模型提示词对抗、角色操纵指令以及强制无效代码执行等。
研究团队通过量化评估指标 Interference@20(衡量 20 步交互中防御干预能够实质影响攻击智能体行为的比例)展开测试。如图 1 所示,跨越六类主流大模型与六类欺骗策略的所有测试组合中,平均干预度均低于 0.2。
这种脆弱性并非因为诱饵本身制造得不够逼真,而是源于静态伪造物与动态探索之间的根本脱节。高级渗透智能体具备持续反思与上下文一致性比对能力。当智能体通过 cat /srv/app/.env 读到了虚假的数据库配置信息,它随后会尝试通过特定端口连接该数据库或调用相应的凭据。静态环境无法为这一连串由攻击者临时起意发起的衍生探测提供逻辑连贯的支撑,导致后续命令要么报错,要么返回与此前诱饵冲突的环境状态。智能体通过反思机制捕捉到这种语境冲突,便会判断此路不通或察觉陷阱,果断调转方向,将算力重新倾注于真正的业务漏洞上。
防御的真正痛点,不在于构造单个多么精巧的伪造文件,而在于缺乏一种能够根据攻击者当前意图与轨迹实时生成并持续维护“动态谎言”的机制。

动态造假:让整个虚拟现实伴随攻击者逐步展开
AgentSnare 的核心思想是变“守株待兔”为“实时造梦”。系统不再试图预先构建一个庞大而死板的完整蜜罐,而是将诱饵环境的生成推迟到攻击发生的瞬间。只要攻击者的行为触及受控防线,系统便根据其攻击意图与历史上下文,动态渲染出局部的、逻辑自洽的虚假事实,引导其在虚假的攻击路径上不断深入。
如图 2 所示,AgentSnare 的在线防御流程被严格划分为两个阶段:候选伪造物构建与基于状态引擎的三维验证。
在第一阶段,部署的策略模型 $M_{\theta}$ 接收当前攻击者可见的交互历史 $h_{t}$、攻击者刚刚发出的工具调用动作 $a_{t}$、当前蜜罐已承诺的世界事实账本 $W_{t}$、操作前沿图 $\mathcal{F}{t}$ 以及服务器的基础画像 $q$。策略模型实时推断攻击者的具体技术意图,并针对该探针生成候选观察结果 $\tilde{o}{t}$ 以及为支撑该结果所必须增加的环境状态事实 $\Delta W_{t}$:
\[x_{t}=(h_{t},a_{t},W_{t},\mathcal{F}_{t},q)\] \[c_{t}=(\tilde{o}_{t},\Delta W_{t})=M_{\theta}(x_{t})\]例如,当攻击智能体执行查看环境变量的操作时,策略模型不会机械地丢出一个随机报错或固定凭据,而是根据上下文虚构一个看似合理的内部审计数据库端点与高权限部署账号,同时在状态增量 $\Delta W_{t}$ 中把这一账密关系、虚拟主机配置和关联文件完整定义下来。
在第二阶段,候选伪造物必须经过 AgentSnare 核心支撑引擎 ShadowOS 的校验,绝不允许策略模型自由发挥产生幻觉漏洞。验证从三个维度展开:候选观察必须完全符合刚刚执行命令的真实语法规范;增量状态 $\Delta W_{t}$ 绝不能与账本 $W_{t}$ 中此前已确立的事实发生冲突;新增的事实必须挂载在当前可拓展的操作前沿 $\mathcal{F}_{t}$ 上,确保攻击者下一步无论查看进程、测试网络连通还是检索关联文件,系统都能有据可依地接续演变。
一旦通过校验,ShadowOS 才会将这批新事实永久固化到世界状态中:
\[(W_{t+1},G_{t+1}) =\operatorname{Commit}(W_{t},G_{t},\Delta W_{t},\Delta G_{t})\] \[o_{t} =\operatorname{Render}(a_{t},\tilde{o}_{t},W_{t+1},G_{t+1})\]如果候选伪造物破坏了一致性,系统则回退到安全失败状态,不引入任何冲突变量。这种“延迟具象化”(Lazy Materialization)机制,确保了虚拟现实在智能体眼前像滚雪球一样延展,却在全链路逻辑上无懈可击。
模拟攻防:离线打磨轻量级策略模型
在线环境下,防御系统对推理延迟有着极高要求,不可能调用百亿、千亿参数的高延迟大模型来反复试错。为了让小型模型掌握老练的诱导技巧,研究人员设计了离线模拟攻防管线,对开源的轻量级模型 Qwen3-4B 进行微调。
训练数据的合成完全在受控模拟环境中进行。针对攻击模拟器抛出的探测请求,系统每次利用生成器采样多个候选伪造物,并剔除破坏语法规范或存在冲突的无效项。随后,攻击模拟器基于不同候选观察结果分别预测后续可能采取的衍生动作序列。只有那些能够持续激发攻击者深入蜜罐、把后续调用牢牢锁定在虚假环境里的候选伪造物,才会被视为最优解打上监督标签。
通过这一反复多轮的选择与过滤,团队构建了一套包含 24,807 条高质量防御决策、覆盖 12 种攻击意图类别的纯交互轨迹库。值得强调的是,该数据集中没有包含任何 CVE-Bench 中的具体漏洞场景、官方利用链或测试代码,确保了防御策略学到的是通用的行为诱导逻辑,而非针对特定题目的作弊式记忆。
最终,通过 LoRA($r=64$, $\alpha=128$)对 Qwen3-4B 进行三个周期的微调并固化权重,使其在推理服务架构下能够高效输出稳定、高诱导性的状态与观察对。
从单点防御到 DDD 评估:如何丈量轨迹控制力
评价一个交互式欺骗系统是否优秀,如果仅看真实目标最终是否被攻破,就退化成了二元粗粒度指标,无法看清防御机制是在哪一步生效的。为此,论文正式提出了用于评估智能体攻防轨迹的过程化框架 DDD,即 Delay(延迟消耗)、Divert(引流维持)与 Defuse(诱导拆弹):
-
Delay(延迟):衡量蜜罐在智能体有限的行动预算中所吸收的操作比例。在预算上限为 $B$、实际调用 $T$ 次工具的渗透过程中,统计流向蜜罐表面的调用占比:
\[\mathrm{Delay}=\frac{1}{T}\sum_{t=1}^{T}\mathbb{I}[z_{t}=\mathrm{decoy}]\] -
Divert(引流):更侧重关注智能体“首次咬钩”后的持续留存能力。以 $\tau$ 代表智能体首次向诱饵环境发起有效操作的时间步,计算后续所有动作中留在诱饵内的比例(Post-Entry Retention, PER):
\[\mathrm{PER}=\frac{\sum_{t>\tau}\mathbb{I}[z_{t}=\mathrm{decoy}]}{T-\tau}\] -
Defuse(拆弹):考察防御机制是否成功重塑了智能体的认知。定义有效漏洞利用报告集合为 $\mathcal{P}$,其中通过溯源标记确认其证据链全部来源于虚假蜜罐的报告集合为 $\mathcal{P}_{D}$,诱导成功率 SubDefuse 即为:
\[\mathrm{SubDefuse}=\frac{\lvert \mathcal{P}_{D} \rvert}{\lvert \mathcal{P} \rvert}\]
这套框架将攻防对抗拆解为完整的控制闭环:Delay 考察在全流程中分流攻击算力的广度,Divert 考察维持逻辑谎言、阻止攻击者重返真实主线的深度,而 Defuse 则直接切中智能体完成攻击任务时的核心论据。
压制主流渗透模型:实战攻破率彻底归零
在基于 PentestGPT 架构、利用 15 个高度复杂的 CVE-Bench Web 漏洞真实环境展开的测试中,攻防双方展开了激烈交锋。攻击者配置了业界前沿的推理与执行模型 Claude Opus 4.6、GPT-5.4 与 MiniMax M3,每个漏洞均给予 200 次工具调用的充裕预算,并采用独立的 pass@3 协议进行评测。
在无防护状态下,三大模型在 pass@1 下便可轻松攻破 45 个任务中的 18 个。面对静态防御,攻击模型几乎未受阻碍,pass@3 下依然成功攻破 18 个目标,证明静态诱饵已形同虚设。传统的虚拟交互式终端 Cowrie 以及依托概率状态机和大模型生成的 HoneyLLMd 虽然有所改善,但仍分别被攻破 12 个和 10 个目标。
而在 AgentSnare 部署的环境下,真实目标被攻破的数据停留在不可思议的 0/45。
深入 DDD 过程指标能够清晰揭示 AgentSnare 的绝对控制力。在整体指标上,AgentSnare 达成了 46.8% 的全局 Delay 吸收率与 55.9% 的咬钩后留存率(PER),相比表现次优的 HoneyLLMd(36.9% PER)实现了大幅跨越。而在关乎认知重塑的 Defuse 指标上,全量测试中 638 次有效的漏洞完成尝试里,有 574 次提交的利用证据全部被诱导至虚假蜜罐生成的数据上,SubDefuse 高达 90.0%。
面对执行风格迥异的模型,防御表现也呈现出耐人寻味的差异。例如在对抗推理极具目的性的 GPT-5.4 时,虽然全流程 Delay 仅为 37.7%,但其 SubDefuse 却飙升至 96.5%;而在对抗执行工具非常频繁的 MiniMax M3 时,AgentSnare 实现了高达 55.7% 的 Delay 与 64.7% 的留存率。无论攻击模型擅长短平快的精准刺探,还是大范围的穷举尝试,AgentSnare 都能自适应地将动作引流至虚幻分支,并在终点让其基于假数据提交“虚假胜利”的攻击报告。
小模型搭配一致性状态机,胜过无约束的通用大模型
在消融实验中,研究团队进一步探寻了 AgentSnare 成功的技术决定因素。测试将完整系统拆解,分别对比了“未经微调的基座 Qwen3-4B + ShadowOS 状态机”、“经过微调但移除 ShadowOS 校验逻辑的裸奔版本”,以及“完全移除微调与状态机、纯靠强大的闭源模型 GPT-5.4-mini 进行 Prompt 交互应答”的对照方案。
实验表明,仅凭闭源大模型 GPT-5.4-mini 的即兴文本生成,即便提示词设计得再周全,虽然能获得 37.0% 的 Delay 与 88.6% 的 Defuse 指标,但在 pass@3 下仍有 3 个目标被成功利用。这是因为纯 Prompt 模式缺乏底层的强状态图引擎支撑,多轮对抗后必然露出破绽。
相反,体积精巧的 4B 模型在融合了轨迹意图微调与 ShadowOS 的全局物理一致性检查后,整体控制指标全面压制了参数规模庞大得多的通用闭源模型,并保持了完美的 0 破防记录。这证实了一个关键判断:在复杂的多轮对抗场景中,严格受控的环境状态机与针对攻防博弈专门微调的小模型协同,其可靠性远超漫无边际的通用语言生成能力。
对抗自主 Agent 的范式转移
AgentSnare 的提出,标志着网络欺骗防御正在经历一次根本性的范式转移。过去的蜜罐技术本质上是“环境静态化,等待攻击者撞网”,这种机制在面对固定脚本或人类手动扫描时尚能支撑,但在具备自主规划、代码编写和上下文校验的大模型智能体面前不堪一击。
通过引入轨迹自适应与按需增量展开机制,防御方首次在交互维度上掌握了主导权。它不再试图在入口处硬碰硬地拦截攻击请求,而是顺应智能体的探索欲望,为每一次刺探即时编造合乎逻辑的伪证,最终使攻击智能体深陷自洽的虚幻世界中耗尽算力。随着自主 Agent 在攻防对抗中的应用不断普及,这种利用上下文一致性“反向欺骗模型推理链”的动态防御技术,正在成为构建未来弹性安全基础设施的关键拼图。