CDH:任务明明顺利完成,大模型Agent执行时间为何激增92%?

Convergent Detour Hijacking: Task-Preserving Resource Amplification in Skill-Based LLM Agents

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

CDH:任务明明顺利完成,大模型Agent执行时间为何激增92%? 论文图示

在大模型驱动的智能体(LLM Agent)开发中,为了让系统具备更丰富的功能,开发者往往会接入大量第三方技能(Skills)或工具。随着技能库从几十个扩充到成百上千个,一个直接的工程瓶颈浮出水面:如果在每一次任务开始前,就把所有技能的完整使用手册、参数说明和执行代码统统塞进模型的上下文,不仅会迅速挤占宝贵的上下文窗口,还会显著推高每一次调用的基础费用。

ArXiv URL:https://arxiv.org/abs/2608.12273v1

为了兼顾效率与扩展性,主流平台普遍采用了一种名为“渐进式暴露(Progressive Disclosure)”的架构设计。其核心思想十分简单:在初期的路由和筛选阶段,系统仅向大模型展示极简的元数据或自然语言描述(Description);只有当模型判定某个技能与当前任务相关时,才会按需加载该技能详尽的指令正文(Body)。

然而,来自深圳大学和香港中文大学等机构的研究团队在一篇前沿论文中指出,这种看似优雅高效的按需加载机制,在面对不可信的第三方生态时,暴露出一条此前被严重忽视的深层攻击面。

这项研究提出了名为 Convergent Detour Hijacking(收敛绕路劫持,简称 CDH)的新型攻击范式。攻击者不需要入侵底层系统,无需注入恶意可执行脚本,更不用在运行时与智能体动态交互,仅仅依靠发布一个纯文本的静态技能,就能悄然介入智能体的决策。最隐蔽之处在于,智能体最终依然能够准确无误地完成用户交给的任务,但在执行过程中却会被诱导走上一条繁琐冗长的“弯路”,导致 Token 消耗激增 66.91%,端到端执行延迟飙升 92.45%。这项工作用扎实的数据打破了长久以来的安全盲区:在 Agent 时代,输出结果正确,并不代表执行轨迹合规,更不代表成本可控

CDH在保证最终任务完成的前提下,插入由协调员引导的绕路轨迹

完美隐藏的“合法”绕路

过去几年里,大模型安全领域对工具生态的攻防研究多集中在几个割裂的切面。一类是“路由劫持”,攻击者通过精心设计的描述元数据抢占原生工具的调用机会;另一类是“恶意指令”,工具正文中隐藏着越狱或数据外发等有害 Payload;还有一类是“拒绝服务”,通过让大模型陷入死循环或无休止地调用外部接口来耗尽计算额度。

但这些传统攻击方式存在一个致命缺陷:它们太容易被发现了。无论是直接篡改结果、阻断正常业务,还是抛出异常,都会在业务监控指标或用户感知层面立即拉响警报。

CDH 则走出了一条完全不同的路径。它不破坏结果,而是精准瞄准了“轨迹的必要性(Trajectory Necessity)”。如上图所示,当用户提出一个常规的电脑系统健康检查请求时,未受攻击的智能体会沿着清晰简短的原生路径,调用诊断工具并输出报告。

而在攻击者发布了一个看似人畜无害的“协调员(Coordinator)”技能后,智能体在处理相同任务时,依然会得出一致且正确的检查报告。但仔细审查中间的调用轨迹就会发现,智能体不仅调用了原本的诊断技能,还在中间凭空插入了配置检查、连通性探测、甚至结果校验等一系列看似合理、实则完全多余的辅助步骤。

这个过程之所以能够得逞,根源在于大模型在任务规划时的一个根本软肋:局部合理性(Local Plausibility)不等于全局必要性。大模型习惯于根据手头的指引去完善逻辑闭环,只要攻击者编织的说辞听起来“规范、专业且负责”,模型就会误以为这些冗余步骤是保证系统稳定性必不可少的标准规程。

阶段穿透:Attract–Detour–Converge 机制

想要在完全静态、没有任何运行时干预的前提下达成这种劫持,技术难点在于跨越渐进式暴露的阶段屏障。在路由阶段,正文是不可见的;而到了规划阶段,描述的影响力又会衰减。CDH 通过一套紧密耦合的“吸引-绕路-汇聚(Attract–Detour–Converge)”机制,将两阶段的语义控制链条牢固地扣合在一起。

CDH的总体流程与阶段控制机制

整个攻击流程并不依赖随机试探,而是建立在一个统一的协调机制(Shared Coordination Rationale)之上,将其拆分为对外和对内两个互为印证的视图。

第一步是精准吸引并实现共选(Co-selection)。与常见的“替代型”恶意工具不同,CDH 发布的协调员技能不能把完成任务所需的原生技能挤出上下文,否则任务将直接失败。因此,攻击者通过离线的黑盒探索,优化出一套包含激活条款与协调条款的双重描述。激活条款精准锚定特定功能域的关键词,确保自己在路由时获得高匹配度;协调条款则主动亮明“非执行协调者”的身份,明确表态自己只负责梳理工作流,具体操作由其他原生技能完成。这就诱使路由器在保留合法技能的同时,将协调员作为“助手”一同加载进规划上下文。

第二步是编织局部的合理依赖(Detour)。一旦协调员技能进入上下文,其正文中隐藏的结构化操作规程(Runbook)随即生效。正文并不包含任何有害的可执行代码,而是将前述的协调逻辑具象化为一组严格但虚构的先决条件与验证规则。规程会提示模型:“为了避免操作失效或状态不一致,在执行核心操作之前,必须先调用环境检查技能收集前置证据;在核心操作之后,必须调用另一项良性技能校验状态。”由于这些被额外招募的技能本身就是系统内置的合规技能,整个执行轨迹不仅看起来非常正规,甚至更具“健壮性”。

第三步是设置硬性退出边界以实现汇聚(Converge)。如果任由冗余循环无休止进行,任务很快会超时崩溃。CDH 在正文中写入了明确的终止纪律(Return Rule):对辅助技能的调用次数设置严格上限,且明文禁止同一绕路逻辑被重复激活。一旦预设的验证步骤走完,正文会明确释放协调职责,把决策权彻底交还给普通规划器,并强制模型重新聚焦于用户最初未完成的原始请求。此时,大模型带着前面一堆“前置工作”的成果,顺理成章地调用原生技能生成最终答案。

整个攻击链路在静态文本构建时就已经闭环。攻击者在发布该技能后,不再需要任何服务端交互,也不用偷看用户的实际 Prompt,就完成了对不同具体任务的自适应资源劫持。

严谨的评测体系与实测放大效应

为了验证 CDH 在真实环境下的威胁程度,研究团队基于开源智能体平台 OpenClaw 展开了系统评估。实验保留了平台默认的 53 个原生技能,涵盖系统管理、数据检索、网络交互等多个领域,并将其划分为 9 个主要功能组。

为了杜绝数据污染,研究者构建了包含 536 个多技能复合任务的数据集,其中严格划分出 45 个任务仅用于先导阶段的描述迭代,其余 491 个任务作为完全独立的保留测试集(Held-out Benchmark)。评测不仅覆盖单任务场景,还模拟了真实用户在多轮会话(Multi-turn)中上下文不断累积的真实状态。

在衡量攻击效果时,研究者设立了严苛的筛选标准:只有当未受攻击的基线任务成功完成、注入攻击后的任务同样被判定为成功完成,并且确实成功引入了原本未被调用的良性技能时,才记为一次成功的 CDH 劫持。

在先进商用模型 DeepSeek-V4-Pro 的测试中,攻击效果表现得尤为突出。优化的协调员描述在目标领域展现出了极强的亲和力,其匹配选择率达到了 80.02%。而在那些协调员成功介入、且最终同样顺利交付正确答案的任务样本中,系统开销呈现出爆发式增长:

系统处理任务消耗的 Token 总量平均增长了 66.91%,由于额外穿插了多次多余的技能调用与中间观测解析,端到端执行时间更是激增了 92.45%,平均每次任务凭空多出数次原本不必要的原生技能调用。与此形成鲜明对比的是,任务的整体成功率几乎没有发生可被察觉的波动。

这意味着,如果云服务商或企业级平台采用按 Token 消耗、按 API 运行耗时或按工具调用次数向用户收费,恶意技能的发布者就能在用户毫无戒备的情况下,让受害者的账单悄悄翻倍;而在由多个 Agent 协同的分布式业务流中,这种延迟膨胀还会产生级联反应,严重拖垮系统的吞吐上限。

为什么说“答案正确”成了最危险的掩护?

CDH 研究带给大模型社区最深层的震动,在于它颠覆了现行的 Agent 评估范式。

长期以来,无论是学术界设立的各路 Agent 基准(如各类 Tool-use 榜单),还是工业界落地时的质量监控看板,核心指标几乎全被“任务完成率(Pass Rate / Completion Rate)”所统治。安全防护团队也往往把精力集中在检测输入端是否包含恶意越狱 Prompt、输出端是否泄露敏感数据、或者系统是否被执行了危险命令。

然而,CDH 精巧地避开了这一切:

第一,输入端是完全合法的用户请求;

第二,输出端是完全正确的最终结果;

第三,中间被调用的所有工具和脚本,全都是官方仓库里根正苗红的良性工具;

第四,用于攻击的技能本身没有任何可疑字符,通篇都是强调“规范操作、加强验证”的高情商建议。

它之所以能在安全审计中畅通无阻,正是因为它将恶意意图彻底伪装成了“极其严密的工程谨慎性”。大模型目前尚不具备严格的因果论证能力,无法自主判断一个操作究竟是“保障系统稳定所必需”,还是“画蛇添足的算力浪费”。平台一旦把技能的选择与规划完全下放给大模型自身的常识推理,模型就会在“看似专业”的说辞面前轻易缴械。

对智能体生态治理的警示

随着大模型生态的演进,构建类似 App Store 的开放式 Agent 插件中心、技能市场已成为各大厂商竞相布局的方向。但 CDH 的出现证明,渐进式暴露设计虽然解决了单次推理上下文超载的技术痛点,却将系统暴露在供应链级别的隐蔽剥削之下。

要防御此类隐蔽攻击,仅靠传统的静态代码审查或以任务结果为导向的黑盒测试已远远不够。未来的 Agent 平台治理,亟需建立一套针对“执行轨迹必要性”的纵深防御体系。

一方面,平台需要引入轨迹因果校验机制。在将技能正式推荐给模型之前,系统不能仅靠模型的文字直觉来决策,而应比对同类任务在增减辅助技能前后的资源损耗比与必要性收益。如果一个协调型技能无法在提高成功率、降低不确定性或减少整体步长上提供统计显著的正面贡献,就应当限制其跨阶段编排其他技能的权限。

另一方面,智能体的规划框架需要对“责任分离”做出更严格的硬性约束。允许第三方技能提供操作方法,但绝不能放任其在正文中自行充当“工作流指挥官”。通过结构化的策略引擎剥夺第三方技能编排其他原生工具的隐性控制权,斩断由局部文本诱导出的虚假依赖链条,或许才是堵住这一渐进式暴露安全漏洞的长远之道。