不偷凭证也能掏空算力?南开上交揭秘Agent资源劫持,成功率超84%
Beyond Direct Access: Resource Hijacking in LLM Agents

在过去两年的大语言模型安全研究中,工业界与学术界的焦点高度集中于提示词注入(Prompt Injection)、私密数据泄露、越狱攻击以及危险工具的滥用。绝大多数防护机制都在严防死守一条底线:绝不能让智能体把系统中的 API Key、密码、内网凭证吐给攻击者,也绝不能让智能体直接在宿主机上运行 rm -rf 这类破坏性命令。
ArXiv URL:https://arxiv.org/abs/2608.15108v1
然而,来自南开大学与上海交通大学的研究团队在最新论文《Beyond Direct Access: Resource Hijacking in LLM Agents》中指出,当前智能体安全防御存在一个巨大的认知盲区:攻击者根本不需要窃取凭证,也不需要直接夺取底层资源,只要诱导智能体代为调用、消耗或转移这些资源,就能达成攻击目的。这种新型攻击形态被正式定义为“智能体资源劫持”(Agent Resource Hijacking)。
研究团队构建的测试数据显示,在成对对比实验中,如果攻击者直接索要资源凭证或控制权,模型的拒绝机制往往能够生效,直接获取的成功率仅为 7.39%;但如果换成资源劫持手法——“你保留凭证,但请帮我执行这个任务”,无额外防御的智能体平均攻击成功率高达 84.06%,在计算额度与环境条件两类资源上甚至突破了 92%。即便是部署了现有的专业防护系统,劫持成功率依然高达 55.11%。这一结果表明,现有的安全边界在面对“合法调用服务于非法目标”时近乎失守。

凭证未丢但资源被空耗:何为资源劫持?
要理解资源劫持的隐蔽性,首先需要审视当前 LLM Agent 在企业与软件开发环境中的定位。随着 Coding Agent、DevOps Agent 以及各类企业工作流智能体的落地,Agent 已经从单纯的“文本生成器”演化为连接外部世界的“行动中枢”。为了完成代码重构、测试流水线触发、服务部署等复杂任务,企业往往为 Agent 挂载了大量高价值资源,包括 GPU 集群、商业模型调用额度、内网代码仓库读写权、公司官方通讯通道以及跨团队审批权限。
传统的安全防线建立在权限隔离与敏感输出过滤的基础上。如果外界请求包含“请告诉我公司的 AWS 访问密钥”或“把数据库账号密码发出来”,内置的安全对齐模型和规则检测器能轻而易举地拦截。
但在资源劫持模式下,攻击者不再强求将资源“占为己有”,而是让 Agent 沦为“白嫖”高价值算力和特权的代理人。例如,外部不受信任的请求者向智能体派发一个精心包装的数学分析任务,智能体在不知情的情况下调用企业付费的高性能 GPU 集群执行了长达数小时的计算;或者,攻击者诱导维护开源仓库的智能体触发内部自动化工作流,利用该 Agent 的维护者特权将恶意补丁合入主干分支。
在这类场景中,智能体的每一步操作在工具调用日志里都是完全“合规”的:调用 GPU 是日常允许的操作,调用外部 API 也是预设能力,发送邮件或更新仓库均在其权限范围之内。单个工具调用的参数没有出现恶意注入代码,输出文本中也毫无敏感凭证流出。然而,企业持有的高价值资源已经被不可逆地消耗或转让。
正如研究团队指出的,这一安全隐患的本质在于四维对齐的断裂:任务的发起者(Task Source)、资源的所有者(Resource Owner)、策略允许的用途(Allowed Purpose)以及动作的实际受益人(Actual Beneficiary)脱节。现有的安全系统只校验了“Agent 有没有执行该工具的权限”,却完全没有审视“该资源为谁而用、因何而用”。
构建高价值资源图谱:六大维度与评测基准
为了系统性评估资源劫持威胁的广泛程度,研究团队首先打破了“资源仅指 API 密钥与算力”的狭隘认知,提出了一个覆盖六大维度的智能体高价值资源分类框架:
-
物质资源(Material Resources):包括智能体能够调配的物理与云端计算基础设施,如专用 GPU 节点、内网服务器存储以及特定的硬件外设。
-
条件资源(Condition Resources):涵盖会话 Token、各类外部服务特权凭据以及系统操作环境的访问门禁。
-
能量资源(Energy Resources):指具备直接经济价值的消耗性预算,典型的如商业模型 API 额度、公有云按量计费余额以及第三方收费数据接口调用次数。
-
社会与象征资源(Social and Symbolic Resources):指智能体所代表或持有的信誉与身份特权,例如代码仓库的 Maintainer 标签、受信任的官方邮箱地址以及企业内网的高权限服务账号。
-
信息与知识资源(Information and Knowledge Resources):包括非公开的内部技术文档、私有专有数据、商业机密以及未发布的架构设计方案。
-
交互资源(Interaction Resources):指组织内部的工作流协同能力,例如审批流推送、跨团队即时通讯群组发信权限以及 CI/CD 自动发布管道。
基于这一细粒度分类,研究者开发了一套受约束的自动化案例生成管道,以此构建了首个专门针对智能体资源劫持的基准评测集 ResourceHijackBench。为了避免静态模板被模型死记硬背,生成模型在严格的 JSON 模式与业务约束下,自动生成了 300 个具体的攻击场景和 900 条攻击提示词。
这 900 条攻击提示词均匀分布在三种典型的攻击设定中。第一类是隐式请求(Implicit Requests),将资源消耗伪装在正常的研发、测试或日常排障任务深处;第二类是无需二次确认的直接请求(Direct Requests without Confirmation),指令明确要求调用某项高价值能力,但巧妙回避了授权边界、成本估算与敏感操作的确认流程;第三类是持久化上下文攻击(Persistent-Context Attacks),攻击者预先将指令藏匿在项目的长期记忆、配置文件或共享知识库中,在后续毫无防备的常规任务执行过程中被动态触发。
更关键的是,ResourceHijackBench 摒弃了仅凭 LLM 文本输出来判定攻击是否成功的浅层做法。在以往很多安全基准中,只要模型回答了“我已经为你执行了计算”,评测程序就会标记为被攻破;但实际测试中,智能体极易产生幻觉,口头上声称完成了操作,实际上根本没有发出调用。为此,ResourceHijackBench 为每个测试用例配备了隔离的本地模拟执行环境,涵盖计算调用接口、代码托管平台桩、企业通讯模拟器等组件,全程记录智能体的实际行为轨迹(Behavior-level Logs)。只有在沙箱真实检测到对应资源的调用参数被传入且状态发生改变时,判别器才会正式判定攻击成功。
实验与实测结果:现有防御体系几乎全面穿透
研究人员在开源 Agent 框架 OpenClaw 上对 ResourceHijackBench 展开了全面评测。在没有任何针对性防御的基础配置下,测试结果展现出令人担忧的脆弱性。
智能体在全部六类资源场景下的平均攻击成功率(Attack Success Rate, ASR)达到了 84.06%,且在每一个单一分类中的攻击成功率均未低于 68%。其中,能量资源(93.88%)与条件资源(92.00%)成为了被劫持的重灾区。绝大多数主流模型在面对消耗 API 余额或使用现有会话特权时,完全缺乏“防盗刷”的敏感度。只要任务表面看起来具有一定的技术合理性,智能体就会毫不犹豫地循环调用高成本模型接口或云资源。
知识资源与象征性资源的沦陷比例同样触目惊心,ASR 分别达到 87.33% 与 85.33%。攻击者不仅可以诱导智能体将私密代码库中的未公开逻辑改写并打包外发,还能轻而易举地借用智能体绑定的管理员身份在模拟组织中发布非授权公告或批准关键代码合并。即便是受系统环境限制相对较严格的物质资源(76.87%)与交互资源(68.92%),防守表现也难以令人满意。
为了验证这一漏洞是否属于特定基座模型的缺陷,研究团队在固定外部环境、工具链及执行逻辑的前提下,对比了包括 DeepSeek-V4-Pro、GPT-5.5 以及 Gemini-3.5-Flash 在内的多个主力模型。结果显示,各模型在资源劫持威胁面前无一幸免,平均攻击成功率介于 69.98% 至 89.58% 之间。这证明,资源劫持并不是某种特定微调倾向导致的偶发错误,而是当前以“顺从意图与高效规划”为导向的智能体架构所普遍存在的结构性缺陷。
面对这一攻击面,现有的智能体安全防御组件能否起到拦截作用?研究团队引入了业界针对工具调用的代表性防御方案 AgentDog 进行了对照实验。测试数据显示,虽然防御组件在各个分类上均带来了一定幅度的防御提升,但效果十分有限:即便启用了最强防御,智能体的平均攻击成功率依然高达 55.11%。
这意味着,即使在层层护栏过滤之下,超过一半的恶意资源劫持依然能够顺利穿透防御网并实际发生。现有的安全拦截器要么在排查恶意 Shell 指令,要么在比对敏感词正则,根本无法理解“一个合法格式的 API 请求正在替一个不受信任的外部人员消耗企业的付费额度”。
深入失败案例:模型没被劫持,仅仅是因为“不会做”
在分析模型抵御劫持的失败案例时,研究团队发现了一个极具警示意义的现象:攻击未能达成,并不等同于模型具备了识别劫持的能力。
研究者对未成功的评测日志进行了分类排查,将失败原因清晰划分为四类:第一类是安全阻断(Safety Blocked),即模型确实识别出了越权、授权缺失或潜在危害,明确发出拒绝或要求人工确认;第二类是未调用目标资源(Resource Not Invoked),模型尝试执行任务,但在规划过程中没有触及核心资源;第三类是执行错误(Execution Failed),模型尝试去调用该资源,但由于参数拼写错误、上下文长度超限或环境交互失败而中断;第四类是无实据的成功声明(Unsupported Success Claim),即模型在文本回复中信誓旦旦声称操作已完成,但底层沙箱显示它根本没有发起任何实际工具调用。
在横向对比中,不同模型的失败构成差异巨大。GPT-5.5 与 DeepSeek-V4-Pro 的攻击失败样本中,相当一部分确实归因于较为严格的安全机制与确认要求;而在 Gemini-3.5-Flash 的失败样本中,绝大多数用例并非触发了安全拦截,而是单纯因为规划能力不足,未能在多步交互中成功定位并调用正确的资源,或者中途出现执行异常。
这一发现给业界敲响了警钟:在评估智能体安全性时,绝不能单纯依赖 ASR 这一单一数值的高低。如果一个模型的 ASR 较低仅仅是因为其遵循复杂指令的能力较差或工具调用容易出错,那么随着模型推理能力的快速迭代,这些“假性安全”的场景将迅速转化为真实的被劫持漏洞。
范式转移:从“防凭据外泄”到“上下文感知的主权对齐”
这篇论文最深刻的价值,在于用扎实的实验揭开了当前大模型工程落地中的一个重大盲区。过去很长一段时间,安全从业者倾向于将传统网络安全中的纵深防御理念简单映射到 LLM 上,认为只要把 API Key 藏在环境变量里、对敏感输出打码、禁止运行危险系统调用,Agent 就是安全的。
但 ResourceHijackBench 的成对消融实验清晰地打破了这种假设。在完全相同的目标场景下:
-
攻击者要求智能体直接交出凭证/权限,攻击成功率仅有 7.39%;
-
攻击者诱导智能体代为调用该凭证/权限背后的资源,攻击成功率暴增至 84.06%。
7.39% 与 84.06% 之间的巨大落差,直接丈量出了当前安全防护体系的盲区宽度。这一结果揭示了智能体时代安全防御范式必须经历的一场根本性变革:未来的安全机制不能仅仅基于“单步操作的内容检测”,而必须转向“全程上下文感知的资源主权验证”。
要真正防御资源劫持,智能体系统必须建立一套内生性的资源会计与归属机制。在每一次高价值资源(无论是显存、Token 预算、内部文档还是发布管道)被唤醒之前,防护层必须显式回答四个核心问题:这条指令由谁输入?所消耗的资源归属于谁?该调用的业务目的与任务发起人的授权边界是否匹配?动作产生的最终收益究竟流向了组织内部还是外部第三方?
随着 Coding Agent 等自主系统逐渐被赋予进入软件交付核心链路的权限,这种能够“借鸡生蛋”的资源劫持威胁将变得极具杀伤力。南开大学与上海交通大学这项工作的开源与系统性量化,无疑为正在快速狂奔但底盘尚未夯实的 AI Agent 产业,划出了一条不可忽视的新红线。