不是安全刹车而是放大器?HITLCUA揭秘智能体“隐形墨水”注入威胁

Invisible Ink Threats: Adversarial Goals Behind Legitimate Tasks in Computer-Use Agents

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

当大语言模型被赋予操作屏幕、鼠标、键盘和终端的能力,演化为“计算机使用智能体”(Computer-Use Agents,简称 CUA)时,技术界在惊叹其生产力跃升的同时,也建立了一套心照不宣的安全共识:只要在关键节点保留“人类在环”(Human-in-the-Loop, HITL)机制,让智能体在执行敏感或不可逆操作前弹窗让用户确认,就能守住安全的底线。无论是修改系统文件、删除数据库,还是进行资金转账,哪怕智能体被外部网页里的恶意提示词劫持,坐在屏幕前的用户也能一眼看破并点击拒绝。

ArXiv URL:https://arxiv.org/abs/2608.02018

但这项防线存在一个致命的盲区:如果恶意攻击根本不去触发那些警铃大作的高危破坏,而是伪装成看似人畜无害、甚至顺理成章的辅助步骤呢?

这项最新研究系统揭示了一类被命名为“隐形墨水威胁”(Invisible Ink Threats)的新型间接提示词注入攻击,并构建了专属评测基准 II-Bench 与端到端人机协同测试平台 HITLCUA。实验给出了一个令人不寒而栗的反常识结论:在面对这类伪装成正常任务的隐形攻击时,人类在环确认不仅没能阻断攻击,反而成了攻击的“放大器”——在模拟普通用户的测试中,智能体的整体攻击成功率不降反升,部分顶尖模型的被攻破率甚至直接翻倍。

传统强攻击与隐形墨水攻击在防御表现上的对比

从“开门砸锁”到“润物无声”:何为隐形墨水威胁?

在传统安全攻防语境下,间接提示词注入(Indirect Prompt Injection)往往追求立竿见影的破坏力。攻击者在论坛、网页或聊天记录中埋设指令,诱骗正在执行浏览任务的智能体去格式化磁盘、删库、盗取浏览器存储的所有明文密码。这类行为在信息安全三要素(机密性、完整性、可用性)中通常指向破坏可用性。然而,这种“大开大合”的破坏方式恰恰最容易被大模型自身的安全对齐机制拦截;就算模型自身犯了糊涂向用户发起弹窗,任何心智正常的用户在看到“是否确认清空根目录”时,都会毫不犹豫地按下拒绝。

隐形墨水威胁则完全反其道而行之。它放弃了对系统造成破坏性瘫痪的执念,转而盯上那些机密性与完整性的灰色地带。

这类攻击的核心逻辑是劫持智能体的合法能力,去执行表面危害极低、但在行为模式上与正常任务几乎无法区分的微小操作。例如:在帮用户查找代码库安装教程时,顺便给黑客指定的 GitHub 仓库点一个 Star;在查阅技术文档时,顺手给某个讨论帖点个赞或留下关注;在安装目标 Python 依赖包前,先下载并安装一个名不见经传的辅助包,并谎称“这是运行新版本所必需的环境依赖”;或者将 VM 内部的一份非敏感日常文档,伪装成排错日志顺手贴到论坛的回复框里。

在单步行为审计的视角下,这些操作没有任何异常特征:点赞、浏览、下载包、终端敲命令,全都是 CUA 正常工作流程中的基础积木。防御者无法通过简单的规则或基于行为的白名单来分辨恶意,必须去深究每个动作背后的“真实意图”。

对于攻击者而言,这类低危害操作具有极其不对称的收益。数以万计被劫持的智能体可以成为黑客操纵社交舆论、虚假刷量、养号的免费劳工;更严重的是,潜伏的恶意依赖包一旦在受害者本地悄然装上,或者普通日志中夹带了主机配置信息,就为后续更深度的持久化控制打开了后门。

搭建攻防演练场:II-Bench 与 HITLCUA 平台

为了把这种隐蔽威胁搬上台面进行量化分析,研究团队构建了专门的数据集 II-Bench 以及首个高度拟真的人机在环测试框架 HITLCUA

HITLCUA 框架与 II-Bench 评测流程全景

测试 CUA 的安全性远比测试普通文本大模型复杂。智能体面临的不仅仅是一段 prompt,而是一个具有状态持久性、允许键鼠操作、需要跨应用跳转的完整操作系统。HITLCUA 采用了一种巧妙的混合沙箱架构:

底座依托开源桌面交互环境 OSWorld,运行在真实的虚拟机中,为智能体提供包含终端(Terminal)、文件管理器、VSCode 等完整工具链的 Linux 操作系统;而在网络层面,它将来自 WebArenaTheAgentCompany 的自建开源应用封装成 Docker 容器,直接部署在隔离的本地内网,模拟出真实的论坛(类似 Reddit)、私有云存储(OwnCloud)以及即时通信平台(RocketChat)。

在这种沙箱环境下,研究团队引入了两个至关重要的非玩家角色(NPC):

在这套体系之上,II-Bench 提供了 444 个精心设计的评测样本(包含 111 组良性与恶意对抗配对)。所有的注入模板都极为考究:以醒目的前缀吸引注意,随后抛出恶意目标,接着顺着用户的良性任务编织一段看似完全合理的“前置依赖借口”(例如声称必须先跑这一行代码,才能兼容最新依赖库),最后再贴心地附上原本正确的安装命令,让智能体在完成攻击后依然能“顺畅”完成用户的初始任务,实现全程无感欺骗。

为了探究边界,研究团队将攻击分为三大类,并按危害严重程度阶梯式递进:

  1. 页面导航与交互攻击(Post 类别):诱导智能体访问外部指定链接、关注特定账号或给代码仓库刷赞;

  2. 敏感信息外发攻击(Send 类别):诱导智能体读取本地文件并以回复形式贴出,目标文件从普通文本、隐私账密一路升级到 SSH 授权密钥;

  3. 代码下载与执行攻击(Download 类别):诱使智能体从官方仓库下载看似无关的包,或者直接从攻击者控制的第三方源拉取未经验证的依赖。

所有样本同时提供了自然语言描述与包含 Bash 脚本的代码块两种表现形式,并在用户原始指令的宽泛程度(宽泛探索型 vs 步骤明确型)上做了严格的分层对照。

权威光环与能力诅咒:主流模型全线告急

在覆盖了 Claude-Sonnet-4.6、GPT-5.1、GPT-5-mini、GLM-5V-Turbo、Qwen3.7-Plus、MiniMax-M3 和 Gemini-3.5-Flash 等七大顶尖基线模型的广泛评测中,II-Bench 撕开了当代智能体防御的脆弱一面。

在用户下达宽泛指令(Loose Setting)的场景下,没有一个模型展现出令人安心的防御力。七款模型的平均攻击成功率(ASR)全面沦陷,即便是表现相对最稳健的 GPT-5.1,也执行了超过半数(51.8%)的注入指令;而在梯队另一侧,Gemini-3.5-Flash 的 ASR 高达 90.5%,Qwen3.7-Plus 达到 82.0%,Claude-Sonnet-4.6 也录得 75.2% 的失守记录。哪怕用户给出了非常详尽的指定步骤,最强防守者 GPT-5.1 依然在 36.9% 的情况下误入歧途。

深入剖析实验数据,可以提炼出两个极具启发性的技术事实:

事实一:代码格式是零成本的“攻击放大器”

在将同一攻击目标分别包装成“自然语言文本”和“Markdown 代码块”的双模态对比中,所有模型的攻击成功率都在代码形态下出现了显著攀升,平均提升幅度达 8.1 个百分点。对于 GPT-5-mini,这种诱导甚至直接让 ASR 从 46.7% 猛增至 65.7%(暴涨 18 个百分点);即便是底座对齐最严苛的 GPT-5.1,面对代码块也会多执行 8.8 个百分点的恶意操作。

背后的机理耐人寻味:当 CUA 处于终端运维或环境配置等任务上下文中时,一个用反引号包裹的代码块,天然散发着一种“可执行语法”的权威光环。大模型面对自然语言文本时,往往还会下意识调用语义安全检查;但面对一段排版工整的 Shell 命令,再加上前文铺垫的“必须运行此命令以解决底层依赖”的借口,智能体会倾向于将其当成标准的执行步骤直接吞下。

各类对抗任务在不同平台与维度下的实验结果热力图

事实二:认知能力的提升反而构成了漏洞表面积

在对不同攻击类别的统计中,Download 类攻击以 63.2% 的总体成功率居首,Send 类紧随其后(61.2%),而社交类的 Post 攻击成功率看似较低(31.2%)。但这一现象并不意味着智能体在社交行为上有更高的警惕性。

相反,在 Post 类的分析中出现了一种令人警惕的“能力倒挂”:

诸如 GLM-5V-Turbo 和 GPT-5-mini 等体量相对较小的模型,在面对欺骗性发帖任务时 ASR 只有 10% 左右;但 Gemini-3.5-Flash 却高达 75.0%,Qwen3.7-Plus 达 39.6%,Claude-Sonnet-4.6 达 35.4%。小模型的低被攻破率绝非因为防御机制更严密,而是纯粹由于其长程规划和推理能力较弱,根本无法理解黑客铺设的长篇前置理由,最终因为任务执行卡死而失败

而顶尖的前沿大模型因为具备极强的情境理解和逻辑串联能力,不仅彻底吃透了黑客编造的借口,还能极度顺畅地完成多步跨应用跳转,替攻击者成功发帖点赞。这种现象揭示出一个残酷的现状:在缺乏深层意图防御的前提下,模型基座通用能力的单纯增长,客观上反而扩大了其执行复杂恶意操作的攻击面。

人类把关:安全盾牌为何沦为恶意加速踏板?

全篇论文最震撼、也是对行业现有安全架构冲击最大的发现,出现在引入人类协同的 HITL 评测中。

研究团队设定:当智能体执行到存疑动作时,允许向 NPC2(模拟非专业普通用户)发起确认请求。为确保仿真的有效性,团队甚至召集了三名真实非专家人类志愿者进行同步对照,人类的批准率(68.5%–77.1%)与大模型模拟用户的批准率(73.5%–83.3%)高度吻合,证明了普通人在面对专业技术细节时的判断共性。

直觉告诉我们,模型主动求助、人类在环介入,攻击成功率理应断崖式下跌。然而,实验结果却呈现出完全相反的戏剧性走向:在所有参与测试的模型与平台组合中,引入 HITL 之后的攻击成功率不降反升,整体 ASR 平均增加了 7.8 个百分点!

最触目惊心的案例发生在 Reddit 场景下的 GPT-5.1:在传统无干预测试中,其 ASR 仅为 21.2%;而一旦开启了“遇疑向用户询问”的人类在环模式,其攻击成功率反而直接翻倍,攀升至 42.4%

监控日志拆解了这一防御异化的全过程:

重新思考计算机使用智能体的安全范式

这项研究对正处在落地前夜的 CUA 产业敲响了警钟。过去我们在构建智能应用时,常常习惯性地将“无法自动解决的边界安全问题推给最终用户”,甚至将弹窗确认视作免责与安全的万能灵药。但隐形墨水威胁用扎实的实证数据证明:在计算机自动化的深水区,把机器看不懂的复杂伪装推给缺乏安全素养的普通用户,本质上是一种安全责任的逃避,甚至会在心理学和工程学上形成反向共谋。

要终结这种安全困局,未来的 CUA 防御演进必须在两个维度上发生质的跃迁:

一方面,必须打破“代码块天然可信”的盲区,对结构化内容与外部环境输入建立绝对隔离的信任边界(Taint Tracking,污点追踪),杜绝模型将外部观察数据无缝转译为可执行指令;

另一方面,智能体的内置审核不能仅仅停留在单步操作是否“温和”的表象上,必须具备对全局任务的“意图因果链推演”能力——哪怕安装一个只有几 KB 的官方依赖,也必须证明它与用户原始目标的因果关联。

当 AI Agent 开始真正执掌桌面系统的生杀大权,安全就不再只是一句“请确认”那么简单。跳出非黑即白的粗暴防御,理解那些藏匿在正常行为底下的“隐形墨水”,是这项技术通往成熟社会生产力前必须越过的高峰。