ClawSentry:四阶段渐进式防御,将Agent攻击成功率降至2.61%
ClawSentry: A Progressive Multi-Tier Security Monitor for Safeguarding Autonomous LLM Agents

在大模型技术从单纯的“聊天对话”向具备自主行动能力的“智能体(Agent)”演进的过程中,系统所面临的安全边界正在发生根本性的位移。当 Agent 获得了读取本地文件系统、执行 Shell 脚本、调用外部 API 以及加载第三方技能(Skills/Tools)的权限时,传统的提示词安全和输出内容审核立刻显得捉襟见肘。一个潜藏在第三方工具包里的恶意指令,或者一段网页数据中注入的间接提示词(Indirect Prompt Injection),就能轻易劫持 Agent 的控制流,导致系统敏感凭据泄露、本地提权甚至级联式的主机被接管。
ArXiv URL:https://arxiv.org/abs/2608.21101v1
由上海人工智能实验室等机构联合提出的开源安全网关框架 ClawSentry,正是针对这一严峻挑战给出的系统级解法。研究团队明确指出:Agent 的安全风险是“渐进式(Progressive)”且“跨生命周期(Cross-stage)”的,它绝不可能仅靠在某一个调用点上设防就彻底阻断。实验表明,在主流代码评测基准 SkillInject 上,ClawSentry 能将搭载强推理模型的 Agent 上下文攻击成功率(Contextual ASR)从 39.55% 骤降至 2.61%,同时将正常任务的成功率(Contextual TSR)稳定在 83.05%(仅微降 0.73 个百分点);在覆盖 6 大风险域的 SkillsSafety 基准测试中,面对 5 种不同技术底座的工业级 Work Agent,ClawSentry 将最高接近 50% 的攻击成功率压制在 9.09% 至 15.03% 之间,并在纯净任务集上交出了 98.7% 的综合任务保全率。
这项研究之所以值得技术从业者深入研读,不仅在于其亮眼的防御指标,更在于它构建了一整套无需修改底层 Agent 框架内部实现、能够统一纳管多种 Agent 运行时的安全架构范式。

Agent 风险的四个生命周期位点与绕过困境
理解 ClawSentry 的设计,首先要理解现存 Agent 防护方案为何频繁失效。
在传统的单点防御思维中,安全团队往往习惯于在单一接口上堆砌规则。例如:在模型接收到任务时做提示词过滤(Invocation 阶段)、在工具真正触发系统调用时做沙箱隔离(Execution 阶段),或者在模型产出最终文本时做输出合规检测(Post-action 阶段)。然而,Agent 的实际控制循环是一个包含了技能获取、目标规划、动作派发、环境观察与状态迭代的闭环循环。在这个循环中,恶意行为并不是孤立的一瞬间,而是可以分布在整个控制流的四个关键位点(Loci):
-
位点 A(技能准入,Skill Admission): 第三方技能包在被引入或首次调用之前。攻击者完全可以在扩展包的代码、依赖项或元数据中埋藏木马逻辑。如果防护程序直到执行时才去窥视单个调用,往往无法拼凑出分散在多个文件中的完整恶意链条。
-
位点 B(调用意图,Invocation-time Intent): Agent 正在组装工具调用参数的时刻。此时恶意意图可能隐藏在看似合理的语义上下文中,传统的关键词签名匹配完全失效。
-
位点 C(执行效应,Execution-time Effect): 工具或系统命令在宿主系统上真正发生状态改变(读写、网络外联、进程派生)的时刻。
-
位点 D(后置后果,Post-action Consequence): 工具调用执行完毕,输出结果被送回 Agent 上下文的时刻。恶意载荷往往隐藏在工具返回的非结构化数据中(例如检索网页或日志文件时读入的数据),诱导 Agent 在后续步骤中发动二次攻击。
更棘手的是研究团队指出的能力等价绕过(Capability-Equivalent Bypass)现象:“能观测到”并不等同于“能识别”。一个原本意图删除或读取关键凭证(如 ~/.ssh/id_rsa)的恶意动作,被单点规则拦截后,Agent 往往并不会放弃目标。在攻击者指令或自身自主循环的驱动下,它可以通过换一种说法重写命令(如从 cat 换成 base64)、将一个破坏性动作拆解为跨多轮对话的多个看似无害的细碎步骤,甚至直接切换到另一个表面完全不同的工具(例如从 Terminal 命令换到 Python 执行器)。如果防御组件在每次调用时都作为“无状态”的审查器独立运作,它即便精准记录了每一次请求,也无法察觉这实际上是对已被拒绝目标的跨轮次、跨工具伪装渗透。

从上图公开基准测试的统计数据可以看出,未受保护的工业级 Agent 在面对 RD1(上下文信任)与 RD2(Agent 权限滥用)风险时表现得极其脆弱,攻击成功率居高不下。这充分印证了:如果防御系统不能覆盖完整的生命周期,且缺乏跨轮次的状态追踪能力,任何单点防线都会沦为虚设。
核心解法:将前沿安全能力收敛为外部只读监督者
为了在动态且多变的语义环境中识别恶意意图,安全系统必须具备极强的代码走查与上下文理解能力。然而,这就引发了一个经典的工程悖论:能够精准读懂代码并推断攻击意图的模型,其本身往往也是前沿的强推理模型,如果赋予这个安全审查模型过高的执行权限,一旦它在审查过程中被攻击载荷诱导注入,安全审查器自身反倒会沦为被利用的最高特权入口。
ClawSentry 确立的核心设计原则是:将前沿安全推理能力定位为“外部只读监督者(External Read-only Supervisor)”。这个监督者必须遵循三大铁律:
-
边界暴露受限(Bounded Exposure): 审查模型只能接触到被结构化清洗和范围限制的上下文,不能无限制地漫游整个宿主环境。
-
无动作执行权(No Authority to Act): 审查模型所属的工具包在物理架构上被严格限制为只读。它只能阅读代码、检索轨迹与查看上下文快照,绝对不向其暴露任何写磁盘、执行系统命令或外发网络请求的工具。
-
确定性规则托底(Extensible Priors): 最终的放行与阻断决策权牢牢由网关底层的确定性策略引擎把控。语义审查器只负责提供结构化的置信度证据,而不能擅自替代网关签发绝对豁免。
在此哲学指导下,ClawSentry 构筑了一套由前置准入、多层渐进式运行时引擎与后置反馈组成的立体防线。
AHP 协议:让安全网关与 Agent 框架解耦
如果安全组件必须深入每一个 Agent 框架的底层源码去打补丁,那么该方案在工程上就注定无法规模化落地。为了解决异构环境下的接入难题,ClawSentry 抽象出了一套框架无关的通信层——Agent Harness Protocol(AHP,Agent 安全控制协议)。

AHP 的巧妙之处在于将 Agent 运行时产生的异构事件抽象为统一的 CanonicalEvent。每个事件由标准化适配器(Adapter)生成,包含 SHA-256 签名的唯一事件标识、会话 ID、规范化工具名以及标准化的载荷,而各框架特定的非通用字段则被严密隔离在 framework_meta 命名空间中。
更重要的是,AHP 针对不同的生命周期位点建立了双通道拦截中继机制:
-
同步控制通道(覆盖位点 A、B、C): 针对于动作执行前的一切请求,适配器通过本地 Unix 域套接字(Unix Domain Socket, UDS)与安全网关保持高吞吐、极低延迟的同步阻塞通信。在网关显式返回
Allow(放行)、Block(阻断)或Defer(挂起审查)裁定之前,底层的真实动作严禁执行。这确保了防御机制稳稳扎根在关键路径上。 -
异步审计通道(覆盖位点 D): 动作执行完毕后,工具返回的真实输出通过 HTTP Webhooks 异步打入网关。这种非阻塞的设计既不会拖慢 Agent 的推理流转,又能让后置审查器即时剖析输出中的高风险数据泄露或潜在间接注入,并将分析证据动态馈送给后续操作。
通过 AHP,ClawSentry 在完全不侵入模型内部权重的条件下,直接无缝兼容了 Codex、Claude Code、Kimi CLI 和 Gemini CLI 等业界主流框架。开发者如果要适配一个全新的 Agent 框架,只需编写数行轻量级适配代码,即可全量继承整个安全网关的防护策略。
四位一体的渐进式防御机制
在 AHP 的事件规范之上,ClawSentry 沿着 Agent 的生命周期展开了环环相扣的四重防御。
1. 首次使用技能包审查(FSPR,位点 A)
任何代码在对宿主产生实质影响之前,都必须在 FSPR(First-use Skill Package Review)的显微镜下经过审查。FSPR 绝非简单调用一次大模型打分,而是划分为三个层次:首先利用基于规则的确定性证据底线快速过滤已知违规模式;对悬而未决的模糊扩展包,则唤醒一个只读、跨文件的轻量级分析 Agent,深入其多文件依赖链条中审查其是否存在未声明的越权行为;最后网关依据审查结果生成带内容哈希的审查缓存。凡被判定为可疑或声明行为不一致的技能包,在首次被调度时就会被彻底锁死在准入阶段。
2. 效应归一化的三层渐进式决策引擎(位点 B 与 C)
当技能被合法加载后,Agent 在执行具体动作时,往往会通过多种外在形式调用同一底层能力。ClawSentry 将每一个运行时事件投影为一个效应包络(Effect Envelope),抽取其真实能力类型、目标对象、敏感作用域以及上下文来源凭证,并从六个维度实时合成动态风险快照:
-
$D_1$:工具固有危险度
-
$D_2$:目标敏感程度(例如系统根目录、凭据存储路径)
-
$D_3$:命令语义危险度
-
$D_4$:会话累积风险值
-
$D_5$:当前 Agent 的信任等级偏差
-
$D_6$:注入攻击证据强度
系统通过加权公式计算基线风险分 $B_t$ 与最终加权分 $S_t$:
\[B_t = w_{123} \max(D_1, D_2, D_3) + w_4 D_4 + w_5 D_5\] \[S_t = B_t \left( 1 + \lambda \frac{D_6}{3} \right)\]基于该量化快照,ClawSentry 采用了漏斗式的三层(L1–L3)渐进决策:
-
L1 策略引擎: 基于确定性规则与白名单进行亚毫秒级匹配。明确合法或严重越权的请求直接在此裁决,过滤绝大多数无争议流量。
-
L2 语义分析器: 当 L1 判定处于灰色地带时,引入锚定在安全规则上的轻量模型开展语义审查。
-
L3 只读探针 Agent: 仅当 L2 仍无法消解歧义、且系统判定潜在破坏力较大时,才激活具备多轮推演能力的 L3 探针。该探针在严格受限的只读环境下,检查当前工作区上下文与任务轨迹,判断该调用的合理性。这种阶梯式过滤策略,把高昂且耗时的大模型审查成本压缩在极小一部分残留模糊流量中。
3. 能力等价防绕过追踪器(Cross-cutting Guard)
针对前文提到的换词、拆解和换工具绕过,ClawSentry 在内存中维护了一套会话级的“被阻断效应指纹库”。一旦 Agent 发起的某个动作被确认为此前遭拒行为的“能力等价延续”,系统会直接激活防绕过逻辑。若匹配度极其明确,网关直接依据历史策略阻断;若属于模糊的跨工具替换尝试,则直接将调用提级送入 L3 深入调查。模型在此处仅承担“语义比对识别者”的角色,判定当前行为是否为先前攻击的变体,最终的处置裁定权依然牢固掌握在网关手中,实现了语义识别能力与执行授权的彻底分离。
4. 后置后果异步审计(位点 D)
对于通过外部交互读入的非结构化返回内容,后置通道在不阻塞执行的前提下进行异步合规性筛查。如果从中捕捉到了隐藏的注入 Payload、意外泄露的环境变量密钥或经过混淆的隐蔽信道代码,网关会立即向操作员发出熔断告警,并以最高优先级将此高危证据非回溯式地注入到后续动作的快照风险分(提高 $D_6$)中,使得后续所有相关动作立刻受到最高严苛度的审查。
实验结果与系统性能权衡
一套优秀的安全系统不仅要看它能防住多少攻击,更要看它是否会因为过度敏感而“误杀”正常业务,导致 Agent 丧失自主解决复杂问题的实用性。
评估团队在业界公认的技能安全评测基准上进行了端到端的压力测试。测试覆盖了五种主流 Work Agent 配置,包括驱动 Codex 的 GPT-5.4 与 GPT-5.5、驱动 Claude Code 的 GLM-5.1 与 MiniMax-2.7,以及集成在 Kimi CLI 中的 Kimi-K2.5。值得注意的是,ClawSentry 在主实验中选用的安全审查模型并非算力极高昂的顶级专有模型,而是主打低延迟与高性价比的 gemini-3.5-flash,这更贴近实际生产部署的成本诉求。
测试得出的关键结论集中在以下几个维度:
-
攻击成功率(ASR)的断崖式压制:
在面对专门针对上下文伪装攻击设计的 SkillInject 基准时,未受保护的 Codex/GPT-5.4 系统的攻击成功率为 39.55%,而在 ClawSentry 的全生命周期看护下,该指标直接被压缩至 2.61%。在更加综合复杂的 SkillsSafety 全量测试集中,五种 Work Agent 在原生状态下的 ASR 普遍落在 33.5% 至 49.7% 的高危区间,接入 ClawSentry 后,各系统的 ASR 被强行约束在 9.09% 至 15.03% 之间,防御效果展现出了极高的一致性。
-
正常任务成功率(TSR)的极致保全:
安全机制如果导致误拦截频发,其商业价值将大打折扣。实验数据显示,在执行纯净无害的技能任务时,ClawSentry 的综合任务成功率高达 98.7%。即便在混杂着上下文注入干扰的严苛环境下,其任务成功率相较于原生状态也仅有极微弱的波动(例如在 Codex 上仅从 83.78% 轻微变动至 83.05%)。这证明效应归一化与细粒度风险快照机制准确切中了恶意意图与正当操作的语义边界。
-
阶梯式渐进漏斗带来的成本红利:
由于 L1 确定性层拦截了大量硬性违规与白名单操作,真正流入 L2 进行语义推理的流量不足整体调用的一小部分,而最终需要耗费多轮上下文唤醒 L3 探针的请求比例更是极为微小。这意味着企业在实际工程部署时,无需为每一个工具调用承担高昂的安全大模型 Token 成本,即可获得媲美前沿大模型深度推理的安全防护水位。
总结与行业启示
ClawSentry 的核心贡献,在于跳出了传统“把大模型当做黑盒过滤器”的初级防御思路,回归到了严谨的系统安全体系设计:
-
它明确指出了 Agent 面临的威胁是横跨技能准入、意图组装、命令执行与后置影响的全生命周期动态博弈;
-
它通过 AHP 协议确立了“控制流同步阻断、数据流异步审计”的双通道架构,打破了安全系统与具体 Agent 框架绑定的工程桎梏;
-
它确立了让前沿模型作为“只读外部监督者”的安全定位,达成了语义智能与系统权限的解耦。
随着自主智能体越来越深入地介入代码重构、生产运维自动化与私域数据处理等高权限业务场景,Agent 运行时的安全边界已经成为决定其能否规模化落地的胜负手。ClawSentry 所验证的这套多层渐进式防护范式,不仅为开源社区贡献了一套开箱即用的工业级防御套件,也为未来 Agent 安全系统的架构演进指明了清晰的技术路径。