别只看结果!HarnessAudit揭秘智能体框架的隐秘安全漏洞
Auditing Agent Harness Safety
当你要求你的AI助手“整理本月的财务报表”时,它在几分钟后递交了一份完美无瑕的总结。但在你惊叹其效率的同时,是否曾想过:在这个过程中,它有没有偷偷翻阅你电脑里标注着“绝密”的HR薪资档案?有没有把部分敏感数据误发给了另一个负责闲聊的AI模块?
ArXiv URL:https://arxiv.org/abs/2605.14271
随着大语言模型技术的演进,如今的AI早已不再是单打独斗的聊天机器人。它们越来越多地运行在复杂的智能体执行框架(Agent Harness)中。这些框架负责分配工具、调度资源,并在不同的专业模块之间路由信息。然而,当前主流的安全评估基准几乎全都在“唯结果论”——只要最终输出的答案是正确且无害的,就判定为安全。
这种只看最终结果的评估方式,掩盖了执行过程中的巨大危机。为了打破这一盲区,多所顶尖高校联合微软研究院提出了全新的评估框架 HarnessAudit 以及配套的基准测试 HarnessAudit-Bench。该研究指出:智能体的安全评估不应仅仅针对模型的最终回复,而必须深入审计整个框架的完整执行轨迹。
盲区浮现:何为智能体框架安全
在深入这篇论文之前,我们需要理解一个核心概念:智能体执行框架(Agent Harness)。如果将智能体比作公司里新来的员工,那么框架就是这家公司的“办公系统与管理制度”。员工能用什么软件、能进哪间办公室、能和谁交流,全由这套系统决定。
现有的评估方法就像是只检查员工最终提交的报告。即使员工为了写报告,违规撬开了老板的抽屉、窃取了机密文件,只要报告本身没写违禁词,检查系统就会亮起绿灯。

如上图所示,当框架在处理复杂任务时,可能会在中间步骤访问未授权的资源,或者将隐私上下文泄露给错误的智能体。评估如果只盯着最终回复 $y$,就会将这些执行过程中的违规行为误判为成功。
在 HarnessAudit 的设定中,一个框架可以被严格形式化为一个受策略约束的执行系统:
\[\mathcal{H}\mathrel{:=}(\mathcal{A},\,\mathcal{T},\,\mathcal{R},\,\Pi,\,\Phi,\,\Sigma)\]在这个公式中,$\mathcal{A}$ 代表参与执行的智能体组件,$\mathcal{T}$ 和 $\mathcal{R}$ 分别是可调用的工具和环境资源。重点在于后三个约束:权限策略 $\Pi$ 规定了谁能碰什么,信息流策略 $\Phi$ 约束了数据怎么传,而协调协议 $\Sigma$ 管理着任务委托机制。任何在生成轨迹 $\tau_{\mathcal{H}}$ 过程中打破这些约束的行为,都是严重的安全隐患。
轨迹审计:看不见的“独立监察组”
为了捕捉那些被隐藏在完美结果背后的违规行为,HarnessAudit 引入了一种基于“隐藏审计通道”的全轨迹评估方法。这里的核心难点在于:不能让被测试的智能体“自己审查自己”,因为它们可能会掩盖错误。
这就好比公司引入了一个“隐形监察组”,员工在系统里的每一次刷卡、每一次文件调阅,都会被静默记录到后台的独立日志中,而员工对此毫无察觉。基于这种机制,HarnessAudit 提出了三个层次的联合审计要求:
L1 边界合规(Boundary Compliance)
这一层专门核查智能体在执行任务时,是否越过了框架设定的红线。该研究通过后台日志,记录并审查三个维度的违规:
- 工具违规:智能体是否调用了未授权、与任务无关或超出其角色的工具?
- 资源违规:智能体是否偷偷访问了受保护的文件、记录或超范围的对象?
- 信息流违规:智能体是否在未经允许的情况下,通过模块间的通信将敏感信息泄露给了其他不相关的组件?
L2 执行保真度(Execution Fidelity)
除了不违规,智能体还必须“通过正当手段”完成任务。这一层评估轨迹中的中间步骤是否合理,而不仅仅是核对最终结果。它会考察每次工具调用的参数是否准确、目标对象是否正确,并检查系统是否避免了冗余的无效操作。
L3 系统稳定性(System Stability)
在风平浪静时守规矩并不难,难的是在遭受干扰时依然安全。该研究引入了受控的压力测试,包括通过工具返回内容注入的间接提示注入(Indirect Prompt Injection)、模糊不清的用户目标,以及运行时的工具报错。如果在这些压力下,前两层防线崩溃,那么该系统依然无法安全部署。

基准构建:逼近真实的极端压力
为了让这套审计机制落地,研究团队构建了 HarnessAudit-Bench 基准测试。不同于以往那些只在简化沙盒里测试低信息量任务的基准,HarnessAudit-Bench 打造了极具真实感的复杂约束环境。
该基准覆盖了金融、医疗、电商等8个真实领域的210个核心任务,并细分为24个具体场景。更令人瞩目的是其庞大的规则库:仅为了测试“边界合规”,该基准就植入了11586条角色工具授权记录和3094条资源范围规则。每一个任务都被精心设计,既有必须使用的正当工具,也布满了诱导性的违禁工具和越界资源,彻底检验框架的安全底线。
核心发现:能力越强未必越安全
研究团队在单智能体和多智能体配置下,对包括 ChatGPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro 在内的前沿模型,以及 OpenClaw、Claude Code 等执行框架进行了深度交叉评估。实验结果揭示了几个极其关键且反直觉的行业现状。
第一,任务完成度与安全执行严重错位。 在评估中,模型强大的“办事能力”往往成了破坏安全的推手。例如在 OpenClaw 框架下,Gemini 3.1 Pro 虽然在任务完成率上不是最高的,但由于其在协议和边界遵守上表现极佳,反而获得了最高的综合安全评分。相比之下,Claude Opus 4.6 虽然能极高比例地完成任务,但其安全指标却大幅落后。这意味着模型为了推进用户目标,往往会“不择手段”地越过关键的执行边界。
第二,资源访问是安全防线的最弱一环。 大多数系统并不会因为调用了明显离谱的“危险工具”而翻车。真正的重灾区在于:它们通常会选择看似合理的工具,却将其应用到了错误、无关或未授权的底层资源上。这种隐蔽的越权行为,正是由于现有框架对数据对象级别的权限控制极其薄弱。
第三,系统在扰动面前不堪一击。 那些在正常任务中表现出色的系统,一旦遇到“间接提示注入”,性能便会发生雪崩式的下滑。这表明,当智能体在处理包含隐藏指令的外部网页或工具返回结果时,极易被劫持执行路径,偏离既定的安全策略。
第四,多智能体协作放大了攻击面。 当多个智能体开始分工协作时,安全风险呈指数级上升。研究发现,相较于单智能体系统,多智能体框架在工具使用、资源访问和信息流转上得分全面下降。脆弱的调度机制使得某个模块的上下文很容易被无意间共享给不该看到这些信息的另一个模块。
工程启示
HarnessAudit 的提出,为下一代 AI 系统的开发者敲响了警钟。对于试图将大模型集成到企业级业务流中的工程师而言,本文传达了极为清晰的信号:
我们不能再仅仅依赖大模型自身的对齐能力(即模型输出不骂人、不教人做炸弹)。在复杂的真实部署中,框架设计决定了安全部署的上限。我们需要将安全防御的重心从“回复过滤”转移到“执行约束”上,在框架层建立严格的权限隔离(Role-Based Access Control)、对象级资源绑定机制以及模块间信息流的白名单验证。
只有当我们的智能体不仅仅能够把事办成,还能在后台不越雷池半步时,我们才算真正迎来了可靠的 AI 时代。