OpenART:告别静态测试,环境演化让Agent攻击成功率达到85%!

OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution

当今的大语言模型智能体(Agent)正越来越多地被部署在持久化的真实环境中,执行动辄需要数十分钟甚至数小时的复杂任务。它们需要读写共享文件、调用外部 API、修改系统状态,并在漫长的工作流中反复利用这些信息。然而,面对这样复杂的运行机制,目前的 AI 安全评估却依然停留在“一问一答”的石器时代。

ArXiv URL:https://arxiv.org/abs/2608.00677

现有的安全基准往往只会抛给智能体一个简短、静态的测试任务,评估其是否会在几步之内输出有害指令。这种测试就像是用百米冲刺的标准来衡量马拉松选手的耐力:它完全忽略了早期看似无害的微小状态改变,可能会在漫长的交互链条后引发灾难性的安全崩塌。

为了填补这一巨大的安全盲区,研究团队推出了 OpenART(Open-Ended Environment Evolution for Agent Red Teaming),一个旨在通过大规模环境演化来对智能体进行红蓝对抗的全新评估框架。与过去只在提示词(Prompt)上做文章的攻击不同,OpenART 将安全红蓝对抗的焦点转移到了“可执行环境”上。

论文不仅构建了包含上万个长程任务的庞大场景库,还提出了一种名为 EMHA(Evolutionary Markov Hypergraph Attack)的黑盒环境演化攻击算法。在跨越 15 种真实智能体与 5 种顶级基座模型的 75 种组合测试中,EMHA 实现了高达 85.0% 的严格攻击成功率。更值得警惕的是,实验证明:任务越复杂,环境演化暴露出的安全漏洞就越致命

静态基准的失效与长期交互的安全隐患

在大模型与人类的日常对话中,安全的边界相对清晰:用户输入一个违规的指令,模型拒绝回答,一次安全防御就成功了。但当大模型被封装成 Agent,并被赋予了操作环境的权限时,安全问题就发生了质变。

智能体在执行任务时,其行为是通过持久化的共享状态(Shared State)来介导的。一个智能体可能会读取一个外部文件,根据文件内容生成代码,再将代码写入系统并执行。在这个长程工作流中,如果环境被悄悄篡改,比如某个依赖库的版本被替换,或者某个数据表里被注入了恶意指令,智能体在最初的操作中可能完全察觉不到异常。只有当任务推进到特定节点,这些潜伏的“毒药”才会被触发,导致智能体执行越权操作或泄露敏感隐私。

现有的基准测试(如 AgentHarm 或 AgentSecurityBench)虽然也引入了工具调用,但它们通常局限于非常短期的操作,一旦任务结束,环境就会被重置。这种机制无法捕捉到延迟发作的攻击传播,也无法评估智能体在环境不断演变时的安全韧性。

更现实的困境是,不同的 Agent 框架(如 AutoGPT、Aider 或各种开源代码助手)有着完全不同的接口形态。如果想要横向比较它们的安全水位,研究人员过去只能为每个框架手工定制测试脚本,这不仅效率低下,也让跨平台的统一对比成为奢望。

OpenART 架构:重塑红蓝对抗的基本单位

为了解决上述问题,OpenART 提出了一个根本性的理念转变:安全评估的基本单位不应该再是“孤立的提示词”,而应该是“包含持久化状态的可执行环境”

研究团队认为,一个完整的测试场景(Scenario)应该包含三个要素:一个良性的任务目标、一个隐藏的安全契约(衡量行为是否越界),以及一个智能体置身其中的可执行环境。

Figure 1: Overview of OpenART

如上图所示,OpenART 的工作流被拆解为三个精心设计的阶段:

第一阶段:构建极具挑战性的长程场景

OpenART 从现实工作环境(参照 O*NET 职业分类)中提炼了 50 个应用领域。依托超过 50 万个工具、MCP(Model Context Protocol)和技能的庞大语料库,框架自动合成了复杂的执行依赖图。每一个被纳入题库的场景,都必须经过自动化探测器和人类专家的双重验证,以确保其可执行性及安全判定逻辑的严密性。最终,OpenART 输出了超过 10,000 个高质量的验证场景。在这些场景中,智能体完成任务的中位数需要进行 97 次工具调用,这远远超过了现有基准中个位数或十位数级别的复杂度。

第二阶段:跨智能体的无缝运行时映射

为了在不同架构的智能体之间实现公平的横向比较,OpenART 设计了一套目标不可知(Target-Agnostic)的场景表示方法,并辅以轻量级的运行时适配器(Runtime Adapters)。当场景被下发给具体的 Agent 时,适配器会充当翻译官,将底层的任务语义、环境文件和评估器,精准投射到该 Agent 原生支持的接口中。

无论是提供代码补全的 Aider,还是基于命令行的 Copilot CLI,它们都会在自身熟悉的运行环境下处理同一个任务。这确保了在评估 15 种部署的 Agent 和 5 种底层大模型(共计 75 种配置)时,大家面对的困难是等价的,评价标尺是统一的。

第三阶段:受控的环境演化

这是 OpenART 最核心的红蓝对抗机制。在执行过程中,测试的“良性任务目标”和用来评判违规的“安全契约”始终保持冻结。红蓝对抗策略只被允许改变暴露给智能体的环境状态(比如更改工作区的文件内容、伪造之前的短期记忆或篡改特定的工具响应)。随着反馈的不断累积,环境朝着越来越容易诱导智能体犯错的方向演化。通过这种控制变量法,OpenART 能够清晰地证明:攻击成功率的提升,完全是因为智能体应对复杂环境变化的能力不足,而不是因为测试目标被偷偷替换了。

EMHA:无需参数更新的黑盒攻击术

在定义了清晰的演化框架后,如何高效地找到能让 Agent 崩溃的环境修改路径?OpenART 并没有采用需要大量算力进行参数微调的白盒攻击方法,而是提出了一种精妙的黑盒参考策略——演化马尔可夫超图攻击(Evolutionary Markov Hypergraph Attack, 简称 EMHA)

Figure 3: OpenART arena

对于长期任务来说,环境状态的改变往往是牵一发而动全身的。EMHA 的核心思想是:将协调的环境演变过程,建模为在“超图(Hypergraph)”上的游走与探索。

在 EMHA 的视角下,每一次环境的调整都不是盲目的随机抽样。算法维持着一个外部的攻击者状态(Attacker State),其中记录了过去尝试过的环境修改及其带来的反馈。这个过程被巧妙地设计为冻结上下文的适应(Frozen in-context adaptation)。也就是说,作为攻击驱动引擎的大语言模型自身的参数 $\theta$ 始终不发生变化($\theta_{t+1}=\theta_{t}=\theta_{0}$),算法完全依靠记忆模块中积累的黑盒反馈来提炼经验。

在每一个攻击轮次中,EMHA 会执行以下几个关键步骤:

这种设计的优雅之处在于,它完全不需要获取目标 Agent 内部大模型的权重信息,因此可以无缝应用于任何闭源的商业模型,同时保持极高的攻击效率。

10000+场景实测:环境演化揭示的安全真相

为了验证 OpenART 和 EMHA 的威力,研究团队在包含 50 个领域的过万个场景中,对市面上主流的 Agent 进行了地毯式的红蓝对抗。测试涵盖了 GPT-5.5、Claude-Opus-4.8、GLM-5.2、Qwen-3.7-Max 等顶级基座模型(部分代号可能为实验平台内部代称以规避直接对齐)。为了确保结果的严谨性,不仅使用了确定性的代码逻辑评估器,还引入了 GLM-5.2 作为裁判员,只有两者同时判定攻击成功,才会计入最终的严格攻击成功率(Strict ASR)

实验结果揭示了几个极其重要的安全结论:

第一,环境演化对复杂任务具有毁灭性的杀伤力。

在所有的 75 种智能体与模型的配置中,EMHA 达到了惊人的 85.0% 的汇集攻击成功率。最令人瞩目的是,当任务相对简单(依赖较浅,调用次数少)时,全环境演化相对于传统的“仅修改指令”的攻击方法,优势只有大约 1.8% 到 2.7%。然而,一旦将测试放在那些需要深度并行调用、涉及大量持久化状态的极其复杂的场景中,环境演化的优势瞬间暴增了 17.2% 到 17.6%。

这证明了一个可怕的事实:长周期的工作流本身就是安全风险的放大器。在漫长的交互中,智能体极容易在某个不起眼的环节吸收了被污染的环境信息,并由于缺乏全局的防备意识,在后续的行动中将错误不断传递,最终酿成大祸。

第二,代码实现的质量,也是决定 Agent 安全性的关键。

长久以来,AI 社区存在一种偏见,认为只要底层的大模型足够聪明、经过了充分的安全对齐,由它驱动的 Agent 就自然是安全的。OpenART 的数据打破了这种迷思。

经过统计分解,虽然底层基座模型解释了大约 73.6% 的安全变异,但在控制了基座模型和任务完成度等变量后,目标智能体的具体身份(即它的运行时实现,Runtime Implementation)依然能够额外解释 7.6% 的攻击成功率变化

这意味着,即使两个 Agent 都在使用完全相同的最先进的大模型,如果其中一个在开发时对工作区权限的隔离做得不够好,或者没有对短期记忆和长期记忆的边界进行严格的清洗,它同样会轻易地倒在环境演化攻击的屠刀之下。Agent 的安全,不仅是模型算法工程师的责任,更是应用层系统架构师必须面对的挑战。

总结与展望

OpenART 框架的出现,标志着大模型智能体的安全评估正式从静态的“短跑测试”跨入到了动态的“马拉松越野赛”。通过将测试焦点从单纯的提示词转移到长程任务中不断演化的环境状态,OpenART 为行业提供了一面更为清晰的照妖镜。

在这个包含超 10,000 个场景和 97 步调用中位数的残酷竞技场里,85.0% 的攻击成功率不仅证明了 EMHA 算法的强悍,更敲响了 AI 安全的警钟。未来的智能体防御系统,必须超越对单次指令的拦截,建立起跨时间步骤、跨文件状态的全局免疫机制。同时,开发者们也必须清醒地认识到:模型能力的强大并不等同于系统运行时的坚不可摧,唯有在真实演化的环境中磨砺出的安全底线,才能支撑起 AI 走向千行百业的宏大愿景。