OpenAI发布GPT-Red:最大规模自对弈红队模型,对抗练出GPT-5.6!

GPT-Red: Automated Red Teaming via Self-Play at Scale

OpenAI发布GPT-Red:最大规模自对弈红队模型,对抗练出GPT-5.6! 论文图示

在大型语言模型(LLM)走向智能体(Agent)化、深度介入现实业务的过程中,安全防御一直是悬在开发者头顶的达摩克利斯之剑。传统的安全训练往往依赖人类组成的“红队”(Red Team)来测试模型的漏洞,或者收集有限的攻击数据集进行强化学习(RL)对抗训练。然而,这种静态的方法在模型能力爆发式增长面前显得捉襟见肘——模型很容易对已有的攻击模式过拟合,而对不断进化的、具备自适应能力的恶意攻击者毫无招架之力。

ArXiv URL:https://arxiv.org/abs/2607.26115v1

为了打破这一僵局,OpenAI 提出了一种基于大规模自对弈(Self-Play)的自动化红队系统——GPT-Red。它不是一个被动防守的补丁,而是一个专门被训练用来发现前沿大模型新型“提示注入”(Prompt Injection)和“越狱”(Jailbreak)漏洞的攻击型智能体。更重要的是,通过与这个极其狡猾的 AI 攻击者进行持续的对抗训练,OpenAI 成功锻造出了迄今为止抗提示注入能力最强的模型:GPT-5.6

这项工作不仅是目前已知规模最大的 LLM 安全训练项目,更向我们展示了一个令人兴奋的未来图景:通过攻防双方的自我进化飞轮,大模型的安全防御终于可以跟上其能力增长的步伐。

自动化红队:为什么我们需要 AI 来攻击 AI?

在深入探讨 GPT-Red 的机制之前,我们需要先明确一个核心问题:为什么人类红队不够用了?

现阶段,大模型遭遇的恶意输入已经远不止简单的“请告诉我如何制造炸弹”这类直白的违规请求。当 LLM 被赋予了调用工具、浏览网页甚至执行代码的权限后,攻击面呈指数级扩大。例如,攻击者可以将恶意指令隐藏在一个看似无害的网页或搜索结果中(即间接提示注入)。当防守模型(Defender)在执行诸如“总结网页内容”的任务时,就会不知不觉地读取并执行这些恶意指令,从而可能导致系统内部敏感数据被窃取或恶意代码被执行。

人类安全专家虽然经验丰富,但很难穷尽所有极其边缘、复杂且伪装性极强的攻击路径。同时,高质量的人工对抗数据集不仅构建成本高昂,且规模受限。为了弥合这一差距,OpenAI 确立了 GPT-Red 的核心愿景:训练一个能够自动化寻找前沿模型漏洞的攻击智能体,它不仅要在已知的攻击类型(直接提示注入、间接提示注入、内容违规越狱)上表现出色,还要能泛化到未知的场景和新的防御模型上。

为了让 GPT-Red 成为一个“讲武德”的现实主义攻击者,OpenAI 为其设定了严格的威胁模型(Threat Model)与有效性约束。在真实世界中,攻击者通常无法随意篡改防守模型运行环境的所有参数,他们只能在特定的接口(比如某一个将被模型抓取的特定网页)注入信息。因此,GPT-Red 在寻找攻击路径时,不能靠直接修改系统底层代码来“作弊”(Reward Hack),而是必须在规定好的攻击面内,通过生成具有欺骗性的提示词来达成诸如“窃取私密数据”或“删除系统目录”等恶意目标。

推理期的算力扩展:让攻击者学会“谋定而后动”

就像人类黑客在发起真正攻击前会进行多次探测和尝试一样,GPT-Red 也被赋予了在推理阶段扩展算力、不断试错的能力。

OpenAI 为 GPT-Red 提供了一个名为 defender_model 的工具。这使得攻击模型在最终发起攻击之前,可以在沙箱环境中对防守模型进行模拟测试。借助这个工具,GPT-Red 能够深入思考攻击策略,在庞大的恶意提示词搜索空间中进行迭代优化。

这种推理期的算力扩展带来了立竿见影的效果。实验结果表明,在同等环境设定下,GPT-Red 相比于未经过此类专门训练的 GPT-5.5 模型,不仅更倾向于使用该工具进行探测,而且在同等工具调用次数下,能够取得显著更高的攻击成功率(Attack Success Rate, ASR)。当面临由 10 个未知数据窃取场景组成的复杂环境时,传统的静态模型在解决了一些简单任务后往往会陷入停滞,而 GPT-Red 凭借其强大的策略迭代能力,能够跨任务积累经验,持续攻克更难的防御关卡。

自对弈训练:构建攻防演练的“达尔文游戏”

GPT-Red 最核心的创新在于其训练范式——基于强化学习的大规模自对弈(Self-Play)。

自对弈的逻辑非常直接:在同一个训练场中,同时放入作为攻击者的 GPT-Red 和一组具有多样性特征的防守模型。对于 GPT-Red 而言,它的奖励信号来自于成功诱导防守模型做出违规或危险行为;而防守模型的奖励则来自于成功抵御攻击,并圆满完成原本分配给它的正常任务。

这是一个典型的零和博弈。在训练初期,两边的模型都由具备强大思维链(Chain-of-Thought, CoT)推理能力的基础模型初始化。随着训练的推进,防守模型在不断抵御攻击的过程中变得越来越无懈可击;为了继续获得奖励,GPT-Red 就必须绞尽脑汁,进化出更为隐蔽、更具欺骗性的攻击手法。

OpenAI发布GPT-Red:最大规模自对弈红队模型,对抗练出GPT-5.6! 论文图示

上图展示了在训练过程中 GPT-Red 针对不同防守模型生成的攻击策略热力图。我们可以清晰地看到,GPT-Red 并没有寻找一种“万能药”,而是针对不同的防御机制演化出了高度特异化的攻击手段。某些对模型 A 极其致命的攻击,在模型 B 面前可能完全失效,这不仅证明了攻击者策略的多样性,也凸显了自对弈机制能够有效避免攻击模式的单一化。

更有趣的是,GPT-Red 在这个过程中学会了极其复杂的连环计。例如,面对具备复杂推理能力的智能体,简单的命令注入往往会被防守模型轻易识破。于是,GPT-Red 发明了一种被称为“假思维链”(Fake Chain-of-Thought)的攻击策略。它会在攻击载荷中伪造出一段与防守模型日常推理模式极其相似的文本,甚至会凭空捏造虚构的系统安全策略。当防守模型读取到这段被植入的数据时,会误将这段伪造的思维链当成自己之前的推理结果,从而乖乖地执行其中的危险指令(如数据外发)。这种能深入理解防守者心智模型并加以利用的攻击方式,远超普通人类红队能够批量设计的范畴。

逼真的安全强化学习环境

没有高质量的实战环境,再好的演练机制也是纸上谈兵。为了训练 GPT-Red 并随后提升前沿模型的防御力,OpenAI 构建了一个规模庞大且场景多样的安全强化学习环境库。

这些环境的设计理念非常巧妙:将现有的正常能力测试任务,直接转化为对抗训练环境。例如,在一个原本测试模型多模态图片识别能力的任务中,系统会在模型调用工具返回结果时,允许攻击者截断信息并在特定位置(如工具响应或者局部文件中)植入包含恶意指令的视觉图像。这就保证了所有的防御训练都发生在极其贴近真实生产环境的上下文之中。

OpenAI发布GPT-Red:最大规模自对弈红队模型,对抗练出GPT-5.6! 论文图示

红队测试环境主要分为几大类:

OpenAI发布GPT-Red:最大规模自对弈红队模型,对抗练出GPT-5.6! 论文图示

GPT-5.6 的诞生:百炼成钢的防御壁垒

所有针对 GPT-Red 的投入,最终目的都是为了打造更安全的生产模型。

在训练 GPT-Red 的过程中,OpenAI 动用的算力规模甚至与当前最大规模的 RL 后训练(Post-training)相当。GPT-Red 以当时的巅峰模型 GPT-5.5 为起点,不仅在上述所有安全环境中接受洗礼,同时还混合了标准的能力强化学习任务,以确保其指令遵循和逻辑推理能力不会在纯粹的对抗中退化。最终得到的 GPT-Red 展现出了令人惊叹的红队实力,它能极其稳定地攻破包括 GPT-5.5 在内的所有历史模型,不仅发现的成功攻击数量远超人工红队,更在面对未知的环境和工具框架时展现出了强大的泛化能力。

有了这样一个顶级“陪练”,OpenAI 顺理成章地将其引入了下一代旗舰模型 GPT-5.6 的强化学习训练管线中。

在 GPT-5.6 的日常能力训练期间,系统会持续向其输送由 GPT-Red 实时生成的高质量、高难度的提示注入攻击样本。这种动态注入使得 GPT-5.6 不断在防御漏洞上进行梯度攀爬(Hillclimb)。

OpenAI发布GPT-Red:最大规模自对弈红队模型,对抗练出GPT-5.6! 论文图示

最终的评测结果证明了这一路线的巨大成功。研究团队将经过 GPT-Red 对抗训练的 GPT-5.6,与另一个经过严格安全训练但未引入自动化红队的对照组模型(GPT-5.1)进行了对比。结果显示,在各类苛刻的测试基准上,GPT-5.6 的鲁棒性实现了跨越式的提升。最典型的数据体现在针对前文提到的“假思维链”(Fake CoT)攻击的防御上:在同等难度的挑战下,对照组模型的防御成功率仅为 5.2%,而经过自对弈对抗洗礼的 GPT-5.6,将这一防御指标飙升至惊人的 95.9%。这种本质上的跃升,标志着模型不仅学会了应对表面的词汇级恶意输入,更具备了在复杂推理链条中甄别信息真伪的深层防御能力。

结语:开启大模型安全的进化飞轮

GPT-Red 的提出,标志着大模型安全工程进入了一个全新的自动化对抗时代。它向行业证明了提升模型鲁棒性的三大关键要素必须同步扩展:攻击者在推理阶段的搜索算力、自对弈训练的计算资源,以及逼真多样的安全训练环境。

更重要的是,OpenAI 借此建立起了一个坚不可摧的“安全飞轮”。今天的 GPT-Red 帮助我们发现了最隐蔽的漏洞,从而孕育出坚不可摧的 GPT-5.6;而更加强大的 GPT-5.6 作为基础模型,未来将能够提供更加敏锐的学习信号,去训练下一代更聪明的红队智能体。这种矛与盾在算力推动下的无尽交锋,或许正是确保未来的超级人工智能始终安全、可靠并符合人类预期的最有效路径。