GPT-Red:通过大规模自对弈实现自动化红队测试

HuggingFace Daily Papers(社区热门论文)·2026-07-28 08:00·55天前
AI 导读

OpenAI 推出 GPT-Red,一个通过自对弈算法训练的自动化红队智能体,用于发现针对前沿大语言模型的提示注入攻击。该模型在同等规模的最大 RL 后训练计算上训练,能可靠攻破 GPT-5.5 及更早模型,发现比人类红队更多的成功攻击,并泛化到未见环境与防御模型。GPT-Red 被用于对抗性训练 GPT-5.6,使其成为目前对提示注入最鲁棒的模型。

HuggingFace Daily Papers(社区热门论文)
精选
75AI 编辑部评分,满分 100

GPT-Red:通过大规模自对弈实现自动化红队测试

2026-07-28 08:00· 55天前
AI 导读

OpenAI 推出 GPT-Red,一个通过自对弈算法训练的自动化红队智能体,用于发现针对前沿大语言模型的提示注入攻击。该模型在同等规模的最大 RL 后训练计算上训练,能可靠攻破 GPT-5.5 及更早模型,发现比人类红队更多的成功攻击,并泛化到未见环境与防御模型。GPT-Red 被用于对抗性训练 GPT-5.6,使其成为目前对提示注入最鲁棒的模型。

推荐理由

OpenAI 用自对弈训练出 GPT-Red,攻击成功率超过人类红队,并直接用于加固 GPT-5.6。这是目前最大规模的安全训练实验,做对齐的值得逐段拆解,对抗训练的思路可能会被各家复用。

正文 · AI 翻译

我们推出 GPT-Red,一个自动化红队智能体,经过训练用于发现针对前沿大语言模型的新型提示注入攻击。该模型的目标是评估并提升我们生产系统的鲁棒性。为此,我们用它来对 GPT-5.6 进行对抗性训练,这是迄今为止我们对提示注入攻击鲁棒性最强的模型。

为了创建 GPT-Red,我们设计了一种可扩展的自对弈算法,让该模型负责攻击一组同时训练的多样化防御智能体。我们在贴近真实场景的红队环境中训练该模型,所用算力与我们最大规模的强化学习后训练运行相当,使其成为有记录以来规模最大的单次大语言模型安全训练任务。

GPT-Red 在红队测试方面表现出色:它能稳定攻破我们此前直至 GPT-5.5 的模型,发现成功攻击的数量超过人类红队成员,并且能泛化到未见过的环境、防御模型和测试框架中。未来,我们预期随着每个新 GPT 模型鲁棒性的提升,它反过来也会为更强的红队智能体提供更好的学习信号,从而开启自我改进的飞轮效应。

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org