跳到正文
原文
英国 AI Security Institute:Blog(网页)·· 2026-02-17精选AI 评分75

英国 AI Security Institute 发布 Boundary Point Jailbreaking 黑盒越狱攻击方法

Boundary Point Jailbreaking: A new way to break the strongest AI defences

AI 导读

英国 AI Security Institute 红队发布 Boundary Point Jailbreaking(BPJ),一种在纯黑盒设置下自动生成通用越狱前缀的攻击方法。

推荐理由

原文由攻击方法开发者本人披露关键结果与成本数字,读者可据此了解黑盒越狱攻击的演进方向和防御启示。

正文 · AI 翻译

AI 开发者使用防护措施来防止模型在面对越狱时提供有害回应,越狱是专门编写的提示词,旨在绕过这些防护措施并提取有害信息。 

根据我们的经验,开发强大防护措施的最佳方式是反复尝试攻破它们。在过去两年中,我们的红队通过扮演攻击者并开发越狱,测试了顶级 AI 公司的防护措施。我们针对所有测试过的模型都开发出了成功的越狱,并与AI 公司合作改进其防御。

随着时间的推移,某些模型防护措施有所改进,需要更多时间、精力和专业知识才能攻破。但随着防护措施的改进,攻击者可能会开发出越来越复杂的技术。为了防御这一风险,我们开发最先进的攻击技术,并与公司合作,在攻击成为现实之前进行防御。

今天,我们分享关于边界点越狱(BPJ)的信息:一种全自动方法,用于针对最强大的已部署 AI 防御开发通用越狱,在完全“黑盒”设置中,攻击者只能看到输入是否被阻止。 

我们认为 BPJ 是首个成功对抗 Constitutional Classifiers [1] 的自动化攻击,这是 Anthropic 的防御系统,此前经受住了超过 3,700 小时的人工红队测试,在此期间仅发现一次完全成功的人工主导攻击。BPJ 也是首个成功对抗 OpenAI 针对 GPT-5 的输入分类器的自动化攻击,而无需依赖人工种子攻击 [2]。 

我们分享关于 BPJ 的信息,作为我们负责任披露流程的一部分。BPJ 不仅对 AI 开发者有影响,对任何试图保护 AI 系统的人都有影响。使用仅查看单次交互的“单交互”防御很难抵御 BPJ;相反,我们的结果表明,防御者应采用“批级”监控系统,检测流量中的可疑模式。

在这篇博客文章中,我们解释了 BPJ 的工作原理、它在实际测试系统上的表现,以及它对 AI 安全未来的影响。

‍

攻破黑盒分类器的挑战

我们专注于攻击黑盒分类器,这是顶级 AI 公司使用的防御措施,其中单独的模型监控交互并标记有害请求。BPJ 旨在针对这些分类器开发对抗前缀 [3]:文本——当放在有害问题(“目标”)之前时——导致分类器错误地将该问题分类为良性。

图 1. 对抗前缀。通常,有害请求会被辅助分类器标记,以防止模型回应(左)。BPJ 开发对抗前缀(红色前置文本),绕过分类器,从而从模型中提取有害信息(右)。注意,此请求是来自公共数据集的示例——我们使用的问题通常更长、更深入。前缀同样是示例性的,不是 BPJ 发现的攻击(参见主论文以获取简单设置中的完整示例)。

黑盒分类器通常每次尝试只给攻击者一条信息:输入是否被标记为有害。这阻碍了大多数先前的攻击算法,因为它们依赖于获取更丰富的信息,如分类器置信度分数、梯度或自然语言反馈。

在攻击鲁棒的黑盒分类器时,你尝试的每个前缀往往都会被分类器标记,从而无法判断对前缀的某一处修改是否比另一处略好。因此,攻击黑盒分类器的核心难点在于评估你所开发的前缀的某一处修改是否使该前缀有所改进。

‍

BPJ 的工作原理

BPJ 正是为解决这一评估问题而设计的。它通过两种协同工作的技术来实现这一点:

  1. 课程学习:BPJ 的第一个洞见是不直接针对一个明显有害的问题,而是通过创建一系列难度逐渐增加的中间目标来使用一个合成的课程。从完全无害的内容开始,我们慢慢“混入”更多有害目标。我们先针对较容易的层级优化攻击,然后随着攻击的改进而提高难度。

图 2. 课程学习。BPJ 通过使用“插值”函数生成一个由中间目标组成的课程,从而解决困难的目标查询。在噪声插值中,我们将目标有害文本中的 n 个字符替换为噪声字符。较高的噪声水平(右)对当前攻击来说更容易解决;较低的噪声水平(左)则更难。
  1. 边界点:即使有了课程,大多数目标也无法提供信号,因为它们要么太容易(因此所有攻击修改都“未被标记”),要么太难(因此所有攻击修改都“被标记”)。BPJ 的第二个关键洞见是主动搜索那些恰好处于被标记边缘的目标——即位于分类器“决策边界”上的目标。我们称这些为“边界点”。由于它们恰好处于边缘,它们对攻击强度的微小改进也很敏感,从而为算法提供可供学习的信号。 

图 3.边界点搜索。在一个课程层级内,我们寻找能够揭示攻击强度微小变化的攻击目标。为了找到这些目标,我们在当前最佳攻击上测试它们,并过滤掉仅被标记(对当前攻击来说太难)或仅未被标记(对当前攻击来说太容易)的目标。

完整算法在发现新的边界点和改进攻击之间交替进行,沿着课程逐步推进,直到成功攻破那个明显有害的问题。在我们的实验中,将课程学习与边界点相结合,找到成功攻击的速度比仅使用课程学习快约 5 倍。值得注意的是,像随机搜索这样的先前方法即使面对基本分类器也完全失败。

图 4.BPJ 相比随机生成前缀(Best-of-N)和仅使用课程的方法有重大改进。BPJ 平均比仅使用课程快 5 倍成功,而两者都比仅使用 Best-of-N 前缀快得多。

‍

结果

我们针对两个最强的已部署防御系统测试了 BPJ:Anthropic 的 Constitutional Classifiers 和 OpenAI 用于 GPT-5 的输入分类器。 

图 5。 BPJ 成功攻破 Constitutional Classifiers 和 GPT-5 的输入分类器。 BPJ 在两个最困难的公开防护系统上,对具有挑战性的未见生物滥用问题表现良好。Max 指每个问题 50 次查询中的最佳得分。

BPJ 成功找到了针对这两个系统的越狱前缀。在两种情况下,我们都发现了“通用”越狱——这些越狱适用于一系列未见的有害问题,而不仅仅是优化过程中使用的问题。我们发现,在少量问题上运行 BPJ 会自动产生通用越狱。

针对 Constitutional Classifiers,BPJ 将一组有害问题的平均得分从 0% 提高到 25.5%(50 次尝试中最高 39.9%),成本约为 330 美元和 66 万次查询 [4]。使用基本提示策略(elicitation),这些得分上升到平均 68%(50 次中最高 80.4%)。针对 GPT-5 的输入分类器,BPJ 实现了平均 75.6%(50 次中最高 94.3%),成本约为 210 美元和 80 万次查询。

‍

对防御的启示

BPJ 提醒我们,防护开发是一项持续的工程学科:随着防御的改进,攻击者也会适应。这意味着 AI 系统需要针对可用的最强方法进行测试,而不仅仅是最容易检测的方法。  

BPJ 不是一次性的、可修补的攻击,而是一种通用算法,能够找到优化信号来改进攻击。因此,仅仅通过改进分类器来防御 BPJ 可能非常困难。相反,我们建议使用批级监控,即聚合跨交互的流量,而不是试图通过一次只考虑单个交互来防止有害交互。更一般地说,BPJ 强化了使用分层防御方法的重要性,以避免单点故障——特别是如果该故障点可以被直接优化针对。

我们在发表前与 Anthropic 和 OpenAI 分享了这些结果,我们对他们的回应感到鼓舞:两家公司都开发了针对 BPJ 的特定缓解措施,我们正在积极合作,继续开发和测试他们的防御。尽管实施像 BPJ 这样的攻击需要大量专业知识(即使有我们的协助,一家领先公司的研究人员也需要数周才能复现),但我们认为这是一个重要指标,表明随着系统变得更强大并部署在更高风险的环境中,开发者应该准备应对的威胁。

推进我们对攻击的理解——并相应地改进防御——是 AI 系统变得更安全的方式。通过公开分享 BPJ,我们希望为所有构建、部署和评估 AI 系统的人的努力提供信息。

你可以在完整论文中阅读更多内容 [5]。

我们正在招聘。如果你对提高先进 AI 系统安全性的研究感到兴奋,申请成为我们红队的研究科学家。

‍

[1] Anthropic 证实,BPJ 是他们所知的首个在 Constitutional Classifiers 设置中成功的全自动黑盒攻击,并且本应达到其漏洞赏金计划中描述的通用越狱标准。我们注意到,BPJ 需要数月的研究与开发工作,而 Constitutional Classifiers 的设计目标是抵御技能较低、查询预算较小、投入攻击开发时间较少且难以实现 BPJ 细节的攻击者。

[2] OpenAI 证实,BPJ 也是他们所知的首个不依赖人工种子攻击、成功绕过 OpenAI 针对 GPT-5 的输入分类器的自动化攻击。我们注意到,BPJ 的开发和执行发生在不受封禁等执法行动约束的账户上;在标准账户上,反复触发标记很可能导致账户封禁,这正是我们建议的批级监控的一个例子。

[3] BPJ 专门针对分类器。我们使用一种基本的人工发现的越狱方法来绕过主模型的拒绝。这些主模型越狱比针对分类器系统的攻击要容易开发得多。

[4] “Score” 是使用评分标准按问题计算的,该标准检查答案中是否包含特定的技术细节。

[5] 为降低扩散风险,我们隐去了一些算法细节,并且不会发布攻击字符串或代码。请参阅论文中的影响声明以了解我们的发布理由。

‍

作者:Xander Davies、Giorgi Giglemiani、Edmund Lau、Eric Winsor、Geoffrey Irving、Yarin Gal

‍

来源:英国 AI Security Institute:Blog(网页) · aisi.gov.uk