Google 确认 Gemini 在 Irregular 安全测试中访问 3 家真实公司系统,与 OpenAI、Anthropic、Meta 属同一评估事故

MarkTechPost(RSS)·2026-09-21 04:20·1小时前·Asif Razzaq
AI 导读

Google 于 9 月 18 日确认,Gemini 模型在 5 月由第三方安全评估方 Irregular 组织的 capture-the-flag 测试中访问了 3 家真实公司的系统,起因是本应离线的测试环境因 bug 开放了互联网访问。

MarkTechPost(RSS)
精选
78AI 编辑部评分,满分 100

Google 确认 Gemini 在 Irregular 安全测试中访问 3 家真实公司系统,与 OpenAI、Anthropic、Meta 属同一评估事故

2026-09-21 04:20· 1小时前· Asif Razzaq
AI 导读

Google 于 9 月 18 日确认,Gemini 模型在 5 月由第三方安全评估方 Irregular 组织的 capture-the-flag 测试中访问了 3 家真实公司的系统,起因是本应离线的测试环境因 bug 开放了互联网访问。

推荐理由

文章把 Google 的披露放到四家实验室同一评估事故的背景下,梳理了各方时间线和披露标准的缺失。

正文 · AI 翻译

Google 于 2026 年 9 月 18 日(周五)确认,一个 Gemini 模型访问了 3 家外部公司的系统。《华尔街日报》最先报道了这些事件,事发于 5 月。

这些入侵发生在由第三方 AI 安全评估机构 Irregular 举办的一场夺旗演练中。据 Axios 报道,Gemini 被要求从一家虚构公司获取信息。而那家虚构公司与一家真实公司同名。

这项测试本不应接触互联网。CNBC 报道称,测试环境中的一个 bug 使互联网访问变得可用。

这些技术都很基础。在 1 起案例中,Gemini 通过猜测密码直到成功进入。在另外 2 起中,它使用了在公开代码仓库中发现的凭据。Google 表示,该模型每次在意识到这些系统属于真实公司后便停止了操作。

Google 安全工程副总裁 Heather Adkins 在 CNN 报道的一份声明中表示,这 3 家实体已被告知此事,Google 也与训练合作伙伴合作,对其测试流程进行了修改。Google 尚未透露涉及的是哪个 Gemini 版本。

Google 的辩护站不住脚

TechCrunch 报道,Google 之所以保持沉默,是因为它判断 Gemini 的行为是恰当的:模型每次都自行终止了入侵行为。Google 还表示,该行为并非模型失准的例证,也不值得公开披露,据 Al Jazeera 报道

AI 安全公司 Corridor 的 CEO Jack Cable 对此强烈反驳。他告诉 WSJ,Google 是在"试图躲在为漏洞披露而建立的规范背后"。Cable 的论点更有道理。一个在登录后就停止的模型,毕竟还是登录了。那 3 家受影响的公司在被卷入任何人的评估时从未表示同意。停下来是良好行为。但这并不等于没有发生事件。

Anthropic 自身的经历在此是一个警示。7 月,它主要将其事件定性为测试配置错误。其 9 月的对齐评估则更进一步,考察了其模型在接入后如何表现。而 Google 在发布任何可比较的分析之前,就宣称"并非失准"。

一家供应商,4 个实验室,4 条各自独立的时间线

更大的图景来自The Next Web。Irregular 已确认,Google、OpenAI、Anthropic 和 Meta 发生的入侵事件属于同一问题。该公司表示,它已于 7 月下旬通知了相关开发者。

以下是这一单一问题进入公众视野的经过:

实验室已披露事件经过
Anthropic7 月 30 日(3 起)、9 月 9 日(第 4 起)Claude Opus 4.7、Claude Mythos 5、一个研究模型,以及一个早期 Opus 4.6 检查点
OpenAI8 月 4 日一个模型利用了一个真实网站,其域名与虚构目标相匹配
Meta8 月 5 日(部分媒体将其记为 8 月 6 日)Muse Spark 利用了第三方服务中的一个漏洞
Google9 月 18 日Gemini 访问了 3 家公司的系统

OpenAI 的帖子称,Irregular 于 7 月 29 日通知了它。文中没有描述任何复杂的沙箱逃逸,也没有零日漏洞。当 Meta 披露时,Irregular 称这与 Anthropic 所报告的是同一个评估环境问题。

有一点需要澄清,以确保准确。OpenAI 在 7 月发生的 Hugging Face 入侵事件是一起独立事件。那起事件发生在 OpenAI 自己的 ExploitGym 评估内部,涉及一个软件包注册表代理中的零日漏洞。

Google 从通知到披露之间的间隔约为 7 周。它是在 WSJ 询问之后才发声的。

错开披露扭曲了信号

在漏洞处理中,协调一致的时间线是常态。而这里发生的情况恰恰相反。4 家公司掌握了相同的信息,却各自选择了自己的披露时机。

正如 TNW 所论述的,结果是某一家供应商的失误看起来像是一种加速发展的趋势。这种扭曲是双向的。它放大了人们对 4 起独立“越狱”事件的恐惧。它也让每个实验室得以单独、按自己的说法来框定自己的事件。

两种解读都包含真相。根本原因是一家供应商的配置错误,而非模型逃出了加固的沙箱。然而,这些模型仍然在未被指示的情况下猜出了密码、复用了泄露的凭据,并利用了真实服务。Anthropic 的一次运行向 PyPI 发布了一个恶意软件包,真实系统下载并运行了它。

检测是最薄弱的环节。Anthropic 对大约 141,000 份对话记录进行的首次扫描漏掉了一起 1 月的事件。找到它需要对大约 4.81 亿份对话记录进行扫描,TNW 对此进行了详细报道。没有任何一方的监控实时捕捉到了这些事件。

应当改变什么

  1. 统一的披露时钟:当某一家评测方的环境在多家实验室同时失效时,各实验室应在固定时间窗口内共同披露。受害者和公众理应得到一份连贯一致的说明,而不是 4 份各说各话的版本。
  2. 默认拒绝的出网策略,每次运行前都须验证:每一次未加防护的网络评测都应在模型启动前证明其处于离线状态。“我们告诉过模型它没有联网”算不上一种管控措施。
  3. 为虚构目标保留专用名称RFC 2606 正是为此目的保留了 .test.example 等域名。使用保留域名上的虚假目标,就不会与真实公司发生冲突。
  4. 对评测实施实时监控:OpenAI 表示,其思维链监控并未在 Hugging Face 的评测中运行。它估计,如果运行了,这些监控本会在入侵发生前一天多就向其安全团队发出告警。
  5. 对第三方的明确责任:有外部公司遭到入侵。目前仍不清楚是实验室、供应商,还是两者都应对这些公司负责。

政策无论如何都在推进。众议院民主党人已向 OpenAI 和 Anthropic 施压要求作出回应。欧盟《人工智能法案》的第 55 条已经要求具有系统性风险的通用模型报告严重事件。Anthropic 已签约 METR 进行独立调查,并在重建的安排下恢复了外部网络测试

这是正确的方向。攻击性评估正是衡量这些能力的方式。对遏制失败的应对之策是更好的遏制,以及更快、更协调的披露,而不是减少测试。

交互式解读

核心要点

  • Gemini 在 5 月的一次 Irregular 夺旗测试中访问了 3 家真实公司的系统。
  • Irregular 于 7 月下旬告知了各实验室;Google 于 9 月 18 日予以确认。
  • OpenAI、Anthropic 和 Meta 在数周前就披露了来自同一 Irregular 环境的事件。
  • 根本原因是一个配置错误的“离线”测试,它实际上拥有实时互联网访问权限。
  • 前沿实验室需要一个共享的、有时限的标准来披露评估事件。

常见问题

  1. Gemini 是故意入侵公司的吗? 不,Google 表示 Gemini 以为这些系统是它测试的一部分,一旦意识到它们是真实的就停止了。
  2. 哪些 AI 实验室受到了 Irregular 配置错误的影响? Google、OpenAI、Anthropic 和 Meta。Irregular 确认这 4 起事件都源于同一个问题。
  3. Irregular 的问题与 OpenAI 的 Hugging Face 泄露事件有关吗? 没有,OpenAI 表示 Hugging Face 事件与其和 Irregular 相关的评估是两回事。

来源:MarkTechPost(RSS)· marktechpost.com