跳到正文
OpenAI:官网动态·· 2 小时前精选AI 评分60

OpenAI 公布 EU AI Act 下的文本溯源方案,推出 textGrain 文本水印

Our approach to EU text provenance rules

AI 导读

OpenAI 公布应对 EU AI Act 的文本水印方案,发布在模型词选择中加入不可见统计信号的 textGrain 技术,API 客户即日起可对部分模型选择性开启水印,未来数周将在欧盟地区为 ChatGPT 和 Codex 输出添加隐形水印,检测器暂只向获批的研究者和专家机构开放。

推荐理由

原文给出 textGrain 的检测数据和局限边界,读者可以据此了解文本水印目前的实际能力和适用条件。

正文 · AI 翻译

我们在欧盟文本溯源规则上的做法

在当今技术条件下促进透明度。

加载中…

音频 1

分享

内容溯源帮助人们了解内容的来源、创建或编辑方式,以及其中是否包含与我们模型相关的信号。我们已公开提供工具,用于识别由我们模型生成的图像和音频。今天,我们分享针对欧盟《人工智能法案》的文本水印方案,以及它如何融入我们更广泛的工作。

欧盟《人工智能法案》要求生成式 AI 提供商以机器可读的方式使生成的文本可被识别。文本水印和检测仍属早期技术,存在显著局限,关于其益处和负责任使用的看法仍在发展中。我们的分阶段方案既反映了欧盟《人工智能法案》的要求,也反映了该技术的局限,并强调对文本水印能告诉人们什么、不能告诉人们什么的透明度:

  • 从今天起,全球 API 客户将能够为部分模型选择启用文本水印。文本水印在 API 中默认保持关闭。

  • 在未来几周内,我们将为欧盟境内符合条件的 ChatGPT 和 Codex 文本输出添加不可见水印。

  • 我们开放文本水印检测器的申请。访问权限最初将仅限于经批准的研究人员和专家组织,他们可以帮助我们评估和改进这项技术。

我们的水印如何工作及表现如何

我们的文本水印技术 textGrain 会向模型的用词选择中添加一种不可见的统计信号。我们的检测器会寻找该信号,以评估一段文字是否包含 OpenAI 水印。有关 textGrain 工作原理的更多细节可在我们的技术报告⁠(在新窗口中打开)中找到,该报告将在未来几周内更新更多细节。我们还计划将该技术开源,以便他人在此基础上继续开发。

在我们的评估中,textGrain 达到或超过了我们测试过的其他方法的表现,包括用于文本的 SynthID。即便如此,理想条件下的强劲表现并不能保证在日常使用中可靠检测。

检测器可能犯两类错误:它们可能在不存在水印时报告存在水印——即假阳性——或漏掉存在的水印——即假阴性。以下评估说明了其中一些挑战:

  • 更短或更受限的文本更难检测。在 1% 的目标假阳性率下,对于心理学等内容,我们的检测器在约 80% 的 200 token 段落中识别出水印,而在 400 token 段落中约为 95%。对于数学等用词灵活性较低的内容,检测率则大幅降低。

  • 编辑会削弱水印。在一项针对 400 token 段落的评估中,将 10% 的词语替换为同义词使检测率从约 92% 降至 66%。替换 25% 的词语则使其降至 17%。

这些局限性促使我们决定仅向经过批准的研究人员和专家组织提供初始检测器访问权限,他们可以帮助我们评估可靠性和负责任的使用方式。

该图表展示了针对数学和心理学问题的带水印响应的结果,这些问题来自 ELI5 数据集⁠(在新窗口中打开),目标假阳性率为 1%。检测效果随文本长度增加而提升,但对于用词灵活性较低的内容(如数学),整体检测率显著更低。

编辑会大幅削弱水印信号。该图表展示了替换段落中 10% 或 25% 的词语如何影响检测。结果基于对来自 ELI5⁠(在新窗口中打开) 问题的带水印英文响应。

水印对输出质量的影响

在用于评估 Astra(我们最新的前沿模型)的各项基准测试中,我们未发现加水印与不加水印之间存在有意义的性能差异。

基准测试 无水印文本(Astra,max) 带水印文本(Astra,max)
Artificial Analysis Intelligence Index 49.57 分 49.76 分
AutomationBench 34.09% 34.86%
DeepSWE v1.1 72.80% 71.68%
Terminal-Bench 4.0 53.90% 56.06%
Terminal-Bench Science 0.1 56.90% 60.00%
BrowseComp 87.92% 87.35%
HealthBench Professional 64.27% 64.60%
GPQA Diamond 94.44% 93.94%

文本水印无法告诉你什么

文本水印只能提供关于我们的系统在段落中所起作用的有限信号。理解检测结果能得出和不能得出什么结论非常重要。

  • 水印不能衡量人类的贡献。 它可以表明 OpenAI 系统生成或处理了段落的某部分,但无法说明其中包含多少人类判断、编辑或创造力。

  • 水印不能确立所有权或责任。 它不能确定文本归谁所有、其使用是否合法、是否需要披露,或由谁负责。

  • 水印不能识别用户。 它不会将个人、组织、账户、提示词或对话与文本关联起来。

  • 水印不能验证准确性。 它不能告诉你段落是否真实、具有误导性、有害,或是否呈现于正确的语境中。

  • 未检测到水印并不能证明是人类创作。 使用 OpenAI 工具生成的文本可能因过短、经过编辑或翻译而无法可靠检测。它也可能来自不受支持的模型、早于水印功能推出,或由其他公司的工具生成。

我们的下一步

  • 在欧盟推出文本水印。 在未来几周内,我们将仅在欧盟面向所有套餐的符合条件的 ChatGPT 和 Codex 用户引入文本水印。我们不会在发布时将文本水印设为全球默认。这种区域性做法让我们有空间从实际使用和反馈中学习。

  • 为 API 客户启用可选水印。 从今天起,全球的 API 客户将能够为部分模型选择启用带水印的文本输出。这让客户可以决定水印如何契合其透明度义务以及他们为用户提供的体验。我们还在与云合作伙伴合作,在未来几周内为通过其服务访问的 OpenAI 模型输出提供水印。

  • 为研究人员和专家组织提供检测器访问权限。 经批准的研究人员和专家组织可从今天起申请。根据实践准则⁠(在新窗口中打开),访问权限最初将按个案授予,以支持文本来源的评估和改进。该工具将报告是否检测到 OpenAI 水印,而不会识别用户或披露其提示或对话。鉴于水印漏检和误报的风险,我们在发布时不会将其公开提供。

随着技术、标准和证据的发展,我们预计会重新审视这一方法的每个部分。

我们在内容来源方面的更广泛方法

没有任何单一来源技术本身足够,因此我们采用分层方法,结合开放标准、持久水印和验证工具。

我们为支持的图像输出添加 Content Credentials,符合 C2PA⁠(在新窗口中打开),在支持的图像和音频中嵌入不可见的 SynthID⁠(在新窗口中打开) 水印,并通过 openai.com/verify⁠ 和我们的 Content Provenance API⁠(在新窗口中打开) 提供图像和音频验证。这些技术相互补充:Content Credentials 可以记录文件的来源和历史,而不可见水印可以在元数据被移除时保留信号。

正如我们在选举保障工作中所述,来源信息可以帮助人们和平台评估可能具有误导性的 AI 生成内容,包括深度伪造。我们将这些信号与政策、滥用检测、报告、调查和执法相结合,并与研究人员、标准机构、平台和民间社会合作,使来源信息在更广泛的生态系统中发挥作用。

将来源信息扩展到文本需要考虑其被重写、翻译或编辑的容易程度。正如我们在六月所讨论的,我们的方法必须反映当前技术的实际局限。我们将继续改进检测,研究水印如何经受编辑和翻译,并探索更有意义地区分 AI 辅助与 AI 创作的方法。我们将随着证据、标准和监管要求的发展调整我们的方法,并在我们认为结果可以被负责任地解读时扩大检测器的访问权限。

如需了解更多信息,请访问我们的帮助中心文章⁠(在新窗口中打开)。

来源:OpenAI:官网动态 · openai.com