纽约时报诉OpenAI与微软案新解封文件:微软高管称AI抓取是"人类历史上规模最大的劳动力盗窃"

Hacker News 热门(buzzing.cc 中文翻译)·2026-09-18 19:15·5小时前·pluc
AI 导读

纽约时报诉OpenAI与微软版权案的新解封文件显示,微软应用科学总监 Brent Hecht 在2024年1月内部备忘录中称AI数据抓取是“人类历史上规模最大的劳动力盗窃”,OpenAI 的 Nick Turley 称其产品对出版商构成“生存威胁”。

Hacker News 热门(buzzing.cc 中文翻译)
同事件
77AI 编辑部评分,满分 100

纽约时报诉OpenAI与微软案新解封文件:微软高管称AI抓取是"人类历史上规模最大的劳动力盗窃"

2026-09-18 19:15· 5小时前· pluc
AI 导读

纽约时报诉OpenAI与微软版权案的新解封文件显示,微软应用科学总监 Brent Hecht 在2024年1月内部备忘录中称AI数据抓取是“人类历史上规模最大的劳动力盗窃”,OpenAI 的 Nick Turley 称其产品对出版商构成“生存威胁”。

正文 · AI 翻译

未删节的新信息在《纽约时报》提起的版权诉讼三年前针对 OpenAI 和 Microsoft 提起的这起诉讼,揭示了一项承认:AI 抓取数据无异于盗窃,且 AI 产品对出版物构成重大威胁。

根据诉讼内容,微软一位高管私下将两家公司的 AI 训练做法描述为“盗窃”,而 OpenAI 自己的领导层则表示,其 AI 模型对那些作品被用于训练的出版商和记者构成了“生存威胁”。

解封的材料还详细说明了这些公司据称是如何在未被察觉的情况下绕过付费墙获取并使用这些内容、通过大规模抓取构建训练数据集,以及故意从训练数据中删除版权声明的。

值得注意的是,其中许多新信息来自《泰晤士报》自己的案情摘要,而非仍处于封存状态的原始证据材料。以下引述均脱离了其原始语境呈现。

这份未经涂黑处理的法庭文件,是这起已持续三年的诉讼的最新升级。在该案中,《纽约时报》最初指控这些公司通过使用其内容训练生成式 AI 模型,违反了版权法。

AI 公司能否合法使用受版权保护的材料来训练 AI,这个问题尚无明确答案,但法官们在很大程度上倾向于支持 AI 公司的论点,即训练构成“合理使用”。这一法律规则允许人们在某些情况下未经许可使用受版权保护的作品,例如戏仿、新闻报道或批评。本月早些时候,特朗普政府提交了一份意见书,为 OpenAI 未经许可使用受版权保护材料训练其大语言模型进行辩护。

然而,其中几项新披露的内容与 OpenAI 的合理使用抗辩相矛盾,尤其是该规则要求使用不得替代或损害原作品的市场。

例如,微软自己的数据显示,其 Copilot“答案引擎”导致《纽约时报》域名的点击率相比传统 Bing 搜索下降了多达 93%。微软应用科学总监 Brent Hecht 于 2024 年 1 月撰写的一份微软内部演示文稿将这一下降描述为“末日循环”,称其将“同时损害我们模型的性能和整个网络”。

“一个终端产品威胁到其关键供应商的经济根基,这是极不寻常的,但这正是我们为自家大语言模型业务在其‘内容供应链’方面所创造的局面,”该微软文件写道,上述内容在诉状中被引用。

微软 CEO Satya Nadella 今年早些时候也在一次证词陈述中表示,“任何付费墙后的内容,都应获得任何想要使用它的人的授权……用于 grounding 或训练”,并明确表示,如果他“得知 OpenAI 抓取并训练了付费墙后的信息”,他会“行使[微软的权利]要求 OpenAI 重新训练其模型。”

其他承认则不利于合理使用测试的不同支柱:OpenAI 的 ChatGPT 负责人 Nick Turley 在内部沟通中写道,出版商面临来自聊天机器人等产品的“生存威胁”,这些产品“在很大程度上具有替代性”,并且“随着它们变得更好,将越来越具有替代性”。

OpenAI 总裁 Greg Brockman 将这些模型描述为“非常擅长新闻”。Nadella 今年早些时候在宣誓后同意,与聊天机器人对话“已经替代了……在 AI 平台上直接把信息给你,而不是需要前往底层来源”。

这类措辞说明,这项技术可能如何直接与原始作品竞争,而不是改造它。

一份微软文件指出,生成式 AI 存在“真实风险”,可能“严重扰乱那些生成了基础模型训练所用数据的人们的就业”。

抄袭的规模之大令人震惊。这些文件首次披露,仅 OpenAI 的中期训练数据集就包含超过 91,692 份由 NYT、Daily News 和 Center for Investigative Reporting 出版的作品副本。一个源自 Common Crawl 的数据集仅来自 nytimes.com 的文档就超过 200 万份。

在 2023 年 1 月的一份内部备忘录中,Hecht 称其为“一次规模空前的惊人盗窃”,以及“人类历史上最大的劳动成果盗窃”。

该文件以新的细节阐述了 OpenAI 和 Microsoft 是如何获取原告内容的,包括从 Bing Index 中抓取。

“OpenAI 将整个 GPT-3 训练数据集交付给了 Microsoft,Microsoft 用其评估如何将 OpenAI 的模型部署到自己的商业产品中,”文件中写道。“Microsoft 同样通过名为 Project Taxi 和 Project Mango 的计划向 OpenAI 提供了训练数据。”

据称,这些公司把 Project Mango 的数据汇编成了一个训练数据集,其中包含至少 160,903 份来自这些新闻出版商的独特作品副本。

为了最大限度地利用其抓取成果,OpenAI 员工据称想出了一个在不被发现的情况下绕过付费墙的计划。文件显示,当 OpenAI 研究员 Nick Ryder 向 Brockman 提到一个“绕过 nytimes 付费墙的黑客手段”时,Brockman 回复道:“啊,不错。”

据称,OpenAI 员工还构建了 WebText 和 WebText2 等训练数据集,这些数据集过度依赖抓取的新闻内容。他们还据称从 Common Crawl 这一免费的开放网络抓取数据存储库中提取了数百万篇文章。调查结果还描述了在训练数据进入模型之前,故意从中删除版权声明的行为,因为研究人员“不希望模型向用户输出”“版权声明”。

“这里首次揭示的证据表明,OpenAI 和 Microsoft 知道他们的所作所为是错误的,”《纽约每日新闻》的律师 Steven Lieberman 在向 TechCrunch 分享的一份声明中表示。

OpenAI 和 Microsoft 未回应置评请求。