《纽约时报》诉OpenAI与微软版权案新解封文件披露内部称AI抓取为盗窃、绕过付费墙及大规模复制新闻作品等承认
事件全貌
AI 综述《纽约时报》三年前对OpenAI和微软提起的版权诉讼中,新解封的未删节文件披露了内部承认:AI抓取等同于盗窃,AI产品对出版机构构成重大威胁。文件显示,微软一位高管私下将两家公司的AI训练做法描述为“盗窃”,OpenAI领导层则称其AI模型对训练所用作品的出版商和记者构成“生存威胁”。
文件详细描述了被指控的内容获取方式:绕过付费墙而不被发现、通过大规模抓取构建训练数据集,并故意从训练数据中剥离版权声明。规模方面,文件首次披露OpenAI仅中期训练数据集就包含超过91,692份来自《纽约时报》、Daily News和调查报道中心的作品副本;一个源自Common Crawl的数据集仅nytimes.com就包含超过200万份文档。微软应用科学总监Brent Hecht在2023年1月的内部备忘录中称其为“前所未有的惊人盗窃”和“人类历史上最大的劳动盗窃”。
文件还引用了微软自身数据:Copilot“答案引擎”导致《纽约时报》域名的点击率较传统Bing搜索下降多达93%。Hecht在2024年1月的内部演示中将这一下降描述为“末日循环”。微软CEO纳德拉今年在证词中表示,任何付费墙后的内容都应获得许可,并称若早知OpenAI抓取并训练了付费墙后的信息,他会要求OpenAI重新训练模型。OpenAI的ChatGPT负责人Nick Turley在内部通信中写道,出版商面临来自聊天机器人等产品的“生存威胁”,这些产品“在很大程度上具有替代性”。OpenAI总裁Greg Brockman称模型“擅长新闻”。
新闻机构的动议指控微软违反“行业规范”,将因Bing购买的数据集作为OpenAI训练数据出售,且未咨询新闻机构;并指控OpenAI从受不得用于商业目的协议约束的第三方获取含180万篇文章的《纽约时报》数据集,OpenAI员工知道用该数据训练模型“不合适”但仍这样做。动议还称,若法院不明确AI公司必须许可新闻内容,出版商和AI公司都可能陷入困境。
Ars Technica报道称,新闻机构不满微软和OpenAI在内部人士警告抓取新闻是盗窃后,从未选择许可内容,而是以他们无法预料的方式在另一个市场取代了他们。
AI 汇总报道生成 · 3小时前更新。单篇报道保留其发布时的原貌。
最新情况详见事件全貌。
报道时间线
沿着报道,了解事件的不同侧面。
- 《纽约时报》诉讼文件指控 OpenAI 明知出版商受威胁仍大量复制版权文章
《纽约时报》周四提交的诉讼文件指控 OpenAI 在明知 AI 产品对出版商构成生存威胁的情况下,未经许可完整复制数百万篇受版权保护的文章训练模型,并绕过付费墙获取内容。该案寻求数十亿美元赔偿,文件引用微软内部数据显示 AI 回答工具使用户对原始内容的点击率下降 83% 至 93%,OpenAI 则辩称训练属于合理使用,OpenAI 与微软均对相关言论作出回应或否认。
- 微软高管曾称 AI 抓取是"人类历史上最大规模的劳动窃取",新闻集团据此推进诉讼主张
新闻集团在诉讼动议中指责 Microsoft 将为 Bing 购买的数据集转售给 OpenAI 作训练数据,且 OpenAI 从受商业限制协议约束的第三方获取含 180 万篇文章的 NYT 数据集并用于训练。原告方引用微软内部文件承认生成式 AI 对训练数据生产者就业存在"真实风险",并主张法院若认定抓取新闻不属于合理使用,可打破各 AI 公司竞相免费搭车的"囚徒困境"。
- 纽约时报诉 OpenAI 与微软案解封文件披露 AI 抓取被称为史上最大劳动窃取
纽约时报诉 OpenAI 与微软版权案的新解封文件披露,微软高管 Brent Hecht 在内部备忘录中称 AI 抓取是“人类历史上最大规模的劳动窃取”,OpenAI 高管 Nick Turley 则称聊天机器人对出版商构成“生存威胁”。
本事件热度走势
移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。