微软高管内部备忘录曝光:AI 训练是"人类历史上最大的劳动力盗窃"
《纽约时报》三年前对 OpenAI 和微软提起的版权诉讼有了新进展。最新解封的未删减材料显示,微软一位高管曾私下将公司的 AI 训练实践形容为"盗窃",OpenAI 领导层则承认其模型对出版商和记者构成"生存威胁"。
据诉讼文件披露,这些公司涉嫌通过绕过付费墙获取内容、大规模扫描构建训练数据集,并刻意从训练数据中删除版权声明。需要注意的是,大部分新证据来自《纽约时报》方面提交的简报,相关引文脱离原始语境。

《纽约时报》最初的指控是,两家公司未经许可使用其内容训练生成式 AI 模型,构成版权侵权。AI 公司能否合法使用受版权保护的材料进行训练,目前并无明确答案,多数法官倾向于支持 AI 公司的主张,即训练构成"合理使用"。本月早些时候,特朗普政府还提交了一份法庭简报,为 OpenAI 在训练大语言模型时未经授权使用版权材料的做法进行辩护。
然而,文件中的一些新陈述与 OpenAI 的合理使用抗辩相抵触,尤其是合理使用要求使用行为不得替代或损害原始作品的市场这一要件。
微软自己的数据显示,其 Copilot"答案引擎"上线后,《纽约时报》域名的点击率相比传统 Bing 搜索下降了 93%。2024 年 1 月,微软应用科学总监 Brent Hecht 在一份内部演示文稿中将这一趋势称为"恶性循环",认为它会"同时损害我们的模型和整个网络的性能"。
"最终产品威胁其基础供应商的经济基础,这种情况极为罕见,但这正是我们为自己的 LLM 业务制造的处境,涉及其内容供应链,"微软的内部文件中写道。
在今年早些时候的证词中,微软首席执行官萨蒂亚·纳德拉(Satya Nadella)也表示:"任何设有付费墙的内容,任何想使用它的人都应获得授权……无论是用于知识接地还是训练。"他明确表示,如果早知道"OpenAI 在付费墙后收集内容并进行训练",他会"援引(微软的)权利要求 OpenAI 重新训练其模型"。
其他陈述同样与合理使用的不同判断标准相冲突。OpenAI ChatGPT 负责人 Nick Turley 在内部沟通中写道,出版商正面临来自聊天机器人等产品的"生存威胁"。OpenAI 总裁 Greg Brockman 则形容这些模型在新闻领域表现出色。纳德拉在早些时候的宣誓证词中承认,与聊天机器人对话已经取代了(传统新闻获取方式)。
这类表述表明,相关产品并非对原创内容进行转化性使用,而是直接与原创作品竞争。
一份微软文件还指出,生成式 AI 可能"严重扰乱创造基础模型训练数据的从业者的就业",构成"真实的风险"。
复制规模同样惊人。文件首次披露,仅 OpenAI 的 GPT-3 中期训练数据集就包含《纽约时报》、《纽约每日新闻》和调查报道中心(CIR)出版的超过 91,692 件作品。一个源自 Common Crawl 的数据集则包含 nytimes.com 的 200 多万篇文档。
2023 年 1 月的一份内部备忘录中,Hecht 将这一切称为"前所未有的、令人震惊的盗窃",是"人类历史上最大的劳动力盗窃"。
文件还详述了 OpenAI 和微软获取原告内容的具体方式。
在商业层面,OpenAI 向微软提供了完整的 GPT-3 训练数据集,微软据此评估如何在自己的商业产品中部署 OpenAI 的模型。微软也通过 Project Taxi 和 Project Gutenberg("古腾堡计划")向 OpenAI 提供训练数据。
据称,两家公司将"古腾堡计划"的数据汇入一个训练数据集,其中包含来自新闻出版商的至少 160,903 件独立作品。
文件显示,为了最大化抓取收益,OpenAI 员工曾设计绕过付费墙的方案。当 OpenAI 研究员告知 Brockman 有黑客找到绕过《纽约时报》付费墙的方法时,Brockman 回复称:"很好。"
据称,OpenAI 员工还构建了 WebText 和 WebText2 等训练数据集,这些数据集对抓取所得新闻内容的依赖程度远超正常比例,并从 Common Crawl 中提取了数百万篇文章。文件还描述称,训练数据在进入模型前被有意删除版权声明,原因是研究人员不希望模型向用户输出版权声明。
"这些首次公开的证据表明,OpenAI 和微软明知自己的行为是错误的,"《纽约每日新闻》代理律师 Steven Lieberman 在发给 TechCrunch 的声明中表示。
截至发稿,OpenAI 和微软均未回应置评请求。





