大型人工智能(AI)产业正面临严峻的内容版权与商业模式争议。核心矛盾在于:AI 公司依赖吸收他人的原创工作——包括书籍、新闻报道、照片、代码及网络内容——来训练模型,却普遍拒绝支付费用、遵守许可证或向创作者分享收入。

近期,“先行动,后辩论合法性”的行业惯例受到越来越多质疑。以《纽约时报》起诉 OpenAI 和 Microsoft 的版权案为例,据“404 媒体”披露的法庭文件显示,原告方引用了 Microsoft 应用科学主任 Brent Hecht 在联合简报中的言论。Hecht 指出,此案涉及“前所未有的惊人盗窃”,并在记者律师的总结判决简报中被引述为可能是“人类历史上最大的劳动力盗窃”。
Microsoft 内部政策文件也被提交至法庭,其中承认生成式 AI 可能“显著扰乱那些提供基础模型训练数据的人的就业”。文件将大语言模型(LLM)描述为一种“破坏其供应链的产品”,这种破坏性反过来可能导致模型自身崩溃。讽刺的是,AI 正在削弱产出高质量内容的创作者的经济基础。
目前,美国纽约南部地区法院法官 Sidney H. Stein 尚未对此案作出裁决。OpenAI 和 Microsoft 以“合理使用”为由进行抗辩,主张使用公开文章和书籍训练 LLM 有助于推进公共知识,而非作为“非法经济市场替代品”。
然而,法庭文件揭示的事实表明,大型 AI 公司深知其对内容的依赖,且部分公司表现出对合规性的漠视。根据 OpenAI 公司代表的宣誓证词,该公司确认其 LLM 会抓取受付费墙保护的内容,且代表表示不知道如何在训练数据集中检测或移除这些内容。当联合创始人 Greg Brockman 被告知 OpenAI 可以突破防火墙时,他回应称:“很好。”
即便不考虑更广泛的态度,此类策略已对新闻市场、小说创作及图形艺术等领域造成冲击,影响了那些要求为原创作品获得报酬的行业。对于部分 AI 开发者而言,这并非副作用,而是商业模式的一部分。他们追求快速生成看似合理的答案,甚至不关心答案的正确性或信息来源的准确性。一位 OpenAI 软件工程师曾言:“无论我们如何突出地展示链接。”





