版权战火再燃:纽约时报指OpenAI明知威胁仍复制数百万文章
纽约时报最新诉讼文件指控OpenAI在明知AI产品对出版商构成生存威胁的情况下,仍复制数百万篇受版权保护文章以训练模型,并寻求数十亿美元赔偿。文件披露了布罗克曼、赫克特及纳德拉的相关言论与内部通信。
诉讼文件披露内部通信:OpenAI被指明知故犯
一场围绕AI训练数据版权的法律对决正在升级。纽约时报向法庭提交的最新文件显示,OpenAI在意识到自身技术可能对出版商造成“生存威胁”的前提下,依然大量复制受版权保护的文章,用以构建商业价值巨大的AI系统。
纽约时报与多家媒体机构正联合向OpenAI及共同被告微软寻求数十亿美元赔偿。案件的核心争议在于,两家公司是否未经授权利用出版商内容训练AI模型,从而违反版权法。
代表纽约时报的律师指出,OpenAI的行为受商业利益驱动。文件援引OpenAI联合创始人格雷格·布罗克曼在2026年前后的一段文字,称其“被天文数字般的财富深深驱动”,并希望通过技术商业化实现这一目标。
合理使用之争:转换还是替代?
面对指控,OpenAI坚持其长期立场:依据版权法,使用公开内容训练模型属于“合理使用”,理由与搜索引擎索引网页类似。该公司强调,大语言模型对原始内容进行的是转换性使用,而非简单复制,也不会替代纽约时报等出版物。
但纽约时报律师反驳称,被告“反复完整复制数百万篇受版权保护的文章”,目的是开发具有替代性的商业AI产品。文件进一步指出,OpenAI内部清楚其工具可能取代原始材料。
诉讼引用了ChatGPT负责人的一段内部记录,其中将AI产品描述为对出版商构成“生存威胁”,并称这些产品“在很大程度上具有替代性,而且随着它们变得更好,替代性会越来越强”。
微软应用科学总监布伦特·赫克特的观点也被列为证据。据称他曾写道,用受版权保护的内容训练大语言模型是“一场规模空前的惊人盗窃”,若此案胜诉将“彻底嘲弄‘合理使用’这一理念”。微软随后回应称,这些言论仅代表员工个人观点,并非法律分析。
付费墙与点击率:争议中的具体数据
诉讼文件还指控OpenAI采用“越界且具有欺骗性”的手段获取付费墙后的内容。文件称,现任OpenAI总裁、实际二号人物布罗克曼当时已知悉该做法。当一名员工告知他“有办法绕过纽约时报付费墙”时,布罗克曼回复:“啊,不错。”
另一项引发关注的发现来自微软自身数据:与传统搜索引擎相比,使用其AI回答工具的用户对原始内容的点击率下降了83%至93%。这一数字直观展示了AI摘要功能对内容生产者流量的冲击。
微软CEO萨蒂亚·纳德拉在为此案提供的证词中表示,如果当时“得知OpenAI抓取并利用付费墙后的信息进行训练”,他会依据双方协议行使权利,要求OpenAI“重新训练其模型”。微软对此解释称,纳德拉的证词讨论的是广泛原则及信息获取方式的变化,并非对版权问题的结论。
OpenAI未立即回应置评请求。该公司此前曾表示:“本案不是人类创作与AI之争,而是纽约时报想以牺牲惠及所有人的进步为代价,谋求一笔不该得的横财。”
行业影响:AI与内容生态的博弈进入深水区
这起诉讼是版权持有人针对AI公司提起的数十起案件中备受瞩目的一例。随着生成式AI能力快速迭代,模型训练对高质量语料的依赖与日俱增,而传统媒体则面临流量与收入的双重压力。
案件走向可能重新定义“合理使用”在AI时代的边界。若法院支持出版商主张,AI公司或将被迫调整数据获取策略,甚至重构部分训练流程;若AI公司胜诉,则可能进一步巩固其利用公开内容训练模型的合法性。无论结果如何,内容创作者、技术平台与法律体系之间的博弈已进入深水区。