2026-09-19 00:42 1010 次浏览

微软内部文件自曝:AI训练被指"史上最大规模劳动窃取"

解封法庭文件显示,微软高管布伦特·赫克特曾将大模型训练形容为"人类历史上最大规模的劳动窃取",并警告AI答案引擎正引发内容生态的"末日循环",与微软OpenAI公开主张的合理使用立场形成强烈反差。

内部言论与公开立场现裂痕

生成式人工智能训练数据的合法性争议,因一批法庭文件的解封再度被推至风口浪尖。在《纽约时报》等新闻出版机构诉微软与OpenAI的版权案中,微软应用科学总监布伦特·赫克特的一段内部讨论记录被公开。他在谈及大语言模型利用互联网海量内容进行训练时,使用了"前所未有规模的惊人窃取"的措辞,并进一步将其定性为可能是"人类历史上最大规模的劳动窃取"。

这一表述迅速在技术圈与法律界引发震荡。微软与OpenAI在公开场合一贯主张,模型训练类似于学生阅读书籍后学习知识,属于合理使用范畴,且生成内容对原始材料已进行足够转换,不构成直接复制。然而解封文件中的内部交流,却呈现出与这套辩护逻辑截然不同的认知。

"嘲弄合理使用"与模型复现能力

文件披露,赫克特曾提出,若想在诉讼中取胜,相关企业或许需要"彻底嘲弄合理使用这一概念"。原告方将此视为关键证据,用以质疑AI企业长期坚持的版权辩护基础。与此同时,部分OpenAI内部讨论记录也被公开。其中显示,联合创始人格雷格·布罗克曼曾承认,当模型接触《纽约时报》内容时,ChatGPT确实能够预测并续写相关文章中的句子。原告据此主张,模型具备重现原始作品的能力,而非仅进行抽象学习。

这些材料让"合理使用"这一法律支点面临更严苛的审视。技术层面,大模型对训练语料的记忆与泛化边界本就模糊,内部承认的续写能力,可能被解读为对原始表达的实际复制,从而削弱转换性使用的抗辩力度。

流量断崖与"末日循环"预警

赫克特的担忧并不止于版权。他在另一份内部演示文档中提出"末日循环"概念:AI答案引擎正逐步减少用户访问新闻网站的需求,导致媒体流量下降、商业收入萎缩。当越来越多内容生产机构失去生存能力,未来可供AI系统学习的优质信息也将枯竭,最终反噬模型自身与整个互联网生态。

原告方引用的微软内部数据显示,Copilot等AI答案系统对部分新闻网站流量造成显著冲击。在部分案例中,用户点击进入《纽约时报》页面的比例相较传统搜索结果下降超过90%。赫克特在文件中指出,一个产品会威胁其关键供应者的经济基础,这种现象极为罕见,而AI行业目前正处在这种状况之中。新闻机构与内容创作者是模型的重要信息来源,当这些群体遭受冲击,整个内容供应链都将面临风险。

行业困境与监管变量

训练数据的合法性并非微软与OpenAI独有难题。OpenAI此前曾公开表示,在完全不接触受版权保护内容的情况下训练先进AI系统几乎不可能。Meta前高管尼克·克莱格也作出类似表态,认为若严格按传统版权规则执行,当前许多AI系统将难以维持发展。与此同时,微软、Meta等多家科技企业持续因训练数据问题面临质疑,部分企业被指利用用户内容、代码库、文章、图片及其他网络资源训练模型,而创作者往往未获明确授权或补偿。

随着诉讼推进,更多内部文件正在被公开。这些材料不仅关乎微软与OpenAI的诉讼结果,也可能影响全球范围内关于AI训练、知识产权保护以及内容生产者权益分配的监管走向。案件仍在审理中,但围绕训练合法性的法律争议,正在成为决定未来AI产业发展规则的重要变量。