微软员工曾探讨AI抓取是否为“人类历史上最大规模的劳动窃取”
要点速览
- •时报2023年版权诉讼案解封文件显示,微软员工私下将OpenAI使用新闻文章比作前所未有的人类劳动窃取,并警告用AI生成材料训练可能逐步降低模型质量。
- •微软CEO萨提亚·纳德拉作证称付费墙内容应获得授权,并表示若知道OpenAI使用付费墙材料,本可行使微软权利强制其重新训练模型。
- •OpenAI内部通信包括一名员工描述构建绕过时报付费墙的变通工具,总裁格雷格·布罗克曼对此作出积极回应。
- •OpenAI内部发现——包括一名工程师观察到用户很少点击引用链接——削弱了聊天机器人能为出版商回引流量的论点。
- •两家被告均坚持使用新闻文章训练属合理使用,西德尼·斯坦法官正在审议简易判决动议;该案由时报于2023年底提起,另有十一家出版商加入。

据周四解封并由《纽约时报》报道的法庭文件,微软员工曾讨论OpenAI使用新闻文章是否构成“人类历史上最大规模的劳动窃取”,以及这是否可能引发“末日循环”,导致他们正在构建的模型退化。
这些文件源自时报于2023年底对OpenAI和微软提起的版权诉讼,此后另有十一家出版商加入该案。OpenAI一贯对这些指控提出异议,且诉讼已迫使该公司保存2000万条ChatGPT对话记录。纽约南区法官西德尼·斯坦正在审议简易判决动议,并在此过程中陆续解封相关文件。简易判决允许法官在不存在重大事实真正争议时无需开庭即解决案件,这也是解封记录——包括两家公司的内部通信——在诉讼现阶段具有重要分量的原因。
微软2023年的内部文件已预见到舆论反弹。一份备忘录写道:“全世界数百万人很快会将大型模型‘吸干’他们所有工作视为一次规模空前、令人震惊的窃取。”同一位作者还写道,大型AI模型“是一种摧毁自身供应链的产品。”这一说法指向一种反馈循环:大量使用AI生成材料训练的模型会逐步降低自身输出质量——即员工所说的“末日循环”。
微软表示,这些备忘录由应用科学总监布伦特·赫克特撰写,他同时在西北大学任职,这些内容不代表公司观点。微软在一份法庭文件中称,赫克特并非决策者,受聘是为了“提出不同且非对称的观点”。
“在地毯上留下一团糟”
微软CEO萨提亚·纳德拉作证称,“任何处于付费墙内的内容都应被任何想使用它的人授权使用”,并补充说,如果当时知道OpenAI在使用付费墙内容训练,他会行使微软的权利强制其重新训练模型。一位公司发言人表示,纳德拉是就人们如何查找和消费信息的“宽泛原则”发言。
在OpenAI内部,一名员工向总裁格雷格·布罗克曼汇报构建了一个绕过时报付费墙的“黑客手段”。布罗克曼回复:“啊,不错。”
曾负责ChatGPT团队的尼克·特利在2023年6月写道,AI对出版商构成“生存威胁”。2024年2月,他写道AI产品“随着进步将越来越具有替代性”,并在别处写道AI“在很大程度上就是替代性的,仅此而已。”
一名OpenAI工程师在2023年2月观察到,“无论我们把链接展示得多显眼,用户都不会点击”——这一发现削弱了聊天机器人能为出版商回引流量的论点,而读者流量长期以来一直是新闻机构的重要读者和收入来源。
2020年,时任政策总监杰克·克拉克在致布罗克曼和CEO山姆·奥特曼的备忘录中警告称,公司正在“创造替代那些定义社会‘文化’的人群劳动的系统”,并将“成为硅谷如何轻率地闯入生活其他领域并在地毯上留下一团糟的象征。”克拉克后来离职联合创立了Anthropic,后者将时报的置评请求转交给了OpenAI。
微软和OpenAI均辩称,使用新闻文章训练属于合理使用,是将材料转化为新作品,而非替代原作。合理使用允许在未获授权的情况下有限使用受版权保护的材料,而对已发表新闻的大规模训练是否符合这一标准,正是本案将检验的核心法律问题。
“全世界都能看到OpenAI和微软一直以来对自己行为的公正性是如何看待的,”代表《纽约每日新闻》及其他七家报纸的律师史蒂文·利伯曼说。
时报本身是本案原告,但拒绝向自家记者置评;记者称OpenAI未回应置评请求。随着简易判决动议仍在审理中,本案的下一个节点是斯坦法官的裁定,以及解封程序还将披露的其他内容。