新闻宏观经济德里高等法院驳回 ANI 针对 OpenAI 的版权禁令申请

德里高等法院驳回 ANI 针对 OpenAI 的版权禁令申请

作者: The Decoder·

要点速览

  • 法院驳回了 ANI 的临时救济请求,但并未终结其针对 OpenAI 的基础诉讼。
  • ANI 未能证明 ChatGPT 逐字复制了其文章,即便其使用了要求精确复制的提示。
  • Amit Bansal 法官初步认为,如果材料合法取得并仅在内部处理,AI 训练可能落入印度私人使用研究例外。
  • 法院将有关检索增强生成以及相关输出是否构成向公众传播的问题留待主诉讼程序处理。
  • 该裁定出台之际,国际上关于 AI 训练和输出是否侵犯版权或符合相关法律例外的裁决仍不一致。
德里高等法院驳回 ANI 针对 OpenAI 的版权禁令申请

德里高等法院驳回了印度新闻机构 Asian News International(ANI)针对 OpenAI 提出的临时禁令申请。该版权争议涉及 AI 训练和 ChatGPT 输出。

ANI 是印度最大的新闻机构之一。该机构起诉 OpenAI,指控其在模型训练以及 ChatGPT 生成的回复中涉嫌使用受版权保护的新闻材料。在一项临时裁定中,法官 Amit Bansal 驳回了 ANI 在两项主张上的救济请求,并讨论了模型记忆、检索增强生成(Retrieval Augmented Generation,RAG)以及使用受版权保护作品训练 AI 系统的法律地位等问题。该裁定并未终结诉讼;它只是确立了法院的初步观点,并将若干问题留待主诉讼程序处理。

AI 版权法专家 Andres Guadamuz 将该裁定称为 OpenAI 的一项重要早期胜利。他的分析可见于 发布。

ANI 的证据未能证明逐字复制

ANI 向法院提交了数份 ChatGPT 输出,并称这些输出构成对其文章的实质性复制。OpenAI 回应称,涉案模型 GPT-4 和 GPT-4o 分别使用截至 2022 年 4 月和 2024 年 4 月的数据集进行训练。ANI 作为证据所依赖的大多数文章发表于 2024 年 8 月和 9 月,这意味着它们不可能被包含在这些训练数据集中。

Bansal 法官的初步观点是,输出中的相似之处似乎源于检索增强生成。这种方法允许语言模型以类似搜索引擎的方式实时检索当前在线信息。由于 ANI 在其诉状中未讨论 RAG,法院未就该问题作出最终裁定。法官表示,基于 RAG 的输出可能构成“向公众传播”,这一问题将留待主诉讼程序处理。

法院还指出,ANI 使用了对抗性提示,明确指示模型“exactly”复制文章。即便使用了这些提示,ANI 也未能提供任何一份逐字复制文本。法官认为,新闻文章中包含的事实通常不受版权保护,而在本案中,复制主题和标题并不构成与 ANI 的直接竞争。

证据也不支持 ANI 关于 OpenAI 在其模型中永久存储训练数据、并可按需逐字再现该机构作品的主张。法院表示,这一问题将在主诉讼程序中再次审查。

法院初步支持将 AI 训练视为私人使用

ANI 在临时阶段也未能证明 OpenAI 为 AI 训练复制其材料构成版权侵权。双方均承认 OpenAI 在训练过程中使用了 ANI 内容。OpenAI 辩称,这些材料仅占整体数据集的极小部分,模型提取的是非表达性元素,包括语法、句法和语言模式。

法官审查了印度版权法下的例外规定,并援引了一项涵盖“私人或个人使用,包括研究”的条款。在当前阶段,他对“研究”作出了足够宽泛的解读,将 AI 训练纳入其中。

法院对这一做法设定了限制。训练副本必须来自合法来源,而不能来自影子图书馆,或未经许可访问的付费墙网站。法官还指出,OpenAI 并未公开训练副本,而是仅在内部处理。Guadamuz 表示,这是法院首次明确认定 AI 训练落入私人使用例外范围。

法院适用了三部分公平性测试,并在三项问题上均支持 OpenAI。法院称,OpenAI 对 ANI 作品的使用仅限于训练,因为没有证据证明存在记忆或复制。ANI 也未能证明经济损害,部分原因是两家公司处于不同领域。根据裁定,即使用户向 ChatGPT 询问 ANI 的标题,模型也只会返回主题,最多返回少数文章标题。

Bansal 法官引用了 Bartz v. Anthropic 和 Kadrey v. Meta 等美国案件,在这些案件中,语言模型输出被视为具有转换性。他还提到了此前的 Google Books 裁决。

法院进一步认为,经过训练的语言模型可以改善信息获取,支持教育,推进科学研究,协助软件开发,支持翻译,并为残障人士创建工具。

全球 AI 版权裁决仍存在分歧

德里法院的裁定加入了越来越多的国际裁决之列,而这些裁决在 AI 与版权问题上得出了不同结论。在美国,一名法官驳回了 Raw Story 和 AlterNet 针对 OpenAI 提起的诉讼,原因是原告无法证明足够的损害,且出现精确复制的可能性较低。该法院还认定,事实不受版权保护。

GitHub Copilot 案也未获成功,原告未能指出任何一例完全相同代码。相比之下,The Intercept 通过一项 DMCA 主张取得了部分胜利,该主张涉及训练前被剥离的受版权保护材料。

在 Ross Intelligence v. Thomson Reuters 案中,法院驳回了合理使用抗辩,因为该 AI 研究工具直接与 Thomson Reuters 的法律数据库 Westlaw 竞争,使该使用不具转换性。法院强调,该裁定仅适用于这一非生成式使用场景,不能扩展到大型语言模型。

在 Anthropic 案中,旧金山一家联邦法院将使用受版权保护作品进行 AI 训练描述为“spectacularly”具有转换性,这是支持合理使用的强烈信号。不过,法院也作出了“Napster comparison”,因为 Anthropic 使用了来自影子图书馆的盗版书籍作为训练数据。合理使用不涵盖非法获取的材料。Anthropic 后来因使用这些盗版副本向图书作者支付了 15 亿美元。

美国版权局驳回了 AI 行业的论点,即基于“vast troves of copyrighted works”进行训练通常符合合理使用。撰写该报告的官员在报告发布后不久被 Trump 政府解雇。

欧洲法院在这一问题上也存在分歧。慕尼黑地区法院在 GEMA 案中裁定,歌词可在模型权重中被再现,因此该模型构成与版权相关的复制。伦敦高等法院驳回了 Getty Images v. Stability AI 诉讼,裁定 AI 模型不是“infringing copy”。显示语言模型可以记忆受版权保护书籍的研究,可能会进一步加剧围绕记忆问题的争论。

在这些案件中,若干核心问题仍未解决:AI 模型是否永久存储训练数据;训练是否可以构成合理使用或类似例外;合法获取数据与非法获取数据之间的界线在哪里;以及通过对抗性提示生成的输出是否反映普通使用。德里裁定的重要性在于,它在一项命令中处理了其中若干问题,但由于其仍处于临时阶段,后续证据仍可能影响法院对训练、检索和输出责任的处理方式。

媒体面临版权之外的问题

这场争议也凸显了媒体行业面临的更广泛担忧。即使法院认定 AI 训练合法,AI 驱动的搜索产品仍可能影响新闻市场。Pew Research Center 最近的一项研究发现,当 Google 的 AI Overviews 出现时,外部网站的点击率降至 8%,而在没有 AI 摘要的情况下为 15%。用户往往在收到 AI 回复后停止搜索,并且通常不会查阅其他来源。

对于 ANI 这样的新闻机构而言,能够总结新闻并减少访问原始来源必要性的 AI 系统,可能会随着时间推移削弱行业商业模式,即使没有直接版权侵权的认定也是如此。

慕尼黑第一地区法院最近还裁定,Google 对其 AI 摘要中的虚假陈述承担直接责任,因为这些摘要被视为独立内容,而非搜索结果。根据该裁定,传统上保护搜索引擎运营商的有限责任并不适用于 AI 生成的摘要。

这一推理也可能适用于 ChatGPT 基于 RAG 的回复。当 AI 系统总结新闻并作出独立主张时,其运营方可能被视为媒体提供者,并承担相应责任。这种转变也可能影响合理使用分析,其中一个因素是新产品是否与其训练所依据的作品竞争。如果 AI 摘要取代了访问新闻网站的需要,法院可能更难认定这种使用不具有竞争性。