AI公司购买并销毁数百万本实体书以喂养聊天机器人训练数据
要点速览
- •AI公司正通过匿名中间商大规模采购实体书,将其扫描为训练数据后丢弃原件。
- •2023年前出版的书籍备受AI开发者青睐,因为它们仅包含人类撰写的文本,避免了AI生成内容的污染。
- •书商反映每周销量因AI买家从约20本书增至数百本,但有人担心 uncommon 书籍正被永久销毁。
- •联邦法官在《Bartz诉Anthropic PBC》一案中裁定,对合法购买的书籍进行破坏性扫描构成转化性合理使用。
- •法院在扫描已购书籍与使用盗版副本之间划出了法律界限,一项15亿美元的和解协议要求Anthropic向作品被盗版用于训练Claude的作者进行赔偿。

据404 Media率先发布的报道,人工智能公司正匿名大量采购实体书,在扫描内容用于AI模型训练后将其销毁。
书商表示,冷门和绝版书的需求大幅飙升,引发人们对稀有和 uncommon 书籍因这一做法而永久消失的担忧。
一名联邦法官裁定,对合法购买的书籍进行破坏性扫描可认定为合理使用,尽管针对AI开发者的其他版权诉讼仍在法院审理之中。
破坏性扫描的新兴产业
宛如经典反乌托邦小说《华氏451度》中的场景,一些AI公司不仅在阅读书籍——更在销毁书籍。随着开发者竞相构建更强大的AI模型,版权诉讼不断增多,一个专门为AI公司供应数百万本实体书的新兴产业应运而生。这些书籍被拆解、扫描录入训练数据集,随后被丢弃。
据报道,AI公司通过中间商以工业规模匿名采购书籍。专门从事批量采购的公司宣称能够找到数十万种书籍,同时承诺为AI客户保密,这反映出该做法的敏感性。
批评人士表示,这一采购热潮背后的驱动力是AI公司急于在人类撰写的知识被AI生成文本稀释之前加以保存——AI生成文本通常被称为"AI垃圾内容"。2023年生成式AI兴起之前出版的书籍被认为尤为珍贵,因为它们提供了完全由人类撰写的高质量训练数据。这一推动力反映了业界有时称之为"数据墙"的更广泛挑战——随着公开的互联网文本日益被AI生成的输出所充斥,开发者正转向线下经过验证的人类写作来源,以维持模型质量。
重塑二手书市场
需求的激增已在重塑二手书市场。一位不愿透露姓名的书商告诉404 Media,在AI买家进入市场后,其每周销量从约20本书攀升至数百本。虽然这一增长带来了可观的利润,但该书商表示担心 uncommon 和绝版书籍在被扫描和销毁后正永久消失。
"这在经济上对我有利,也能清理掉原本不太可能卖出的旧库存,"该书商告诉404 Media。"我在海外书籍和外语书籍方面的库存非常适合这类销售。但另一方面,我不喜欢这种最终用途,也不喜欢 uncommon 书籍被化成纸浆。"
对于印量有限或从未被数字化的书籍而言,实体副本的丧失尤为严重,这引发了AI公司是否有义务保存其所消费之物的疑问。
法律先例:破坏性扫描的合理使用
这一做法与Anthropic的"巴拿马计划"如出一辙,后者通过破坏性扫描将数百万本书籍数字化。
去年夏天,在版权诉讼《Bartz诉Anthropic PBC》一案中,旧金山的一名联邦法官裁定,将合法购买的实体书扫描为数字副本——即使原件被销毁——构成转化性合理使用。此后,联邦法官在涉及OpenAI和Meta的另一起版权案件中也作出了类似的合理使用裁决。
然而,在另一起案件中,同一辖区的一名联邦法官批准了一项15亿美元版权和解协议,要求Anthropic向数千名作者每人每本书支付约3,000美元,原因是该公司使用了其作品的盗版副本来训练Claude。截然不同的结果凸显了一条AI公司如今须谨慎应对的法律界限:购买并扫描实体书可能受到保护,但通过盗版获取相同内容则不然。
行业反弹与保存呼声
面对日益高涨的反对声浪,包括Elon Musk在内的AI开发者已公开反对这一做法,并呼吁企业保存被扫描的书籍。
"我已要求SpaceXAI团队将任何稀有书籍保存在图书馆中,并以费力的方式扫描,而不是直接裁掉书脊进行扫描,"Musk在X上写道。