AirTag 调查追踪珍稀书籍去向:亚马逊 AI 设施中书籍被扫描后销毁
要点速览
- •404 Media 利用隐藏的追踪装置,将一批珍稀书籍追踪至位于拉斯维加斯的亚马逊 VGT3 设施,这是对 AI 相关大宗图书采购最终去向的首次公开证实。
- •该设施的工作人员切掉书脊装订,以便书页更快送入扫描仪,在数字化过程中销毁了实体书籍。
- •2022 年之前印刷的书籍备受追捧,因为其文本大多未出现在互联网上且非机器生成,降低了 2024 年《自然》论文中所述的“模型崩溃”风险。
- •Anthropic 的“巴拿马计划”通过破坏性扫描将数百万本书籍数字化,该公司已就盗版书籍达成 15 亿美元的和解,而 Salesforce 正面临一起相关集体诉讼。
- •亚马逊表示其通过商业渠道购买书籍以开发和改进产品,并于 2024 年 12 月发布了 Nova 基础模型,同时通过 AWS 销售 AI 服务。

AI 公司正在整卡车整卡车地扫描书籍——其中有时包括珍稀书籍——并经常在此过程中将其销毁,以训练自己的模型。一项新的调查首次公开揭示了有哪些公司参与其中,以及这一运作是如何进行的。
独立科技媒体 404 Media 将一个追踪装置放入一批珍稀书籍中,并跟踪货物运往位于拉斯维加斯的一处亚马逊设施,该公司在那里扫描并销毁印刷书籍以训练 AI。这项于周一发布的调查首次公开指明了与 AI 训练相关的大宗图书采购最终流向何处。
这批货物的最终目的地是亚马逊的 VGT3 团队。员工告诉该媒体,他们的工作就是接收大批量印刷书籍,然后切掉书脊装订,使书页能更快地送入扫描仪。书籍本身在此过程中被销毁。该团队的标志——一只用爪子紧抓着一本书的恐龙——显得格外贴切。
为何印刷书籍突然变得抢手
2022 年之前印刷的书籍所载文本大多无法轻易在网上获取,而且——关键在于——并非机器撰写。用模型自身生成的同类输出来训练模型,会带来“模型崩溃”的风险,这种质量逐轮下降的恶性循环已在研究人员 2024 年发表于《自然》的一篇论文中得到证实。因此,2022 年之前的纸质书已成为 AI 训练的清洁燃料。
亚马逊并非孤例。一个为 AI 实验室供应实体书籍的小型产业已经形成,这些书籍被拆解、扫描后丢弃——宛如现实版的《华氏 451 度》场景,文本被销毁以喂养机器。Anthropic 内部的“巴拿马计划”早已大规模开展此类运作,通过破坏性扫描将数百万本书籍数字化。这种方法标志着与上一轮大规模数字化时代的分野:Google 图书在 2000 年代和 2010 年代扫描了数百万册图书馆藏书,但并未消耗它们——借来的副本仍回到书架上——且美国一家上诉法院于 2015 年裁定该项目的扫描属于合理使用。
对清洁文本的争夺已诉诸法庭。美国地区法官 William Alsup 裁定,在合法购买的书籍上训练 AI 可构成合理使用,这是 Anthropic 的一次部分胜利,Meta 和 OpenAI 也提出了同样的主张。盗版书则是另一回事:Anthropic 就扫描盗版书籍达成了 15 亿美元的和解,而Salesforce 目前正面临一起集体诉讼,理由是涉嫌图书盗版。版权方也在以其他方式反击:全球最大的大众图书出版商企鹅兰登书屋于 2024 年底在其书籍的版权页中加入了禁止将书籍用于训练 AI 系统的条款。
亚马逊的这项运作之所以一直不为人知,有其结构性原因。过去一年,书商们注意到大宗订单激增,并怀疑背后是 AI 公司——买家对价格不敏感,选书看似完全随机。他们的担忧最终由一枚藏在一笔大宗图书订单中的 Apple AirTag 得到证实,它揭示了目的地:位于拉斯维加斯的亚马逊 VGT3 仓库。
亚马逊证实这一运作此前从未被报道,并表示其“通过商业渠道购买书籍,以帮助开发和改进我们的客户所使用的产品和服务”。该公司也在打造自己的 AI 产品:亚马逊于 2024 年 12 月发布了 Nova 系列基础模型,并通过 AWS 销售 AI 服务,这些业务都依赖大规模的训练数据。