AI公司購買並銷毀數百萬本實體書籍 以餵養聊天機器人訓練數據
重點速覽
- •AI公司利用匿名中間商大量收購實體書籍,掃描作為訓練數據後丟棄原件。
- •2023年以前的書籍尤其受AI開發商青睞,因為其中僅包含人類撰寫的文本,可避免AI生成內容的污染。
- •書商表示,由於AI買家的湧入,每週銷量從約20本書增至數百本,但部分人士擔心不常見的書籍正在永久消失。
- •聯邦法官在Bartz v. Anthropic PBC案中裁定,對合法購買的書籍進行破壞性掃描構成轉化性合理使用。
- •法院在掃描已購書籍與使用盜版副本之間劃出了法律界線,一項15億美元的和解協議要求Anthropic補償被盜版作品用於訓練Claude的作者。

據404 Media率先發布的報導,人工智慧公司正匿名大量收購實體書籍,在掃描內容供AI模型訓練後將其銷毀。
書商表示,冷門及絕版書籍的需求大幅飆升,引發了稀有及不常見書籍因該做法而永久消失的擔憂。
聯邦法官裁定,對合法購買的書籍進行破壞性掃描可構成合理使用,即便針對AI開發商的其他版權訴訟仍在法院審理中。
破壞性掃描的新興產業
宛如經典反烏托邦小說《華氏451度》中的場景,部分AI公司不僅在閱讀書籍——更在銷毀它們。隨著開發商競相打造更強大的AI模型,版權訴訟不斷增加,一個新興產業應運而生,為開發商供應數百萬本實體書籍,這些書籍被拆解、掃描成訓練數據集後遭到丟棄。
據報導,AI公司利用中間商以工業規模匿名收購書籍。專門從事大宗採購的公司宣稱能夠找到數十萬種書籍,同時承諾為AI客戶保密,反映出此做法的敏感性。
批評人士指出,這股收購潮的推動力來自AI公司急於在人類創作的知識被AI生成文本稀釋之前加以保存——這類文本通常被稱為「AI垃圾」。2023年生成式AI興起之前出版的書籍被視為尤其珍貴,因為它們提供了完全由人類撰寫的高品質訓練數據。這一趨勢反映了業界一個被稱為「數據牆」的更廣泛挑戰——隨著公開的網路文本日益被AI生成的內容飽和,開發商轉向離線的、經過驗證的人類寫作來源,以維持模型品質。
重塑二手書市場
需求的激增已在重塑二手書市場。一位不具名的書商告訴404 Media,自從AI買家進入市場後,每週銷量從大約20本書攀升至數百本。儘管業績增長帶來了利潤,該書商仍對不常見及絕版書籍在掃描和銷毀後永久流失表達了擔憂。
「這在財務上對我有利,同時也清理了原本不太可能賣出的舊庫存,」該書商告訴404 Media。「海外進貨和外語書籍的庫存讓我非常適合這些銷售。但另一方面,我不喜歡這種最終用途,我也不喜歡不常見的書籍就這樣被化作紙漿。」
對於印刷量有限或從未數位化的書籍而言,實體副本的流失尤為嚴重,這引發了AI公司是否有義務保存其所消耗文物的疑問。
法律先例:破壞性掃描的合理使用
此做法與Anthropic的「巴拿馬計畫」如出一轍,後者透過破壞性掃描將數百萬本書籍數位化。
去年夏天,在版權訴訟Bartz v. Anthropic PBC中,舊金山的一名聯邦法官裁定,將合法購買的實體書籍掃描為數位副本——即使原件被銷毀——構成轉化性合理使用。聯邦法官隨後在涉及OpenAI和Meta的另起版權案件中作出了類似的合理使用裁決。
然而,在另一起案件中,同一轄區的聯邦法官批准了一項15億美元的版權和解協議,要求Anthropic向數千名作者每人每本書支付約3,000美元,此前該公司使用盜版副本訓練Claude。這些截然不同的結果凸顯了AI公司如今必須審慎應對的法律界線:購買並掃描實體書籍可能受到保護,但透過盜版獲取相同內容則不然。
業界反彈與保存呼聲
面對日益高漲的反彈聲浪,包括Elon Musk在內的AI開發商公開反對此做法,並敦促各公司保存正在掃描的書籍。
「我已要求SpaceXAI團隊將任何稀有書籍保存在圖書館中,並以費力的方式掃描,而不是直接切斷書脊進行掃描,」Musk在X上寫道。