Indagine con AirTag riconduce libri rari a uno stabilimento Amazon per l'IA, dove vengono scansionati e distrutti
Punti chiave
- •404 Media ha utilizzato un dispositivo di tracciamento nascosto per rintracciare una spedizione di libri rari fino allo stabilimento VGT3 di Amazon a Las Vegas, la prima conferma pubblica di dove finiscano gli acquisti di libri all'ingrosso legati all'IA.
- •Gli operai dello stabilimento tagliano le rilegature dei libri affinché le pagine alimentino più rapidamente gli scanner, distruggendo i libri fisici durante la digitalizzazione.
- •I libri stampati prima del 2022 sono richiesti perché il loro testo è in gran parte assente da internet e non è generato da macchine, riducendo il rischio di "model collapse" descritto in un articolo del 2024 pubblicato su Nature.
- •Il "Project Panama" di Anthropic ha digitalizzato milioni di libri tramite scansione distruttiva e l'azienda ha accettato un accordo da 1,5 miliardi di dollari riguardo ai titoli piratati, mentre Salesforce affronta una class action correlata.
- •Amazon ha dichiarato di acquistare libri attraverso canali commerciali per sviluppare e migliorare i propri prodotti e ha lanciato la propria famiglia di modelli di base Nova a dicembre 2024, insieme ai servizi di IA venduti attraverso AWS.

Le aziende di intelligenza artificiale stanno scansionando camion interi di libri—a volte volumi rari—e spesso li distruggono nel processo per addestrare i propri modelli. Una nuova indagine offre la prima immagine pubblica di quali aziende siano coinvolte e di come funzioni l'operazione.
La testata tecnologica indipendente 404 Media ha inserito un dispositivo di tracciamento all'interno di una spedizione di libri rari e ne ha seguito il viaggio fino a uno stabilimento Amazon a Las Vegas, dove l'azienda scansiona e distrugge libri stampati per addestrare l'IA. L'indagine, pubblicata lunedì, è la prima a individuare pubblicamente dove finiscano gli acquisti di libri all'ingrosso legati all'addestramento dell'IA.
La tappa finale della spedizione è stato il team VGT3 di Amazon. I dipendenti hanno raccontato alla testata che il loro lavoro consiste nel ricevere spedizioni massive di libri stampati e poi tagliare le rilegature affinché le pagine alimentino più rapidamente uno scanner. Il libro stesso viene distrutto nel processo. Il logo del team—un dinosauro che stringe un libro tra gli artigli—risulta insolitamente azzeccato.
Perché i libri stampati sono improvvisamente richiesti
I libri stampati prima del 2022 contengono testi in gran parte non facilmente disponibili online e, cosa cruciale, non scritti da macchine. Addestrare un modello sul proprio stesso tipo di output rischia il "model collapse" (collasso del modello), una spirale di degrado della qualità che i ricercatori hanno dimostrato in un articolo del 2024 pubblicato su Nature. La carta antecedente al 2022 è quindi diventata carburante pulito per l'addestramento dell'IA.
Amazon non è l'unica. Si è formata un'industria di nicchia che fornisce ai laboratori di IA libri fisici da smontare, scansionare e buttare—una scena reale di "Fahrenheit 451", con testi distrutti per alimentare le macchine. Il "Project Panama" interno di Anthropic ha già condotto un'operazione del genere su larga scala, digitalizzando milioni di libri attraverso scansioni distruttive. Il metodo segna una rottura rispetto alla precedente era della digitalizzazione di massa: Google Books ha scansionato milioni di volumi di biblioteche negli anni 2000 e 2010 senza consumarli—le copie prese in prestito tornavano sugli scaffali—e una corte d'appello statunitense ha stabilito nel 2015 che le scansioni del progetto rientravano nel fair use.
La corsa al testo pulito è già approdata in tribunale. Il giudice federale statunitense William Alsup ha stabilito che l'addestramento dell'IA su libri acquistati legalmente può qualificarsi come fair use, una vittoria parziale per Anthropic che anche Meta e OpenAI hanno vantato. Le copie piratate sono un'altra questione: Anthropic ha accettato un accordo da 1,5 miliardi di dollari riguardo ai titoli piratati scansionati, e Salesforce ora affronta una class action per presunta pirateria di libri. Anche i titolari dei diritti si stanno opponendo in altri modi: Penguin Random House, il più grande editore commerciale al mondo, alla fine del 2024 ha aggiunto alle pagine del copyright dei propri libri una clausola che ne vieta l'uso per l'addestramento di sistemi di IA.
L'operazione di Amazon è rimasta silenziosa per un motivo strutturale. I librai hanno notato un picco di ordini all'ingrosso nell'ultimo anno e hanno sospettato che dietro ci fossero le aziende di IA—gli acquirenti non erano sensibili al prezzo e sceglievano titoli apparentemente a caso. Le loro preoccupazioni sono state infine confermate da un Apple AirTag nascosto in un grosso ordine di libri, che ha rivelato la destinazione: il magazzino VGT3 di Amazon a Las Vegas.
Amazon ha confermato che l'operazione non era stata riportata in precedenza e ha dichiarato: "purchases books through commercial channels to help develop and improve the products and services our customers use". L'azienda sta anche costruendo prodotti di IA propri: Amazon ha lanciato la propria famiglia di modelli di base Nova a dicembre 2024 e vende servizi di IA attraverso AWS, attività che dipendono dai dati di addestramento su larga scala.