Une enquête à l'aide d'un AirTag remonte jusqu'à une installation d'IA d'Amazon où des livres rares sont numérisés puis détruits
Points clés
- •404 Media a utilisé un dispositif de suivi caché pour remonter une expédition de livres rares jusqu'à l'installation VGT3 d'Amazon à Las Vegas, première confirmation publique de l'aboutissement des achats de livres en gros liés à l'IA.
- •Les employés de cette installation coupent les reliures des livres pour que les pages alimentent plus rapidement les scanners, détruisant ainsi les livres physiques lors de la numérisation.
- •Les livres imprimés avant 2022 sont recherchés car leur texte est largement absent d'internet et n'est pas généré par des machines, ce qui réduit le risque de « model collapse » (effondrement des modèles) décrit dans une étude de 2024 publiée dans Nature.
- •Le « Project Panama » d'Anthropic a numérisé des millions de livres par balayage destructif, et l'entreprise a accepté un règlement de 1,5 milliard de dollars concernant des titres piratés, tandis que Salesforce fait face à une action collective liée.
- •Amazon a déclaré acheter des livres par des canaux commerciaux pour développer et améliorer ses produits, et a lancé ses modèles de fondation Nova en décembre 2024, aux côtés de services d'IA vendus via AWS.

Des entreprises d'IA numérisent des camions entiers de livres — parfois rares — et les détruisent souvent au passage pour entraîner leurs modèles. Une nouvelle enquête offre pour la première fois une vision publique des entreprises concernées et du fonctionnement de cette opération.
Le média tech indépendant 404 Media a placé un dispositif de suivi dans un lot de livres rares et a suivi son trajet jusqu'à une installation d'Amazon à Las Vegas, où l'entreprise numérise et détruit des livres imprimés pour entraîner l'IA. L'enquête, publiée lundi, est la première à identifier publiquement où aboutissent les achats de livres en gros liés à l'entraînement de l'IA.
La dernière étape de l'expédition était l'équipe VGT3 d'Amazon. Les employés ont indiqué au média que leur travail consiste à recevoir d'énormes quantités de livres imprimés, puis à couper les reliures pour que les pages alimentent plus rapidement un scanner. Le livre lui-même est détruit au cours du processus. Le logo de l'équipe — un dinosaure serrant un livre dans ses serres — sonne d'une justesse inhabituelle.
Pourquoi les livres imprimés sont soudainement recherchés
Les livres imprimés avant 2022 contiennent un texte qui, pour l'essentiel, n'est pas facilement disponible en ligne et qui, surtout, n'est pas écrit par des machines. Entraîner un modèle sur ses propres productions risque de provoquer le « model collapse » (effondrement du modèle), une spirale de dégradation de la qualité que des chercheurs ont démontrée dans une étude publiée en 2024 dans Nature. Le papier d'avant 2022 est ainsi devenu un carburant propre pour l'entraînement de l'IA.
Amazon n'est pas la seule. Une industrie de niche s'est formée pour fournir aux laboratoires d'IA des livres physiques qui sont dépecés, numérisés puis jetés — une scène de « Fahrenheit 451 » bien réelle, où des textes sont détruits pour nourrir des machines. Le « Project Panama » interne d'Anthropic a déjà mené une telle opération à grande échelle, numérisant des millions de livres par balayage destructif. Cette méthode marque une rupture avec la précédente ère de numérisation de masse : Google Books a numérisé des millions de volumes de bibliothèques dans les années 2000 et 2010 sans les consommer — les exemplaires empruntés retournaient sur les étagères — et une cour d'appel américaine a jugé en 2015 que les numérisations du projet relevaient du fair use (usage raisonnable).
La course au texte « propre » a déjà abouti devant les tribunaux. Le juge fédéral américain William Alsup a statué que l'entraînement de l'IA sur des livres achetés légalement peut constituer un fair use (usage raisonnable), une victoire partielle pour Anthropic que Meta et OpenAI ont également revendiquée. Les copies piratées sont une autre affaire : Anthropic a accepté un règlement de 1,5 milliard de dollars concernant des titres piratés numérisés, et Salesforce fait désormais face à une action collective pour piratage présumé de livres. Les titulaires de droits ripostent aussi autrement : Penguin Random House, le plus grand éditeur généraliste du monde, a ajouté fin 2024, sur les pages de copyright de ses livres, une mention interdisant leur utilisation pour entraîner des systèmes d'IA.
L'opération d'Amazon est restée discrète pour une raison structurelle. Les libraires ont constaté une hausse des commandes en gros au cours de l'année écoulée et ont soupçonné des entreprises d'IA d'en être à l'origine — les acheteurs n'étaient pas sensibles aux prix et choisissaient des titres apparemment au hasard. Leurs inquiétudes ont finalement été confirmées par un Apple AirTag caché dans une importante commande de livres, qui a révélé la destination : l'entrepôt VGT3 d'Amazon à Las Vegas.
Amazon a confirmé que cette opération n'avait jamais été signalée auparavant et a déclaré « acheter des livres par des canaux commerciaux afin de contribuer au développement et à l'amélioration des produits et services utilisés par nos clients ». L'entreprise développe par ailleurs ses propres produits d'IA : Amazon a lancé sa famille de modèles de fondation Nova en décembre 2024 et vend des services d'IA via AWS, des activités qui dépendent de données d'entraînement à grande échelle.