AirTag-Recherche verfolgt seltene Bücher bis zur Amazon-KI-Anlage, in der sie gescannt und vernichtet werden
Wichtige Erkenntnisse
- •404 Media nutzte ein verstecktes Ortungsgerät, um eine Sendung seltener Bücher bis zu Amazons VGT3-Anlage in Las Vegas zu verfolgen – die erste öffentliche Bestätigung, wo die mit dem KI-Training verbundenen Massenkäufe von Büchern landen.
- •Mitarbeiter der Anlage schneiden Bucheinbände ab, damit die Seiten schneller durch Scanner laufen, und zerstören so die physischen Bücher bei der Digitalisierung.
- •Vor 2022 gedruckte Bücher sind gefragt, weil ihr Text weitgehend nicht im Internet verfügbar und nicht maschinell erzeugt ist, was das in einer Nature-Studie von 2024 beschriebene Risiko eines „model collapse“ verringert.
- •Anthropics „Project Panama“ digitalisierte Millionen von Büchern durch zerstörerisches Scannen, und das Unternehmen stimmte einem Vergleich über 1,5 Milliarden Dollar wegen Raubdrucktiteln zu, während Salesforce mit einer damit zusammenhängenden Sammelklage konfrontiert ist.
- •Amazon erklärte, es kaufe Bücher über kommerzielle Kanäle, um seine Produkte zu entwickeln und zu verbessern, und brachte im Dezember 2024 seine Nova-Foundation-Modelle heraus, neben KI-Diensten, die über AWS verkauft werden.

KI-Unternehmen scannen Lkw-Ladungen von Büchern – manchmal seltene Exemplare – und zerstören sie dabei häufig, um ihre Modelle zu trainieren. Eine neue Untersuchung liefert erstmals ein öffentliches Bild davon, welche Unternehmen beteiligt sind und wie die Operation abläuft.
Das unabhängige Tech-Medium 404 Media platzierte ein Ortungsgerät in einer Sendung seltener Bücher und verfolgte seinen Weg zu einer Amazon-Anlage in Las Vegas, wo das Unternehmen gedruckte Bücher scannt und zerstört, um KI zu trainieren. Die am Montag veröffentlichte Untersuchung ist die erste, die öffentlich genau zeigt, wo Massenkäufe von Büchern für das KI-Training enden.
Die letzte Station der Sendung war Amazons VGT3-Team. Mitarbeitern zufolge besteht ihre Arbeit darin, riesige Sendungen gedruckter Bücher anzunehmen und anschließend die Einbände abzuschneiden, damit die Seiten schneller durch einen Scanner laufen. Das Buch selbst wird dabei zerstört. Das Logo des Teams – ein Dinosaurier, der ein Buch in seinen Klauen hält – wirkt ungewöhnlich passend.
Warum gedruckte Bücher plötzlich gefragt sind
Bücher, die vor 2022 gedruckt wurden, enthalten Text, der größtenteils nicht ohne Weiteres online verfügbar ist und – entscheidend – nicht maschinell geschrieben wurde. Ein Modell mit seiner eigenen Art von Ausgaben zu trainieren, riskiert ein „model collapse“, eine qualitätsmindernde Spirale, die Forscher in einer 2024 in Nature veröffentlichten Studie nachwiesen. Papier von vor 2022 ist daher zum sauberen Treibstoff des KI-Trainings geworden.
Amazon ist nicht das einzige Unternehmen. Es hat sich eine Kleinindustrie gebildet, die KI-Labore mit physischen Büchern beliefert, die zerlegt, gescannt und entsorgt werden – eine real gewordene „Fahrenheit 451“-Szenerie, in der Texte zerstört werden, um Maschinen zu füttern. Anthropics internes „Project Panama“ betrieb eine solche Operation bereits im großen Stil und digitalisierte Millionen von Büchern durch zerstörerisches Scannen. Die Methode markiert einen Bruch mit der vergangenen Ära der Massendigitalisierung: Google Books scannte in den 2000er- und 2010er-Jahren Millionen von Bibliotheksbänden, ohne sie zu verbrauchen – ausgeliehene Exemplare wanderten zurück ins Regal –, und ein US-Berufungsgericht entschied 2015, dass die Scans des Projekts Fair Use darstellten.
Der Wettlauf um sauberen Text ist bereits vor Gericht gelandet. Der US-Bezirksrichter William Alsup entschied, dass das Training von KI mit legal gekauften Büchern als Fair Use gelten kann – ein teilweiser Sieg für Anthropic, den auch Meta und OpenAI für sich beanspruchten. Bei Piratenkopien sieht die Sache anders aus: Anthropic einigte sich auf einen Vergleich in Höhe von 1,5 Milliarden Dollar wegen gescannter Raubdrucktitel, und Salesforce sieht sich nun mit einer Sammelklage wegen mutmaßlicher Buchpiraterie konfrontiert. Rechteinhaber wehren sich auch auf anderen Wegen: Penguin Random House, der größte Handelsverlag der Welt, ergänzte Ende 2024 die Copyright-Seiten seiner Bücher um eine Formulierung, die ihre Nutzung für das Training von KI-Systemen untersagt.
Die Amazon-Operation blieb aus einem strukturellen Grund unentdeckt. Buchhändler bemerkten im vergangenen Jahr einen Anstieg von Großbestellungen und vermuteten KI-Unternehmen dahinter – die Käufer reagierten nicht auf Preise und wählten Titel, die scheinbar zufällig zusammengestellt waren. Ihre Bedenken wurden schließlich durch einen Apple AirTag bestätigt, der in einer großen Buchbestellung versteckt war und das Ziel offenlegte: Amazons VGT3-Lager in Las Vegas.
Amazon bestätigte, dass die Operation zuvor nicht gemeldet worden war, und erklärte, das Unternehmen „purchases books through commercial channels to help develop and improve the products and services our customers use.“ Das Unternehmen baut zudem eigene KI-Produkte auf: Amazon brachte im Dezember 2024 seine Nova-Familie von Foundation-Modellen auf den Markt und verkauft KI-Dienste über AWS – Geschäfte, die in hohem Maß von Trainingsdaten abhängen.