AktualnościAkcjeŚledztwo z użyciem AirTaga wykazało, że rzadkie książki trafiają do obiektu AI Amazona, gdzie są skanowane i niszczone

Śledztwo z użyciem AirTaga wykazało, że rzadkie książki trafiają do obiektu AI Amazona, gdzie są skanowane i niszczone

Autor: Decrypt·

Najważniejsze informacje

  • •404 Media wykorzystało ukryte urządzenie śledzące, aby prześledzić przesyłkę rzadkich książek do obiektu VGT3 Amazona w Las Vegas — pierwsze publiczne potwierdzenie, dokąd trafiają masowe zakupy książek związane z AI.
  • •Pracownicy obiektu odcinają oprawy książek, aby strony szybciej trafiały do skanerów, niszcząc fizyczne egzemplarze podczas digitalizacji.
  • •Książki wydane przed 2022 rokiem są poszukiwane, ponieważ ich teksty w dużej mierze nie występują w internecie i nie zostały wygenerowane maszynowo, co ogranicza ryzyko „kolapsu modelu” opisanego w artykule z 2024 roku w czasopiśmie Nature.
  • •„Projekt Panama” firmy Anthropic zdigitalizował miliony książek za pomocą skanowania destrukcyjnego, a firma zgodziła się na ugodę w wysokości 1,5 miliarda dolarów w sprawie pirackich tytułów, podczas gdy Salesforce stawia czoła związanemu z tym pozwowi zbiorowemu.
  • •Amazon oświadczył, że kupuje książki przez kanały handlowe w celu rozwoju i ulepszania swoich produktów, a w grudniu 2024 roku uruchomił modele fundamentowe Nova wraz z usługami AI sprzedawanymi przez AWS.
Śledztwo z użyciem AirTaga wykazało, że rzadkie książki trafiają do obiektu AI Amazona, gdzie są skanowane i niszczone

Firmy zajmujące się sztuczną inteligencją skanują całe ciężarówki książek — czasem rzadkich — i często niszczą je w tym procesie, aby trenować swoje modele. Nowe śledztwo po raz pierwszy publicznie pokazuje, które firmy są w to zaangażowane i jak działa ta operacja.

Niezależne medium technologiczne 404 Media umieściło urządzenie śledzące w przesyłce rzadkich książek i obserwowało, jak trafia ona do obiektu Amazona w Las Vegas, gdzie firma skanuje i niszczy drukowane książki w celu trenowania AI. Śledztwo, opublikowane w poniedziałek, jako pierwsze publicznie wskazuje, dokąd trafiają masowe zakupy książek związane z treningiem AI.

Ostatnim przystankiem przesyłki był zespół VGT3 Amazona. Pracownicy powiedzieli redakcji, że ich praca polega na przyjmowaniu ogromnych dostaw drukowanych książek, a następnie odcinaniu opraw, aby strony szybciej trafiały do skanera. Sama książka zostaje w tym procesie zniszczona. Logo zespołu — dinozaur ściskający książkę w szponach — robi wyjątkowo trafne wrażenie.

Dlaczego drukowane książki nagle stały się poszukiwane

Książki wydane przed 2022 rokiem zawierają teksty, które w większości nie są łatwo dostępne w internecie i — co kluczowe — nie zostały napisane przez maszynę. Trenowanie modelu na jego własnych wynikach grozi „kolapsem modelu”, spiralą spadku jakości, którą badacze zademonstrowali w artykule z 2024 roku opublikowanym w czasopiśmie Nature. Papier sprzed 2022 roku stał się więc czystym paliwem dla treningu AI.

Amazon nie jest wyjątkiem. Powstała cała niszowa branża dostarczająca laboratoriom AI fizyczne książki, które są rozbierane, skanowane i wyrzucane — scena rodem z „451 stopni Fahrenheita”, gdzie teksty niszczy się, by nakarmić maszyny. Wewnętrzny „Projekt Panama” firmy Anthropic prowadził już taką operację na dużą skalę, digitalizując miliony książek za pomocą skanowania destrukcyjnego. Metoda ta stanowi zerwanie z poprzednią erą masowej digitalizacji: Google Books zeskanowało w latach 2000. i 2010. miliony tomów bibliotecznych bez ich zużywania — wypożyczone egzemplarze wracały na półki — a amerykański sąd apelacyjny orzekł w 2015 roku, że skany projektu stanowią dozwolony użytek (fair use).

Wyścig o czysty tekst trafił już do sądu. Sędzia okręgowy USA William Alsup orzekł, że trenowanie AI na legalnie zakupionych książkach może stanowić dozwolony użytek — częściowe zwycięstwo Anthropic, do którego przyznawały się również Meta i OpenAI. Pirackie kopie to inna sprawa: Anthropic zgodziła się na ugodę w wysokości 1,5 miliarda dolarów w sprawie skanowanych pirackich tytułów, a Salesforce stawia obecnie czoła pozewowi zbiorowemu dotyczącemu domniemanego piractwa książkowego. Posiadacze praw odpowiadają też w inny sposób: Penguin Random House, największe wydawnictwo handlowe na świecie, pod koniec 2024 roku dodało na stronach z informacją o prawach autorskich swoich książek zapis zakazujący ich używania do trenowania systemów AI.

Operacja Amazona przez długi czas pozostawała nieznana z powodów strukturalnych. Księgarze zauważyli w ciągu ostatniego roku wzrost zamówień hurtowych i podejrzewali, że stoją za nimi firmy AI — kupujący nie byli wrażliwi na cenę i wybierali tytuły pozornie losowo. Ich obawy ostatecznie potwierdził ukryty w dużej dostawie książek Apple AirTag, który ujawnił miejsce docelowe: magazyn VGT3 Amazona w Las Vegas.

Amazon potwierdził, że operacja nie była wcześniej zgłaszana, i oświadczył, że „kupuje książki poprzez kanały handlowe, aby pomagać w rozwijaniu i ulepszaniu produktów i usług, z których korzystają nasi klienci”. Firma rozwija również własne produkty AI: Amazon uruchomił rodzinę modeli fundamentowych Nova w grudniu 2024 roku i sprzedaje usługi AI przez AWS — biznesy zależne od danych treningowych na dużą skalę.