AktualnościAkcjePracownicy Microsoftu pytali, czy scraping AI to „największa kradzież pracy w historii ludzkości”

Pracownicy Microsoftu pytali, czy scraping AI to „największa kradzież pracy w historii ludzkości”

Autor: Decrypt·

Najważniejsze informacje

  • Ujawnione akta z pozwu o naruszenie praw autorskich z 2023 roku pokazują, że pracownicy Microsoftu prywatnie porównywali wykorzystanie artykułów przez OpenAI do bezprecedensowej kradzieży pracy ludzkiej i ostrzegali, że trenowanie na materiałach generowanych przez AI może stopniowo degradować jakość modeli.
  • Dyrektor generalny Microsoftu Satya Nadella zeznał, że treści chronione paywallem powinny być licencjonowane, i powiedział, że gdyby wiedział, iż OpenAI korzysta z takich materiałów, wykorzystałby prawo Microsoftu do zmuszenia jej do ponownego wytrenowania modeli.
  • Wewnętrzna korespondencja OpenAI obejmuje opis stworzenia obejścia paywalla Timesa przez pracownika, na który prezes Greg Brockman odpowiedział pozytywnie.
  • Wewnętrzne ustalenia OpenAI, w tym spostrzeżenie inżyniera, że użytkownicy rzadko klikają cytowane linki, podważają argument firm, że chatboty kierują ruch z powrotem do wydawców.
  • Obaj pozwani utrzymują, że trenowanie na artykułach prasowych stanowizwolony użytek, podczas gdy sędzia Sidney Stein rozpatruje wnioski o summary judgment w sprawie wytoczonej przez Timesa pod koniec 2023 roku, do której dołączyło jedenastu innych wydawców.
Pracownicy Microsoftu pytali, czy scraping AI to „największa kradzież pracy w historii ludzkości”

Pracownicy Microsoftu dyskutowali, czy wykorzystanie artykułów prasowych przez OpenAI stanowi „największą kradzież pracy w historii ludzkości” i może uruchomić „pętlę zagłady” degradującą właśnie te modele, które budują — wynika z akt sądowych ujawnionych w czwartek, o których poinformował New York Times.

Akta pochodzą z pozwu o naruszenie praw autorskich, który Times wytoczył przeciwko OpenAI i Microsoftowi pod koniec 2023 roku, a do którego później dołączyło jedenastu innych wydawców. OpenAI konsekwentnie kwestionuje zarzuty, a postępowanie już zmusiło firmę do zachowania 20 milionów dzienników rozmów ChatGPT. Sędzia Sidney Stein z Dystryktu Południowego Nowego Jorku rozpatruje wnioski o wydanie wyroku w trybie summary judgment, a dokumenty są ujawniane w miarę ich rozpatrywania. Summary judgment pozwala sędziemu rozstrzygnąć sprawę bez rozprawy, gdy nie istnieje rzeczywisty spór co do istotnych faktów — dlatego ujawniona dokumentacja, w tym wewnętrzna korespondencja obu firm, ma znaczenie na tym etapie postępowania.

Wewnętrzne dokumenty Microsoftu z 2023 roku przewidywały falę krytyki. „Miliony ludzi na całym świecie będą wkrótce uważać fakt, że duże modele »odkurzają« całą ich pracę, za zdumiewającą kradzież o bezprecedensowych rozmiarach” — napisał jeden z memos. Ten sam autor napisał, że duże modele AI „są produktem, który niszczy swój łańcuch dostaw”. Uwaga ta wskazywała na pętlę sprzężenia zwrotnego, w której modele mocno trenowane na materiałach generowanych przez AI będą stopniowo degradować własne wyniki — czyli na „pętlę zagłady”, o której mówili pracownicy.

Microsoft oświadczył, że memos napisał Brent Hecht, dyrektor ds. applied science, który zatrudniony był również na Northwestern University, i że nie odzwierciedlają one stanowiska firmy. W piśmie procesowym spółka podała, że Hecht nie był decydentem i był zatrudniony, aby „przedstawiać odmienne i asymetryczne perspektywy”.

„Zostawianie bałaganu na dywanie”

Dyrektor generalny Microsoftu Satya Nadella zeznał, że „wszystko, co jest objęte paywallem, powinno być licencjonowane przez każdego, kto chce tego używać”, i doda, że gdyby wiedział, iż OpenAI trenuje na treściach chronionych paywallem, wykorzystałby prawo Microsoftu do zmuszenia jej do ponownego wytrenowania modeli. Rzecznik firmy stwierdził, że Nadella „mówił o ogólnych zasadach” dotyczących tego, jak ludzie znajdują i konsumują informacje.

W OpenAI pracownik powiedział prezesowi Gregowi Brockmanowi o stworzeniu „hacka” omijającego paywall Timesa. Brockman odpowiedział: „ah nice”.

Nick Turley, który kierował zespołem ChatGPT, napisał w czerwcu 2023 roku, że AI stanowi „egzystencjalne zagrożenie” dla wydawców. W lutym 2024 roku napisał, że produkty AI „będą coraz bardziej substytucyjne w miarę poprawy”, a gdzie indziej zauważył, że produkty AI „są w dużej mierze substytucyjne, kropka”.

Inżynier OpenAI stwierdził w lutym 2023 roku, że „niezależnie od tego, jak wyeksponujemy linki, użytkownicy nie klikają” — odkrycie, które przemawia przeciwko argumentowi, że chatboty kierują ruch z powrotem do wydawców, od lat będącego źródłem czytelników i przychodów dla organizacji prasowych.

W memosie z 2020 roku do Brockmana i dyrektora generalnego Sama Altmana ówczesny dyrektor ds. polityki Jack Clark ostrzegł, że firma „tworzy systemy zastępujące pracę ludzi definiujących »kulturę« społeczeństwa” i że „staną się symbolem tego, jak Dolina Krzemowa bezrefleksyjnie wkracza w inne obszary życia, zostawiając bałagan na dywanie”. Clark odszedł później, aby współzałożyć Anthropic, który przekazał prośbę Timesa o komentarz do OpenAIn
Zarówno Microsoft, jak i OpenAI argumentują, że trenowanie na artykułach prasowych stanowi dozwolony użytek (fair use), przekształcając materiały w nowe dzieła, a nie zastępując oryginały. Fair use pozwala na ograniczone korzystanie z materiałów chronionych prawem autorskim bez licencji, a kwestia, czy trenowanie na dużą skalę na opublikowanej publicystyce się w nim mieści, jest centralnym zagadnieniem prawnym, które sprawy będzie testować.

„Świat może zobaczyć, co OpenAI i Microsoft od zawsze myślały o uczciwości własnego postępowania” — powiedział Steven Lieberman, adwokat reprezentujący New York Daily News i siedem innych gazet w sprawie.

Times, sam będący powodem, odmówił komentarza własnym reporterom, którzy poinformowali, że OpenAI nie odpowiedziało na prośby o komentarz. Przy zawieszonych wnioskach o summary judgment kolejnymi punktami w sprawie będą orzeczenie sędziego Steina oraz to, co jeszcze przyniesie proces ujawniania dokumentów.