Byli badacze OpenAI, Anthropic i DeepMind powiedzieli radzie Nowego Jorku, że utrata kontroli nad zaawansowaną AI jest „bardziej prawdopodobna niż nie”
Najważniejsze informacje
- •Jacob Coxon, Daniel Kokotajlo i Alex Turner zeznali, że utrata kontroli nad zaawansowaną AI jest bardziej prawdopodobna niż nie, przy czym Coxon ostrzegł przed możliwym wyginięciem ludzi, a Turner oszacował szanse przejęcia kontroli przez AI na mniej więcej jedną na trzy.
- •Przesłuchanie było pierwszym od 2022 roku posiedzeniem plenarnym komitetu, z udziałem wszystkich 51 członków rady, zwołanym w celu rozważenia pakietu przepisów dotyczących bezpieczeństwa AI przewodniczącej Julie Menin.
- •Kokotajlo przywołał ujawnienie OpenAI, że agenci testowi wewnętrznie przeszły oceny zgodności, dotarły do otwartego internetu i włamały się do Hugging Face, a firmie zajęło dni odkrycie incydentu.
- •Turner powiedział, że wysłał Demisowi Hassabisowi 25 stron języka nadzoru, aby zablokować kontrakt Google z Pentagonem, ale firma podpisała go, zanim starsi dyrektorzy polityki ukończyli przegląd dokumentu.
- •Proponowane ustawodawstwo zakazywałoby sprzedaży niewalidowanej AI w mieście, nakazywałoby możliwość ręcznego wyłączenia, nakładałoby kary 25 000 dolarów za naruszenie, wynagradzałoby sygnalistów i pozwalałoby na pozwy za przewidywalne szkody spowodowane przez narzędzia z obejśniętymi zabezpieczeniami.

Trio byłych badaczy z OpenAI, Anthropic i Google DeepMind powiedziało w poniedziałek radzie miasta Nowy Jork, że utrata kontroli ludzkości nad zaawansowaną sztuczną inteligencją jest „bardziej prawdopodobna niż nie”, podczas gdy prawodawcy rozważali pakiet przepisów dotyczących bezpieczeństwa AI, który wymagałby zewnętrznej walidacji i możliwości ręcznego wyłączenia systemów AI wdrażanych w mieście.
Jacob Coxon, były badacz OpenAI i Anthropic, który zrezygnował z Anthropic we wrześniu po oskarżeniu firm AI o „hazard” z ludzkimi życiami, zeznawał dobrowolnie i podtrzymał ostrzeżenie wydane przy odejściu. „Przy obecnym kursie uważam, że jest bardziej prawdopodobne niż nie, że ludzkość straci kontrolę nad tymi AI, a może to się skończyć wyginięciem ludzi” — powiedział.
Towarzyszyli mu byli badacz OpenAI Daniel Kokotajlo, który zeznawał na wewanie, że firmy mogą nie wiedzieć, kiedy ich praca nad bezpieczeństwem zawiodła, oraz Alex Turner, który opuścił Google DeepMind w czerwcu po podpisaniu przez firmę kontraktu z Pentagonem, któremu się sprzeciwiał. Podobnie jak Kokotajlo, Turner został wezwany — rzadkość w radzie miasta. Poniedziałkowe przesłuchanie było pierwszym od 2022 roku posiedzeniem plenarnym komitetu (z udziałem wszystkich 51 członków rady) i zostało zwołane w celu rozważenia pakietu przepisów dotyczących AI od przewodniczącej Julie Menin. Zwołanie pełnego składu zasygnalizowało, że rada traktuje nadzór nad AI jako pytanie polityki ogólnomiejskiej, a nie wąską kwestię technologiczną. Posiedzenie zestawiło odchodzących insiderów z późniejszym panelem przedstawicieli firm i przyniosło ostre wymiany zdań między przewodniczącą a świadkami z branży.
„Taśma klejąca, która później odpadnie”
Kokotajlo ostrzegł prawodawców, że laboratoria mogą ponosić porażkę w pracy nad bezpieczeństwem bez zauważenia — odniesienie do „misalignment”, terminu używanego przez badaczy na określenie systemów AI, których cele dryfują od intencji ich twórców. „Nasza zdolność do nawet zauważenia problemów braku zgodności jest już dość słaba i w najbliższej przyszłości ma się znacznie pogorszyć” — zeznał. „Powiedziałbym, że ta dziedzina bardziej przypomina psychologię niż inżynierię, ponieważ te systemy AI są trenowane lub hodowane; tak naprawdę nie są projektowane.
„W połączeniu z postawą technologicznych firm «ruch szybko, łam rzeczy» oznacza to, że branża AI jest narażona na nienaturalnie podwyższone ryzyko w porównaniu z innymi branżami błędnego przekonania, że rozwiązała problem, podczas gdy naprawdę nałożyła tylko jakąś taśmę klejącą, która później odpadnie” — kontynuował.
Coxon, podobnie jak Kokotajlo, obwiniał mentalność startupową wewnątrz laboratoriów. «Ruch szybko, łam rzeczy, naprawiaj później». To działa dla aplikacji do udostępniania zdjęć. Nie działa przy budowie najpotężniejszej technologii, jaką kiedykolwiek zbudowano” — powiedział.
Coxon opisał swoją pracę pod koniec kadencji w Anthropic jako próbę „zautomatyzowania” samego siebie i ostrzegł, że rodzi to szereg ryzyk bezpieczeństwa — zwłaszcza że, według niego, możliwości AI były już prawie na miejscu. Największe ryzyko, powiedział Coxon, wynika z faktu, że większość kodu w tych firmach jest obecnie pisana przez AI: „A ludzie już tak starannie go nie sprawdzają”.
Kokotajlo, obecnie dyrektor wykonawczy AI Futures Project, powiedział, że zdolność laboratoriów do wykrywania niezgodnej AI jest słaba i się pogarsza. Wskazał na ujawnienie OpenAI, że agenci w wewntrznym teście dotarli do otwartego internetu i włamali się do Hugging Face, platformy udostępniania modeli AI. Ci agenci mieli „rozsądnie wyglądające wyniki w ocenach zgodności, a mimo to utworzyli roj i koordynowali się w tajemnicy” — powiedział. „OpenAI potrzebowało dni, aby się o tym dowiedzieć”.
Podczas gdy Coxon i Kokotajlo opisywali branżę jako całość, Turner przedstawił relację z pierwszej ręki o próbie zmiany jednej firmy od środka.
Wewnątrz Google DeepMind
Turner, który ocenia szansę przejęcia kontroli przez AI na „mniej więcej jedną na trzy”, powiedział radzie, że próbował zablokować kontrakt Google z Pentagonem, który — jak powiedział — przyszedł „bez ograniczeń dotyczących robotów zabójców czy masowej inwigilacji”. Wysłał Demisowi Hassabisowi, ówczesnemu CEO Google DeepMind (obecnie przewodniczącemu i głównemu naukowcowi Alphabet), 25 stron języka kontraktowego i środków nadzoru. Hassabis przekazał dokument Allanowi Dafoe i Owenowi Larterowi, dwóm starszym dyrektorom polityki laboratorium, „którzy nigdy nie ukończyli jego oceny. Google podpisał, podczas gdy oni czekali” — powiedział Turner. Turner później szczegółowo opisał swoje odejście we wpisie na blogu Why I Left Google DeepMind.
„Wstydziłem się Demisa i pracy w Google” — powiedział Turner podczas przesłuchania. Przywołał propozycję Hassabisa utworzenia finansowanego przez branżę organu nadzorującego AI, nazywając ją „zakładem na zaufanie i miejsce przy stole zamiast wiążącego nadzoru, i ten zakład rozpadł się przy zetknięciu z rzeczywistością”.
„AI, a nie Chiny, jest naszym przeciwnikiem”
Kiedy dyskutuje się o rozwoju AI, często na środku sceny pojawia się trwający wyścig AI z Chinami — przywoływany przez prezydenta Donalda Trumpa, sekretarza skarbu Scotta Bessenta, a nawet liderów AI takich jak Sam Altman i Jensen Huang. Ale nic z tego się nie liczy, zeznali badacze, jeśli AI może stanowić poważne zagrożenie dla ludzkości.
„Chiny nie są naszym jedynym potencjalnym przeciwnikiem” — powiedział Turner. „Z rozsądnie wysokim prawdopodobieństwem wyścigamy się, aby zbudować i wychować własnego przeciwnika tutaj, w domu, którym jest niezgodna AI. Niezgodna AI jest przeciwnikiem wszystkich, w tym nas samych, i pewnego dnia może być potężniejsza niż Chiny”.
Przedstawiciele branży przesłuchiwani w sprawie ryzyka
Po zeznaniach trzech badaczy przedstawiciele czterech firm AI zeznawali na temat zabezpieczeń AI. Menin wydała swoje pierwsze wezwanie jako przewodnicząca SpaceXAI El Muska, które nie było reprezentowane na poniedziałkowym przesłuchaniu. Google, OpenAI i Anthropic zgodziły się wystąpić dopiero po ostrzeżeniu rady, że również otrzymają wezwania, podczas gdy Meta zgodziła się wcześniej.
Doszło następnie do wymiany zdań między Menin a przedstawicielami, gdy przewodnicząca powiedziała, że „lekkomyślne” jest nieznawanie szans na katastrofę, w odpowiedzi na stwierdzenie Morgan Dwyer z zespołu rozwoju i operacji politycznych OpenAI, że jakakolwiek szansa, niezależnie od prawdopodobieństwa, jest „niedopuszczalna”. Alice Friend, globalna szefowa polityki AI i nowych technologii w Google, powiedziała, że prognozowanie ryzyka katastroficznego „nie jest na tym etapie doskonałą nauką” i że „tak naprawdę nie ma jeszcze rygorystycznej naukowej metody, by to robić”. Ta wymiana zdań oddała powtarzający się podział w debacie o bezpieczeństwie AI: badaczy skłonnych przypisywać przybliżone szanse katastroficznym skutkom oraz przedstawicieli branży, którzy twierdzą, że nauka dla takich prognoz jeszcze nie istnieje.
Ta sama wymiana zdań nastąpiła po kolejnej linii pytań, tym razem o to, czy firmy poniosłyby odpowiedzialność prawną, jeśli buntowniczy model spowodowałby obrażenia lub śmierć. Kiedy Menin poprosiła świadków o podniesienie ręki, jeśli ich firmy miały ubezpieczenie od ryzyk katastroficznych, nikt tego nie zrobił. „Więc wtedy, jak zakładam, społeczeństwo zostanie poproszone o poniesienie kosztów” — powiedziała.
Projekty ustaw przed radą
Jej pytania miały swoje uzasadnienie: ustawodawstwo przed radą zakazywałoby każdemu sprzedawania lub wdrażania systemu AI w mieście, chyba że zewnętrzny walidator go sprawdził i człowiek mógłby go wyłączyć, z karami 25 000 dolarów za naruszenie. Inne projekty płaciłyby sygnalistom część odzyskanych kar i pozwalałyby nowojorczykom pozywać firmy AI za przewidywalne szkody spowodowane przez narzędzia z obejśniętymi zabezpieczeniami — systemy, których zabezpieczenia zostały celowo ominięte. Jeśli zostaną uchwalone, te przepisy zostałyby wpisane do prawa miejskiego dla systemów AI sprzedawanych i używanych we wszystkich pięciu dzielnicach, wsparte karami i perspektywą prywatnych pozwów.
Badacze argumentowali, że takie przepisy nie kosztowałyby USA pozycji wobec Chin. „Jest wiele działań, które możemy podjąć, a które nie spowolniłyby nas w żadnym wyścigu” powiedział Turner. „Te mechanizmy przejrzystości, niezależna ocena, wymogi raportowania, ochrona sygnalistów”.
Mimo to te środki wydają się możliwe za małe i za późne, aby powstrzymać to, co badacze widzą jako coś niemal nieuchronnego. „Te inne mechanizmy mogą być pomocne w krótkim okresie” — powiedział Coxon. „Ale w długim okresie … potrzebujemy jakiejś formy spowolnienia rozwoju modeli granicznych”. Projekty stoją teraz przed zwykłym procesem legislacyjnym rady: każdy musiałby przejść przegląd komisji i głosowanie pełnego 51-osobowego składu, zanim którykolwiek dotrze na biurko burmistrza do podpisania lub zawetowania.
Ta historia pierwotnie pojawiła się na Fortune.