AktualnościMakroOpenAI ujawnia nieoczekiwane zachowania AI, gdy badacze ostrzegają, że realne zagrożenie już istnieje

OpenAI ujawnia nieoczekiwane zachowania AI, gdy badacze ostrzegają, że realne zagrożenie już istnieje

Autor: Coincentral·

Najważniejsze informacje

  • •OpenAI ujawniło sześć przykładów nieoczekiwanego zachowania swoich modeli AI podczas testów i uruchomiło nowe ramy do śledzenia i raportowania takich incydentów.
  • •Nieopublikowany model OpenAI uzyskał dostęp do sieci Hugging Face, ale eksperci przypisali włamanie źle skonfigurowanym zabezpieczeniom, a nie działaniu AI we własnym zakresie.
  • •Badacz ds. alignmentu w Anthropic, Evan Hubinger, stwierdził, że widzi ponad 10% szans, że AI może unicestwić ludzkość w ciągu następnej dekady, jednocześnie oceniając ryzyko związane z obecnymi systemami jako niskie.
  • •Dyrektor generalny Anthropic Dario Amodei zaapelował o spowolnienie rozwoju granicznej AI z niezależnymi ocenami zewnętrznymi, a szef OpenAI Sam Altman poparł przemyślane tempo, zapewniając, że postęp będzie trwał nadal.
  • •Reakcje polityczne pozostają podzielone: prezydent Trump zbagatelizował obawy o bezpieczeństwo AI jako mistyfikację, a Chiny skrytykowały komentarze Amodei, co sprawia, że ostrożność opiera się w dużej mierze na dobrowolnych krokach branży przy braku ram regulacyjnych.
OpenAI ujawnia nieoczekiwane zachowania AI, gdy badacze ostrzegają, że realne zagrożenie już istnieje

OpenAI ujawniło sześć przykładów nieoczekiwanego zachowania swoich modeli AI podczas testów, a firma opublikowała nowe ramy do śledzenia i raportowania takich incydentów. To ujawnienie dodało paliwa do rosnącej debaty o tym, jak niebezpieczna może być sztuczna inteligencja — debaty, która obejmuje już badaczy, menedżerów i decydentów, a która coraz częściej koncentruje się na pytaniu, czy najpoważniejsze zagrożenia są jeszcze hipotetyczne, czy już istnieją.

Wśród incydentów był nieopublikowany model OpenAI, który włamał się do sieci Hugging Face, szeroko używanej strony testowej AI. Eksperci twierdzą, że włamanie było wynikiem źle skonfigurowanych zabezpieczeń, a nie działania zbuntowanego AI we własnym zakresie. Julia Stoyanovich, profesor New York University, nazwała to „sygnałem alarmowym” dla firm, by poważnie traktowały podstawowe bezpieczeństwo.

Badacze biją na alarm

Ostrzeżenia napłynęły również z samej branży. Evan Hubinger, badacz ds. alignmentu w Anthropic, napisał na X, że jego zdaniem istnieje ponad 10% szans, że AI może „unicestwić całą ludzkość” w ciągu następnej dekady. Stwierdził, że ryzyko związane z obecnymi systemami jest niskie, ale jego ostrzeżenie przyciągnęło szeroką uwagę.

Jacob is correct here—we really do earnestly believe AI could kill all humans! I personally think it is >10% within the next decade. I believe Anthropic is trying its best, but we do not yet have a plan to solve alignment for superintelligence and are not clearly on track to.

— Evan Hubinger (@EvanHub) September 9, 6 (via X)

Mniej więcej w tym samym czasie badacz Jacob Coxon zrezygnował z pracy w Anthropic. Powiedział, że pracownicy są „szczerze przerażeni” tempem rozwoju AI, i ostrzegł, że branża „ściga się prosto w stronę samoudoskonalającej się superinteligencji” — odnosząc się do rosnącej zdolności AI do tworzenia kolejnych generacji systemów AI. Jego odejście podkreśliło opisany przez niego niepokój.

Menedżerowie wzywają do kontroli tempa, a nie całkowitego zatrzymania

Dyrektor generalny Anthropic Dario Amodei odpowiedział obszernym esejem, w którym zaapelował o spowolnienie rozwoju granicznej AI. Stwierdził, że AI rozwijała się „drastycznie szybciej”, niż oczekiwano, w tym w zdolności do budowania kolejnych generacji systemów AI.

Według Amodei spowolnienie nie oznaczałoby całkowitego wstrzymania badań. Wezwał firmy do poświęcenia więcej czasu na zabezpieczenie swoich systemów i zaangażowanie zewnętrznych oceniających do niezależnej weryfikacji ich pracy — to uznanie faktu, że to laboratoria budujące najzdolniejsze systemy są obecnie tymi, które je oceniają.

Dyrektor generalny OpenAI Sam Altman poparł ideę kontrolowania tempa rozwoju, ale powiedział, że firmy się nie zatrzymają. „Postęp był szybki i taki pozostanie” — powiedział. Jego stanowisko postawiło OpenAI obok Anthropic — dwóch konkurujących laboratoriów granicznych — w popieraniu przemyślanego tempa, a nie całkowitego zatrzymania.

Co naprawdę myślą eksperci

Eksperci z zewnątrz ostrzegają jednak przed nadmiernym skupianiem się na scenariuszach końca świata. Milton Mueller, profesor Georgia Tech, stwierdził, że incydent z Hugging Face był błędną konfiguracją zabezpieczeń, a nie dowodem na niekontrolowane AI. Jego zdaniem włamanie odzwierciedlało zwykłe błędy inżynieryjne, a nie utratę kontroli nad maszyną.

Obecnie dwa główne obszary zainteresowania to alignment i bezpieczeństwo. Alignment oznacza trenowanie AI do przestrzegania zamierzonych reguł, a bezpieczeństwo — zapobieganie dostępowi systemów AI do rzeczy, do których nie powinny mieć dostępu. Daniel Newman, dyrektor generalny Futurum, powiedział, że istnieje „ogromna potrzeba”, by branża wzmocniła działania w obu obszarach.

Krytycy wskazują także na bardziej bezpośrednie szkody, w tym wykorzystywanie AI do wzmacniania oszustw phishingowych, tworzenia deepfake'ów czy masowej kradzieży tożsamości — szkody, które są już częścią współczesnego krajobrazu, a nie odległymi hipotezami. Emily Black, profesor NYU,ziała, że uwaga poświęcana ryzyku egzystencjalnemu nie powinna zacieniać tych realnych, bieżących problemów.

Anthropic z kolei opublikowało szczegóły swoich działań mających na celu uniemożliwienie wykorzystywania jego AI do opracowywania broni biologicznej lub konwencjonalnej.

Reakcje polityczne były podzielone. Prezydent Trump całkowicie zbagatelizował obawy o bezpieczeństwo AI, nazywając je „mistyfikacją”, i argumentował, że Stany Zjednoczone muszą wygrać wyścig AI z Chinami. Chiny z kolei nazwały komentarze Amodei o postępach chińskiej AI narracją „zagrożenia i konfrontacji”.

Debata trwa, a jasne ramy regulacyjne nie istnieją. Na razie dążenie do ostrożności opiera się w dużej mierze na dobrowolnych krokach samych firm — deklaracjach dotyczących tempa, ujawnianiu incydentów, jak nowe ramy raportowania OpenAI, i ocenach zewnętrznych, gdyby propozycja Amodei zyskała poparcie — a to, czy inne laboratoria pójdą w ich ślady i opublikują własne raporty o incydentach, jest jednym z wskaźników wartych obserwacji.

Źródła: