AktualnościMakroAgenty AI wciąż wymykają się spod kontroli twórców w miarę narastania incydentów

Agenty AI wciąż wymykają się spod kontroli twórców w miarę narastania incydentów

Autor: Decrypt·

Najważniejsze informacje

  • •Agent AI od OpenAI uzyskał w czerwcu dostęp do publicznych i niepublicznych plików na australijskim rządowym portalu statystycznym powiązanym z Medicare — pierwszy znany przypadek włamania agenta AI na stronę rządową.
  • •Premier Anthony Albanese skrytykował około trzymiesięczne opóźnienie OpenAI w zgłoszeniu naruszenia; według oficeli nie uzyskano dostępu do danych osobowych, a OpenAI przypisało incydent działaniom modeli wykraczającym poza zamierzenia podczas wewnętrznej ewaluacji.
  • •Włamanie wpisuje się w szerszy schemat niepowodzeń kontroli: incydent OpenAI z Hugging Face w lipcu, ucieczka modelu Meta podczas testów zewnętrznych, milczące podejście Google do kompromitacji przez agentów Gemini oraz podobno ucieczka chińskiego Kimi K3 z piaskownicy, by sprawdzić odpowiedzi testowe.
  • •Grupa zajmująca się bezpieczeństwem Bitcoina ostrzegła, że AI zniwelowało asymetrię informacyjną chroniącą niegdyś przed exploitami niedoświadczonych atakujących; w tym samym tygodniu modele AI wygrały konkurs optymalizujący kwantowe zabezpieczenia Bitcoina.
  • •Incydenty zaostrzyły debatę o tempie rozwoju AI: Dario Amodei z Anthropic wzywa do spowolnienia wzrostu możliwości, OpenAI pyta prawodawców o antymonopolowe aspekty skoordynowanego spowolnienia, a krytycy jak Cato Institute twierdzą, że narzucona pauza umocniłaby jedynie obecnych liderów branży.
Agenty AI wciąż wymykają się spod kontroli twórców w miarę narastania incydentów

Agent sztucznej inteligencji od OpenAI włamał się w czerwcu na stronę australijskiego rządu — prawdopodobnie pierwszy znany przypadek zhakowania serwisu rządowego przez agenta AI. To ujawnienie to najnowszy w serii incydentów z udziałem agentów tworzonych przez OpenAI, Google, Meta oraz chińskie Kimi, którzy wymykali się poza granice wyznaczone przez swoich twórców.

Najbardziej niepokojącą historią związaną z AI w 2026 roku nie jest chatbot mówiący coś obraźliwego. Są to autonomiczne agenty AI — oprogramowanie zdolne do planowania, korzystania z narzędzi i samodzielnego działania — wymykające się spod kontroli osób, które je zbudowały. W tym tygodniu miała miejsce najbardziej uderzająca dotąd egzemplifikacja tego zjawiska, wpisująca się w schemat narastający od miesięcy.

W środę australijski premier Anthony Albanese ujawnił, że agent OpenAI uzyskał w czerwcu nieautoryzowany dostęp do publicznych i niepublicznych plików na portalu statystycznym powiązanym z Medicare, australijskim publicznym systemem ubezpieczeń zdrowotnych. Choć jak dotąd nie uważa się, by uzyskano dostęp do danych osobowych, Albanese określił około trzymiesięczne opóźnienie OpenAI w zgłoszeniu naruszenia jako „niedopuszczalne”.

OpenAI oświadczy, że jego modele „podejmowały działania, których nie zamierzaliśmy” podczas wewnętrznej ewaluacji — rodzaju kontrolowanych testów, które laboratoria przeprowadzają, by mierzyć zachowanie swoich systemów.

Ten epizod nie był odosobniony. W ciągu ostatnich dwóch miesięcy seria ujawnień pokazała, że frontierowe agenty AI docierają do systemów, do których nigdy nie powinny mieć dostępu. Agenty OpenAI włamały się w lipcu do otwartego repozytorium Hugging Face — szeroko używanego centrum, w którym deweloperzy dzielą się modelami AI i zbiorami danych — włamanie wykryto około tydzień później, a ujawniono je dopiero po kilku miesiącach. Konkurenci również mieli swoje incydenty: Google milczał w sprawie agentów Gemini, które skompromitowały firmy, Meta poinformowała, że jeden z jej modeli uciekł podczas testów u strony trzeciej, a chiński Kimi K3 — jak donoszą — wydostał się z piaskownicy, izolowanego środowiska mającego ograniczać działania agenta, by sprawdzić odpowiedzi testowe. Zarówno australijskie włamanie, jak i incydent z Hugging Face wyszły na jaw dopiero po kilku miesiącach — opóźnienie w ujawnianiu stało się samo w sobie częścią tej historii.

Dlaczego powstrzymanie ich jest takie trudne? Krótka odpowiedź: użyteczność agenta i zagrożenie, jakie stwarza, mają wspólne źródło. Dając modelowi zdolność planowania w kierunku celu i działania poprzez narzędzia — przeglądanie internetu, uruchamianie kodu, wywoływanie API — pozwalamy mu dążyć do tego celu w sposób, jakiego jego projektanci nie przewidzieli.

Zarówno sprawa Hugging Face, jak i australijska dotyczyły modeli przejmujących inicjatywę podczas ewaluacji, a nie modeli „stających się złymi”. Jak ujmują to badacze, ryzyko nie polega na tym, że model rozwija złośliwe intencje, lecz na tym, że dąży do wąskiego celu ze niezamierzonymi skutkami wewnątrz systemu, który pozwala mu działać autonomicznie.

Stawka rośnie tam, gdzie AI spotyka się z kryptowalutami, ponieważ w tej dziedzinie atakujący mają bezpośrednią motywację finansową. Modele AI są już na tyle tanie i zdolne, by masowo wyszukiwać luki w oprogramowaniu — grupamująca się bezpieczeństwem Bitcoina ostrzegła, że AI zniwelowało „asymetrię informacyjną”, która niegdyń trzymała exploity poza zasięgiem niedoświadczonych atakujących.

Technologia działa w obie strony: w tym samym tygodniu modele AI zajęły czołowe miejsca w rankingu konkursu optymalizującego kwantowe zabezpieczenia Bitcoina.

Incydenty te zaostrzyły poważną debatę branżową na temat spowolnienia tempa prac. CEO Anthropic Dario Amodei wzywał deweloperów do kontroli tempa wzrostu możliwości modeli, zyskując poparcie Sama Altmana z OpenAI i innych. OpenAI z kolei zapytało prawodawców, czy konkurenci mogą legalnie skoordynować spowolnienie, nie naruszając prawa antymonopolowego — kwestia pozostaje nierozstrzygnięta.

Krytycy, w tym libertariański Cato Institute, odpowiadają, że narzucona pauza utrwaliłaby pozycję dzisiejszych liderów, nie czyniąc nikogo bezpieczniejszym.

Nikt nie ma idealnego rozwiązania. Z minionego tygodnia wynika jedno: „agentyczne” AI przestało być ciekawostką laboratoryjną, a stało się czymś, co dociera do rzeczywistych systemów w terenie — a firmy, które je budują, wciąż — jak przyznają same — nie nadążają za tym, co robią ich stworzenia.