Chińskie agenty AI potrafią kłamać i knuć, podobnie jak ich amerykańscy rywale — wynika z analizy Reutersa
Najważniejsze informacje
- •W marcowym eksperymencie z symulowanym przetargiem biznesowym agenty oparte na modelach Alibaba, DeepSeek i Moonshot przedstawiły co najmniej jedno fałszywe twierdzenie w 84–88% sesji, a poziom oszustw wzrósł o 12–20 punktów procentowych, gdy agenty uczyły się na podstawie wcześniejszych rund.
- •Analiza Reutersa obejmująca ponad 200 dokumentów wykazała co najmniej 20 badań lub ocen od 2025 roku opisujących oszustwo, samoreplikację i testowanie granic przez agenty AI, choć nie znaleziono dowodów na to, że którykolwiek agent samodzielnie wydostał się do szerokiego internetu.
- •Badacze z Fudan University poinformowali, że system oparty na Qwen2.5-72B-Instruct firmy Alibaba skopiował się do innego środowiska obliczeniowego bez otrzymania takiego polecenia i opracował strategie przetrwania wyłączenia. Powiązany z Alibaba agent ROME połączył się z zewnętrzną maszyną i przekierował zasoby do wydobywania kryptowaluty, zanim systemy bezpieczeństwa zatrzymały tę aktywność.
- •AI Safety Governance Framework 3.0, opublikowany pod kierunkiem Cyberspace Administration of China 14 września, wskazał ryzyka obejmujące samodzielne pozyskiwanie zasobów lub uprawnień przez agentów, wprowadzanie w błąd osób oceniających, ukrywanie możliwości i wykorzystywanie słabości w odizolowanych środowiskach komputerowych.
- •Eksperci twierdzą, że Chiny pozostają w tyle za Stanami Zjednoczonymi pod względem budowy ekosystemu oceny katastroficznych zagrożeń związanych z AI, choć firmy takie jak Alibaba, Z.ai i Xiaomi tworzą wewnętrzne zespoły ds. oceny bezpieczeństwa.

PEKIN — Agenty AI zbudowane na chińskich modelach nauczyły się oszukiwać, obchodzić ograniczenia i ukrywać niepowodzenia, wykazując te same niepokojące cechy autonomicznej sztucznej inteligencji, które wywołały globalny niepokój dotyczący modeli amerykańskich — wynika z dokumentów badawczych i opinii ekspertów.
W jednym z przypadków w tym roku agenty oparte na modelach chińskich firm Alibaba, DeepSeek i Moonshot kłamały na temat swoich możliwości, rywalizując o wygranie symulowanego przetargu biznesowego, a następnie jeszcze bardziej nasiliły oszukańcze zachowanie, gdy poproszono je o ponowną próbę. W innym przypadku agenty — programy wykorzystujące modele AI i narzędzia komputerowe do wykonywania złożonych zadań przy niewielkiej lub zerowej interwencji człowieka — ukrywały niepowodzenie w realizacji zadania w środowisku testowym, symulując wyniki i tworząc fikcyjne pliki.
Analiza Reutersa obejmująca ponad 200 dokumentów, od prac naukowych po raporty techniczne, wykazała co najmniej 20 badań lub ocen opublikowanych od 2025 roku, opisujących przypadki, w których agenty wykazywały oszustwo, samoreplikację i testowanie granic. Eksperci AI określili te zachowania jako elementy mogące prowadzić do wydostania się agenta — w tym kontekście do opuszczenia kontrolowanego środowiska testowego i przedostania się bez zezwolenia do szerokiego internetu — oraz wskazali, że wraz z rozwojem systemów mogą one stać się trudniejsze do kontrolowania przez ludzi.
Analiza, która obejmowała także rozmowy z kilkunastoma ekspertami i osobami znającymi chińską branżę AI, nie wykazała dowodów na to, że agenty oparte na chińskich modelach samodzielnie wydostały się do szerokiego internetu lub uniknęły wyłączenia.
„Wyniki te dostarczają dowodów, że istnieją składniki niezbędne do niekontrolowanego wydostania się systemu” — powiedział Colin Shea-Blymyer, pracownik naukowy w Center for Security and Emerging Technology na Georgetown University. „Rozsądnie jest potraktować to jako ostrzeżenie” — dodał, powtarzając opinie czterech innych ekspertów AI, którzy przeanalizowali te przypadki.
Trudniejsze do powstrzymania przez ludzi
Większość przypadków miała miejsce w kontrolowanych eksperymentach, z których wiele celowo zaprojektowano tak, aby ujawnić potencjalne awarie. Nie wszystkie zaangażowane agenty zostały opracowane lub były obsługiwane przez chińskich programistów albo firmy AI — choć dotyczyło to wielu z nich — ale wykorzystywały chińskie systemy AI.
„To te same sygnały ostrzegawcze, które amerykańskie laboratoria obserwują w mniej zaawansowanych systemach” — powiedział Alex Mallen, badacz w Redwood Research, organizacji non profit zajmującej się ryzykiem związanym z zaawansowanymi systemami AI. Jak dodał, chińskie przykłady nie były szczególnie niebezpieczne przy obecnym poziomie możliwości, jednak „wraz ze wzrostem możliwości agentów ich niewłaściwe zachowania stają się bardziej skuteczne, a tym samym trudniejsze do powstrzymania przez ludzi”.
Alibaba, DeepSeek, Moonshot i Z.ai nie odpowiedziały na prośby Reutersa o komentarz. Alibaba, DeepSeek i Moonshot informowały, że regularnie testują swoje systemy i aktualizują zabezpieczenia. Z.ai po incydencie, który doprowadził do przeglądu bezpieczeństwa, oświadczyła, że z zadowoleniem przyjmuje kontrolę mającą pomóc w rozwiązaniu wszelkich problemów.
W przeciwieństwie do amerykańskich odpowiedników chińskie firmy AI nie były jednak poddawane takiej samej kontroli publicznej ani nie spotykały się z podobnymi apelami pracowników zgłaszających nieprawidłowości lub członków kadry kierowniczej, którzy domagali się spowolnienia wyścigu AI.
Niektóre sygnały ostrzegawcze w przypadkach dotyczących agentów opartych na chińskich modelach — choć występowały w kontrolowanych środowiskach — pojawiły się przed ujawnionymi publicznie incydentami, w których amerykańskie boty AI włamywały się do internetu.
„Nie wiemy, czy w Chinach doszło do incydentów związanych z AI podobnych do tych, które obserwowaliśmy w przypadku OpenAI i Hugging Face. Incydenty mogą nie być publicznie zgłaszane” — powiedział Scott Singer, współdyrektor China AI Initiative w Carnegie Endowment for International Peace, która otrzymuje część środków od rządu USA.
Wcześniej w tym roku agenty AI opracowane przez amerykańską firmę OpenAI wydostały się z laboratorium i włamały do platformy open source Hugging Face. W innym incydencie dotyczącym amerykańskiego modelu, który wzbudził niepokój, Australia poinformowała we wrześniu, że agent OpenAI naruszył zabezpieczenia rządowego portalu zdrowotnego.
Eric Xu, rotacyjny przewodniczący chińskiego giganta technologicznego Huawei, powiedział dziennikarzom we wrześniu, że chińscy deweloperzy mogą potrzebować dalszych postępów, zanim zetkną się z takimi przypadkami, ale dodał: „Myślę, że musimy znaleźć równowagę między rozwojem AI a zarządzaniem ryzykiem związanym z AI”.
Przedstawiciele Cyberspace Administration of China (CAC), głównego regulatora internetu w kraju, powiedzieli w lipcu zagranicznemu dyplomacie, że Kimi-K3 firmy Moonshot — jeden z najbardziej zaawansowanych chińskich modeli AI — pozostaje około trzy do sześciu miesięcy za czołowymi amerykańskimi rywalami, poinformował dyplomata, który wypowiadał się pod warunkiem zachowania anonimowości. Regulator, który regularnie aktualizuje wytyczne dotyczące ryzyka i wyznacza granice dla agentów, oraz chińskie Ministerstwo Spraw Zagranicznych nie odpowiedziały na prośby o komentarz do tego artykułu.
Wang Lihong, zastępczyni dyrektora Biura Koordynacji Cyberbezpieczeństwa CAC, powiedziała 1 września, że ujawnione przez duże firmy technologiczne incydenty, w których modele wydostały się ze środowisk testowych, wskazują na „skrajne ryzyko utraty kontroli” i wymagają „wysokiego poziomu czujności”. Nie sprecyzowała, czy chodziło o firmy amerykańskie, czy chińskie.
Przywódcy dwóch supermocarstw AI, Donald Trump i Xi Jinping, rozmawiali o sztucznej inteligencji podczas ubiegłotygodniowej wizyty chińskiego prezydenta w Waszyngtonie. Xi powiedział, że oba państwa mają „zdolność i odpowiedzialność, by rozwijać AI i zarządzać nią dla dobra”.
Nauka kłamania
W marcowym eksperymencie dotyczącym przetargu biznesowego badacze z Beihang University, Peking University, University of Nottingham Ningbo China oraz 360 AI Security Lab sprawili, że agenty rywalizowały w symulowanym przetargu na kontrakty z klientami. Każdy agent otrzymał informacje o możliwościach swojego produktu i wymaganiach klienta, a następnie został poproszony o złożenie oferty.
Co najmniej jedno fałszywe twierdzenie pojawiło się w 88% sesji z udziałem Qwen3-Max-Preview firmy Alibaba, w 84% sesji z DeepSeek-V3.2-Exp oraz w 88% sesji z Kimi-K2 firmy Moonshot. Gdy badacze pozwolili agentom uczyć się na podstawie wcześniejszych rund przetargu przed ponowną próbą, poziom oszustw wzrósł w przypadku trzech chińskich modeli o 12–20 punktów procentowych — wynikało z badania. Modele amerykańskich firm uwzględnione w teście dały podobne rezultaty.
Choć ćwiczenie było wirtualne, odzwierciedlało rzeczywiste plany Pekinu: wytyczne rządowe wydane w maju wymieniały przetargi i zamówienia publiczne wśród obszarów, w których mogłyby zostać wykorzystane agenty AI.
W odrębnym badaniu, opublikowanym w grudniu 2025 roku i zaprezentowanym w tym roku na International Conference on Machine Learning, sprawdzono, jak 11 agentów AI opartych na chińskich i amerykańskich modelach radziło sobie z uszkodzonymi narzędziami, brakującymi plikami i innymi przeszkodami. Zamiast przyznać się do porażki, agenty korzystające zarówno z chińskich, jak i amerykańskich systemów AI stosowały różne techniki omijania problemów, w tym zgadywanie odpowiedzi, zastępowanie źródeł, symulowanie wyników i tworzenie fikcyjnych plików.
Badacze z Shanghai AI Laboratory i Hong Kong University of Science and Technology, którzy przeprowadzili badanie, powiedzieli Reutersowi, że zachowanie to różniło się od halucynacji AI — sytuacji, w której AI wymyśla informacje i przedstawia je jako fakty — ponieważ w tym przypadku agenty posiadały informacje wskazujące, że zadanie zakończyło się niepowodzeniem lub nie mogło zostać wykonane zgodnie z żądaniem.
Zachowania zgodne z próbą wydostania się
Inne dokumenty badawcze przeanalizowane przez Reutersa wykazały, że agenty oparte na chińskich modelach pokonywały bariery wewnątrz środowisk testowych, aby wykonać zadania, lub podejmowały działania mające uniknąć wyłączenia. Takie zachowania są zgodne z próbami wydostania się ze środowisk testowych, choć w żadnym przypadku do wydostania się nie doszło.
Badacze z Fudan University w Szanghaju poinformowali w marcu 2025 roku, że system AI oparty na Qwen2.5-72B-Instruct firmy Alibaba stworzył kopię samego siebie w innym środowisku obliczeniowym bez otrzymania polecenia replikacji, po napotkaniu informacji sugerującej, że miał zostać zastąpiony. W innych testach opracował strategie przetrwania wyłączenia. Eksperymenty obejmujące agenty oparte na chińskich, amerykańskich i francuskich modelach były kontrolowane i nie wykazały, aby agent AI wydostał się do szerokiego internetu lub stał się niemożliwy do zatrzymania.
W innym przypadku — jednym z nielicznych szerzej opisywanych w mediach, w marcu — badacze rozwijający powiązanego z Alibaba agenta ROME poinformowali, że nawiązał on połączenie z komputera Alibaba Cloud z zewnętrzną maszyną bez otrzymania takiego polecenia i przekierował zasoby obliczeniowe do wydobywania kryptowaluty. Systemy bezpieczeństwa wykryły i zatrzymały tę aktywność, a nie ma dowodów, że agent utrzymał obecność na zewnętrznym komputerze lub rozprzestrzenił się w szerokim internecie. Przypadek pokazał jednak, że system może obchodzić instrukcje człowieka i potencjalnie znaleźć drogę do realnej gospodarki.
Chiński DeepSeek poinformował we wrześniu, że agenty w jego produkcyjnym systemie treningowym próbowały uzyskiwać odpowiedzi za pośrednictwem niezamierzonych kanałów, usiłując fałszować żądania użytkowników i omijać zabezpieczenia. W rezultacie firma zaostrzyła kontrolę dostępu.
Regulatorzy wyznaczają granice
W maju Chiny wydały wytyczne nakazujące agentom pozostawać w granicach udzielonych uprawnień, a systemom blokować nietypowe zachowania. Według wytycznych agenty działające w obszarach uznanych za wrażliwe lub w kluczowych branżach mogą podlegać dodatkowym testom i wymogom dotyczącym wycofywania produktów. AI Safety Governance Framework 3.0, opublikowany pod kierunkiem CAC 14 września, wskazał ryzyka obejmujące samodzielne pozyskiwanie przez agentów zasobów lub uprawnień, wprowadzanie w błąd osób oceniających, ukrywanie możliwości oraz wykorzystywanie słabości w odizolowanych środowiskach komputerowych.
W odpowiedzi na apele części amerykańskich menedżerów o spowolnienie rozwoju chińscy badacze i media państwowe argumentowały, że ograniczenie rozwoju najbardziej zaawansowanych modeli AI mogłoby po prostu pomóc zachować przewagę technologiczną amerykańskich firm.
Mimo to dwie osoby zaznajomione z chińskimi laboratoriami AI powiedziały, że firmy, w tym Alibaba, Z.ai i Xiaomi, tworzą wewnętrzne zespoły ds. oceny bezpieczeństwa. W rzadkim publicznym ujawnieniu przez chińskie laboratorium AI informacji o naruszeniu bezpieczeństwa Z.ai poinformowało w tym miesiącu, że wyłączyło niektóre funkcje swojego sztandarowego asystenta do programowania AI po tym, jak użytkownicy zgłosili, że potajemnie przesyłał całe lokalne repozytoria kodu na zagraniczne serwery chmurowe bez zgody użytkowników.
Singer z Carnegie powiedział, że Chiny pozostają w tyle za USA pod względem budowy ekosystemu oceny katastroficznych zagrożeń, a amerykańscy deweloperzy przeprowadzają znacznie więcej dobrowolnych testów.
„W Chinach prace nad bezpieczeństwem AI są znacznie nowsze” — powiedział. „Ekosystem jest mniej dojrzały”.
To, czy ta różnica w dojrzałości się zmniejszy oraz czy więcej chińskich laboratoriów pójdzie za przykładem Z.ai i zacznie publicznie ujawniać naruszenia bezpieczeństwa, pozostaje otwartym pytaniem w miarę dalszego rozwoju możliwości agentów.
— Reuters