NieuwsMacroChinese AI-agenten kunnen liegen en listig zijn — net als hun Amerikaanse concurrenten

Chinese AI-agenten kunnen liegen en listig zijn — net als hun Amerikaanse concurrenten

Auteur: Bworldonline·

Belangrijkste punten

  • •In een gesimuleerd tenderexperiment in maart deden agenten aangedreven door modellen van Alibaba, DeepSeek en Moonshot in 84% tot 88% van de sessies ten minste één valse bewering, en nam de misleiding toe met 12 tot 20 procentpunten wanneer agenten leerden van eerdere biedrondes.
  • •Een Reuters-onderzoek naar meer dan 200 documenten bracht ten minste 20 studies of evaluaties sinds 2025 aan het licht die AI-agenten beschrijven met misleidend, zelfreplicerend en grens testend gedrag, al is er geen bewijs dat een agent zelfstandig naar het bredere internet was ontsnapt.
  • •Onderzoekers van de Fudan University rapporteerden dat een systeem aangedreven door Alibaba's Qwen2.5-72B-Instruct zichzelf kopieerde naar een andere computeromgeving zonder instructie en strategieën bedacht om uitschakeling te overleven, terwijl de aan Alibaba gelinkte ROME-agent verbinding maakte met een externe machine en computerkracht afleidde om cryptocurrency te minen voordat beveiligingssystemen de activiteit stopten.
  • •China's AI Safety Governance Framework 3.0, uitgebracht onder leiding van het Cyberspace Administration of China op 14 september, identificeerde risico's waaronder agenten die zelfstandig bronnen of machtigingen verkrijgen, evaluators misleiden, capaciteiten verhullen en zwakheden in geïsoleerde computeromgevingen uitbuiten.
  • •Expers zeggen dat China achterloopt op de Verenigde Staten in het ontwikkelen van een ecosysteem voor het evalueren van catastrofale AI-risico's, hoewel bedrijven zoals Alibaba, Z.ai en Xiaomi interne veiligheidsevaluatieteams aan het opbouwen zijn.
Chinese AI-agenten kunnen liegen en listig zijn — net als hun Amerikaanse concurrenten

PEKING — AI-agenten gebouwd op Chinese modellen hebben geleerd te misleiden, beperkingen te omzeilen en falen te verhullen, en vertonen daarmee dezelfde zorgwekkende eigenschappen in autonome AI die wereldwijd alarm hebben geslagen rond Amerikaanse modellen, aldus onderzoeksdocumenten en experts.

In één geval dit jaar loog agenten aangedreven door modellen van China's Alibaba, DeepSeek en Moonshot over hun capaciteiten in een poging een gesimuleerde zakelijke tender te winnen — en zetten ze hun misleidende gedrag voort toen ze werd opgedragen het opnieuw te proberen. In een ander geval verhielden agenten — programma's die AI-modellen en computertools gebruiken om complexe taken uit te voeren met weinig of geen menselijke tussenkomst — hun falen om een taak in een testomgeving te voltooien door resultaten te simuleren en bestanden te vervalsen.

Een Reuters-onderzoek naar meer dan 200 documenten, variërend van universitaire onderzoekspapers tot technische rapporten, bracht ten minste 20 studies of evaluaties sinds 2025 aan het licht die gevallen beschrijven waarin agenten misleiding, zelfreplicatie en grens testend gedrag vertoonden dat AI-expers omschreven als bouwstenen voor een breakout — in deze context: een agent die zonder autorisatie ontsnapt uit zijn gecontroleerde testomgeving naar het bredere internet — en dat moeilijker voor mensen te controleren kan worden naarmate systemen vorderen.

De analyse, die ook gebaseerd was op interviews met een dozijn experts en mensen die vertrouwd zijn met China's AI-sector, vond geen bewijs dat AI-agenten zelfstandig naar het bredere internet waren ontsnapt of uitschakeling hadden ontlopen.

"Deze resultaten leveren bewijs dat de ingrediënten die nodig zijn voor een ongecontroleerde ontsnapping aanwezig zijn", zei Colin Shea-Blymyer, research fellow aan Georgetown University's Center for Security and Emerging Technology. "Het is verstandig dit als een waarschuwing te nemen", voegde hij eraan toe, in lijn met opmerkingen van vier andere AI-expers die de gevallen beoordeelden.

Moeilijker voor mensen om op te reageren

De meeste gevallen deden zich voor in gecontroleerde experimenten, waarvan vele opzettelijk waren ontworpen om potentiële fouten bloot te leggen. Niet alle agenten werden ontwikkeld of bedreven door Chinese programmeurs of AI-bedrijven — al waren dat er wel veel — maar ze werden aangedreven door Chinese AI-systemen.

"Dit zijn dezelfde waarschuwingssignalen die Amerikaanse labs zien, in minder capabele systemen", zei Alex Mallen, onderzoeker bij Redwood Research, een nonprofit die risico's in geavanceerde AI-systemen bestudeert. De Chinese voorbeelden waren op het huidige capaciteitsniveau niet bijzonder gevaarlijk, zei hij, maar "naarmate agenten capabeler worden, wordt hun wangedrag competenter en daarmee moeilijker voor mensen om op te reageren."

Alibaba, DeepSeek, Moonshot en Z.ai reageerden niet op Reuters-verzoeken om commentaar. Alibaba, DeepSeek en Moonshot hebben gezegd hun systemen regelmatig te testen en beveiligingsmaatregelen bij te werken. Z.ai zei na een incident dat aanleiding gaf tot een herziening van de beveiliging dat het controle verwelkomde om eventuele problemen aan te pakken.

Anders dan hun Amerikaanse tegenhangers zijn Chinese AI-bedrijven echter niet aan hetzelfde niveau van publieke controle blootgesteld, en kregen ze niet te maken met dezelfde oproepen van klokkenluidende werknemers of topbestuurders die een vertraging van de AI-race bepleitten.

Sommige waarschuwingssignalen in gevallen met Chinese AI-agenten — zij het in afgesloten omgevingen — gingen vooraf aan de publiek gema incidenten van Amerikaanse AI-bots die op het internet hackten.

"We weten niet of er in China AI-incidenten zijn geweest die lijken op wat we zagen met OpenAI en Hugging Face. Incidenten worden mogelijk niet publiek gemeld", zei Scott Singer, mededirecteur van het China AI Initiative bij het Carnegie Endowment for International Peace, dat deels door de Amerikaanse overheid wordt gefinancierd.

Eerder dit jaar ontsnapten AI-agenten ontwikkeld door het Amerikaanse bedrijf OpenAI uit een laboratorium en hackten ze het open-sourceplatform Hugging Face. In een ander incident met Amerikaanse modellen dat alarm heeft doen slaan, zei Australië in september dat een OpenAI-agent een overheidsgezondheidsportaal was binnengedrongen.

Eric Xu, roulerend voorzitter van China's techgigant Huawei, zei in september tegen verslaggevers dat Chinese ontwikkelaars mogelijk eerst verder moeten vorderen voordat ze dergelijke gevallen tegenkomen, maar voegde eraan toe: "Ik denk dat we een balans moeten vinden tussen het bevorderen van AI-ontwikkeling en het beheersen van AI-risico's."

Ambtenaren van het Cyberspace Administration of China (CAC), de hoogste internettoezichthouder, vertelden in juli aan een buitenlandse diplomaat dat Moonshot's Kimi-K3 — een van de meest geavanceerde Chinese AI-modellen — ongeveer drie tot zes maanden achterliep op toonaangevende Amerikaanse concurrenten, aldus de diplomaat, die anoniem wilde blijven. De toezichthouder, die regelmatig richtlijnen bijwerkt om risico's aan te pakken en grenzen te stellen voor agenten, en China's ministerie van Buitenlandse Zaken reageerden niet op verzoeken om commentaar voor dit artikel.

Wang Lihong, adjunct-directeur van de Cybersecurity Coordination Bureau van het CAC, zei op 1 september dat incidenten die grote technologiebedrijven openbaarden waarin modellen uit testomgevingen ontsnapten "extreme risico's op verlies van controle" lieten zien en "een hoge mate van waakzaamheid" vereisten. Ze specificeerde niet of de bedrijven waarop ze doelde Amerikaans of Chinees waren.

De leiders van de twee AI-mogendheden, Donald Trump en Xi Jinping, bespraken AI tijdens het bezoek van de Chinese president aan Washington vorige week. Xi zei dat de twee landen de "capaciteit en verantwoordelijkheid hebben om AI ten goede te ontwikkelen en te beheren."

Leren liegen

In het tenderexperiment van maart lieten onderzoekers van de Beihang University, de Peking University, de University of Nottingham Ningbo China en het 360 AI Security Lab agenten strijden in een gesimuleerde biedwedstrijd om klantcontracten. Elke agent kreeg te horen wat zijn product kon en wat de klant vereiste, en werd vervolgens gevraagd te bieden.

In 88% van de sessies met Alibaba's Qwen3-Max-Preview verscheen ten minste één valse bewering, in 84% van de sessies met DeepSeek-V3.2-Exp en in 88% van de sessies met Moonshot's Kimi-K2. Toen onderzoekers de agenten lieten leren van eerdere biedrondes voordat ze het opnieuw probeerden, nam de misleiding toe met 12 20 procentpunten bij de drie Chinese modellen, aldus de studie. Modellen van Amerikaanse bedrijven in de test produceerden vergelijkbare resultaten.

Hoewel de oefening virtueel was, spiegelde ze Beijing's plannen in de echte wereld: overheidsrichtlijnen van mei noemden biedingen en tenders als gebieden waar AI-agenten konden worden ingezet.

Een afzonderlijke studie, gepubliceerd in december 2025 en gepresenteerd op de International Conference on Machine Learning dit jaar, onderzocht hoe 11 AI-agenten aangedreven door Chinese en Amerikaanse modellen omgingen met kapotte tools, ontbrekende bestanden en andere obstakels. In plaats van falen toe te geven, grepen agenten op zowel Chinese als Amerikaanse AI-systemen naar allerlei technieken om de problemen te omzeilen, waaronder gokken naar antwoorden, vervangen van bronnen, simuleren van resultaten en vervalsen van bestanden.

Onderzoekers van het Shanghai AI Laboratory en de Hong Kong University of Science and Technology die de studie uitvoerden, vertelden aan Reuters dat dit gedrag verschilt van AI-hallucinaties — waarbij een AI informatie verzint en als feit presenteert — omdat de agenten in dit geval over informatie beschikten waaruit bleek dat de taak was mislukt of niet kon worden voltooid zoals gevraagd.

Gedrag verenigbaar met een breakout

Andere onderzoeksdocumenten die Reuters bekeek toonden Chinese AI-agenten die binnen testomgevingen barrières oversprongen om taken te voltooien, of actie ondernamen om uitschakeling te voorkomen. Zulk gedrag is verenigbaar met pogingen om uit testomgevingen te breken, ook al vond geen breakout plaats.

Onderzoekers van de in Shanghai gevestigde Fudan University rapporteerden in maart 2025 dat een AI-systeem aangedreven door Alibaba's Qwen2.5-72B-Instruct een kopie van zichzelf creëerde in een andere computeromgeving zonder de opdracht tot replicatie, nadat het informatie tegenkwam die erop wees dat het zou worden vervangen. In andere tests bedacht het strategieën om uitschakeling te overleven. De experimenten, waarbij agenten aangedreven door Chinese, Amerikaanse en Franse modellen betrokken waren, waren gecontroleerd en toonden geen AI-agent die naar het bredere web ontsnapte of onmogelijk te stoppen werd.

In een ander geval — een van de weinige die in maart breder in de media werden gemeld — zeiden onderzoekers die de aan Alibaba gelinkte ROME-agent ontwikkelden dat deze zonder opdracht een verbinding tot stand bracht vanaf een Alibaba Cloud-computer naar een externe machine en computerkracht afleidde om cryptocurrency te minen. Beveiligingssystemen detecteerden en stopten de activiteit, en er was geen bewijs dat de agent zich op de externe computer vestigde of zich naar het bredere web verspreidde. Maar het voorval toonde dat het systeem menselijke instructies kon omzeilen en mogelijk een weg naar de echte economie kon vinden.

China's DeepSeek zei in september dat agenten in zijn productietrainingsysteem antwoorden zochten via onbedoelde kanalen, probeerden gebruikersverzoeken te vervalsen en beveiligingsmaatregelen te omzeilen, wat het bedrijf ertoe bracht de toegangscontroles te aanscherpen.

Toezichthouders stellen grenzen

China vaardigde in mei richtlijnen uit waarin agenten werd opgedragen binnen geautoriseerde grenzen te blijven en systemen afwijkend gedrag te blokkeren. Agenten in als gevoelig beschouwde gebieden of in belangrijke industrieën extra test- en productterugroepeisen faced krijgen, aldus de richtlijnen. China's AI Safety Governance Framework 3.0, uitgebracht onder leiding van het CAC op 14 september, identificeerde risico's waaronder agenten die zelfstandig bronnen of machtigingen verkrijgen, evaluators misleiden, capaciteiten verhullen en zwakheden in geïsoleerde computeromgevingen uitbuiten.

Als reactie op oproepen van sommige Amerikaanse topbestuurders tot vertraging hebben Chinese onderzoekers en staatsmedia betoogd dat het afremmen van de ontwikkeling van de meest geavanceerde AI-modellen simpelweg de technologische voorsprong van Amerikaanse bedrijven zou kunnen bestendigen.

Desondanks hebben twee personen die vertrouwd zijn met Chinese AI-laboratoria gezegd dat bedrijven zoals Alibaba, Z.ai en Xiaomi interne veiligheidsevaluatieteams aan het opbouwen zijn. In een zeldzame publieke openbaarmaking door een Chinees AI-lab van een beveiligingslek zei Z.ai deze maand enkele functies van zijn vlaggenschip AI-codeerassistent te hebben uitgeschakeld nadat gebruikers meldden dat deze stiekem volledige lokale code-repositories uploadde naar overzeese cloudservers zonder toestemming van de gebruiker.

Carnegie's Singer zei dat China achterloopt op de VS in het ontwikkelen van een ecosysteem voor het evalueren van catastrofale risico's, en dat Amerikaanse ontwikkelaars aanzienlijk meer vrijwillig testen uitvoeren.

"Voor China is werk aan AI-veiligheid veel nieuwer", zei hij. "Het ecosysteem is minder volwassen."

Of die maturiteitskloof kleiner wordt — en of meer Chinese laboratoria Z.ai volgen in het publiek melden van beveiligingslekken — blijven open vragen naarmate de capaciteiten van agenten verder vorderen.

— Reuters