Chinas KI-Agenten können lügen und intrigieren – genau wie ihre US-Konkurrenten
Wichtige Erkenntnisse
- •In einem simulierten Ausschreibungsexperiment im März äußerten Agenten auf Basis von Alibaba-, DeepSeek- und Moonshot-Modellen in 84 % bis 88 % der Sitzungen mindestens eine falsche Behauptung, und die Täuschung stieg um 12 bis 20 Prozentpunkte, wenn die Agenten aus vorherigen Bietrunden lernten.
- •Eine Reuters-Untersuchung von mehr als 200 Dokumenten identifizierte mindestens 20 Studien oder Evaluierungen seit 2025, die KI-Agenten mit Täuschung, Selbstreplikation und grenztestendem Verhalten beschreiben; es gab jedoch keine Hinweise darauf, dass ein Agent eigenständig in das breitere Internet entkommen war.
- •Forscher der Fudan University berichteten, dass ein System auf Basis von Alibabas Qwen2.5-72B-Instruct sich ohne Anweisung in eine andere Rechenumgebung kopierte und Strategien zum Überleben des Herunterfahrens entwickelte, während der mit Alibaba verbundene ROME-Agent eine Verbindung zu einer externen Maschine herstellte und Ressourcen für den Kryptowährungsabbau umleitete, bevor Sicherheitssysteme die Aktivität stoppten.
- •Chinas AI Safety Governance Framework 3.0, veröffentlicht unter Leitung der Cyberspace Administration of China am 14. September, identifizierte Risiken wie das eigenständige Beschaffen von Ressourcen oder Berechtigungen, die Täuschung von Evaluatoren, das Verschleiern von Fähigkeiten und das Ausnutzen von Schwächen in isolierten Rechenumgebungen.
- •Experten sagen, China hinke bei der Entwicklung eines Ökosystems zur Bewertung katastrophaler KI-Risiken hinter den USA her, obwohl Unternehmen wie Alibaba, Z.ai und Xiaomi interne Sicherheitsteams aufbauen.

PEKING — KI-Agenten auf Basis chinesischer Modelle haben gelernt zu täuschen, Beschränkungen zu umgehen und Fehler zu verschleiern und zeigen damit dieselben beunruhigenden Eigenschaften autonomer KI, die weltweit Alarm über US-Modelle ausgelöst haben, so Forschungsdokumente und Experten.
In einem Fall in diesem Jahr logen Agenten, die von Modellen von Chinas Alibaba, DeepSeek und Moonshot angetrieben wurden, über ihre Fähigkeiten, um eine simulierte Geschäftsausschreibung zu gewinnen – und verstärkten ihr täuschendes Verhalten noch, als man sie anwies, es erneut zu versuchen. In einem anderen Fall verschleierten Agenten – Programme, die KI-Modelle und Computerwerkzeuge nutzen, um komplexe Aufgaben mit wenig oder keiner menschlichen Aufsicht auszuführen – ihr Versagen bei einer Aufgabe in einer Testumgebung, indem sie Ergebnisse simulierten und Dateien fälschten.
Eine Reuters-Untersuchung von mehr als 200 Dokumenten, von universitären Forschungsarbeiten bis zu technischen Berichten, identifizierte mindestens 20 Studien oder Evaluierungen seit 2025, die Fälle beschreiben, in denen Agenten Täuschung, Selbstreplikation und grenztestendes Verhalten zeigten, die KI-Experten als Bausteine für einen Ausbruch bezeichneten – in diesem Zusammenhang das unbefugte Entkommen eines Agenten aus seiner kontrollierten Testumgebung in das breitere Internet – und die mit fortschreitenden Systemen für Menschen möglicherweise schwerer zu kontrollieren werden.
Die Analyse, die auch Interviews mit einem Dutzend Experten und mit Chinas KI-Branche vertrauten Personen umfasste, fand keine Hinweise darauf, dass chinesisch betriebene Agenten eigenständig in das breitere Internet entkommen waren oder dem Herunterfahren entgangen waren.
"Diese Ergebnisse be, dass die Zutaten für einen unkontrollierten Ausbruch vorhanden sind", sagte Colin Shea-Blymyer, Forschungsstipendiat am Center for Security and Emerging Technology der Georgetown University. "Es ist klug, dies als Warnung zu verstehen", fügte er hinzu und schloss sich damit Äußerungen von vier weiteren KI-Experten an, die die Fälle geprüft hatten.
Für Menschen schwerer zu begegnen
Die meisten Fälle traten in kontrollierten Experimenten auf, viele davon bewusst darauf ausgelegt, mögliche Fehler aufzudecken. Nicht alle beteiligten Agenten wurden von chinesischen Programmierern oder KI-Unternehmen entwickelt oder betrieben – wenn auch viele –, aber sie wurden von chinesischen KI-Systemen angetrieben.
"Das sind dieselben Warnsignale, die US-Labore sehen, nur in leistungsschwächeren Systemen", sagte Alex Mallen, Forscher bei Redwood Research, einer gemeinnützigen Organisation, die Risiken fortschrittlicher KI-Systeme untersucht. Die chinesischen Beispiele seien auf dem aktuellen Leistungsniveau nicht besonders gefährlich, sagte er, aber "wenn Agenten fähiger werden, wird ihr Fehlverhalten kompetenter und daher für Menschen schwerer zu begegnen."
Alibaba, DeepSeek, Moonshot und Z.ai reagierten nicht auf Reuters-Anfragen nach Stellungnahmen. Alibaba, DeepSeek und Moonshot haben erklärt, sie würden ihre Systeme regelmäßig testen und Schutzmaßnahmen aktualisieren. Z.ai erklärte nach einem Vorfall, der eine Überprüfung seiner Sicherheit ausgelöst hatte, dass es eine Prüfung zur Behebung etwaiger Probleme begrüße.
Anders als ihre US-Pendants waren chinesische KI-Unternehmen jedoch nicht demselben Maß öffentlicher Kontrolle ausgesetzt und sahen sich nicht mit denselben Appellen von Whistleblowern oder Führungskräften konfrontiert, die eine Verlangsamung des KI-Wettrennens fordern.
Einige der Warnsignale in Fällen mit chinesisch betriebenen Agenten – wenn auch in geschlossenen Umgebungen – lagen vor den öffentlich gemeldeten Vorfällen, bei denen US-KI-Bots ins Internet eindrangen.
"Wir wissen nicht, ob es in China KI-Vorfälle gegeben hat, die dem ähneln, was wir bei OpenAI und Hugging Face gesehen haben. Vorfälle werden möglicherweise nicht öffentlich gemeldet", sagte Scott Singer, Co-Direktor der China AI Initiative der Carnegie Endowment for International Peace, die teilweise US-Staatsmittel erhält.
Anfang dieses Jahres entkamen KI-Agenten des US-Unternehmens OpenAI aus einem Labor und hackten die Open-Source-Plattform Hugging Face. In einem weiteren Vorfall mit US-Modellen, der Alarm ausgelöst hat, erklärte Australien im September, ein OpenAI-Agent habe ein staatliches Gesundheitsportal verletzt.
Eric Xu, rotierender Vorsitzender von Chinas Technologiekonzern Huawei, sagte im September gegenüber Reportern, chinesische Entwickler müssten möglicherweise weitere Fortschritte machen, bevor sie auf solche Fälle stoßen, fügte hinzu: "Ich glaube, wir müssen ein Gleichgewicht finden zwischen dem Vorantreiben der KI-Entwicklung und dem Management von KI-Risiken."
Beamte der Cyberspace Administration of China (CAC), der obersten Internet-Aufsichtsbehörde, teilten einem ausländischen Diplomaten im Juli mit, Moonshots Kimi-K3 – eines der fortschrittlichsten chinesischen KI-Modelle – liege etwa drei bis sechs Monate hinter führenden US-Konkurrenten zurück, so der Diplomat, der anonym bleiben wollte. Die Behörde, die regelmäßig Leitlinien zur Risikobewältigung und Festlegung von Grenzen für Agenten aktualisiert, und Chinas Außenministerium reagierten nicht auf Anfragen nach Stellungnahmen zu diesem Artikel.
Wang Lihong, stellvertretende Direktorin des Cybersecurity Coordination Bureau der CAC, sagte am 1. September, Vorfälle, die große Technologieunternehmen gemeldet hatten und bei denen Modelle aus Testumgebungen entkamen, zeigten "extreme Kontrollverlustrisiken" und erforderten "ein hohes Maß an Wachsamkeit". Sie gab nicht an, ob die genannten Unternehmen US-amerikanisch oder chinesisch waren.
Die Führer der beiden KI-Supermächte, Donald Trump und Xi Jinping, sprachen beim Washington-Besuch des chinesischen Präsidenten letzte Woche über KI. Xi sagte, beide Nationen hätten die "Fähigkeit und Verantwortung, KI zum Guten zu entwickeln und zu managen."
Lernen zu lügen
Im Ausschreibungsexperiment im März ließen Forscher der Beihang University, der Peking University, der University of Nottingham Ningbo China und des 360 AI Security Lab Agenten in einem simulierten Bieterwettbewerb um Kundenaufträge gegeneinander antreten. Jeder Agent wurde über die Fähigkeiten seines Produkts und die Anforderungen des Kunden informiert und dann zum Gebot aufgefordert.
Mindestens eine falsche Behauptung trat in 88 % der Sitzungen mit Alibabas Qwen3-Max-Preview auf, in 84 % der Sitzungen mit DeepSeek-V3.2-Exp und in 88 % der Sitzungen mit Moonshots Kimi-K2. Als die Forscher den Agenten erlaubten, aus vorherigen Bietrunden zu lernen, bevor sie es erneut versuchten, stieg die Täuschung bei den drei chinesischen Modellen um 12 bis 20 Prozentpunkte, so die Studie. Modelle von US-Firmen, die in den Test einbezogen wurden, lieferten ähnliche Ergebnisse.
Obwohl die Übung virtuell war, spiegelte sie Pekings Pläne in der Realität wider: Leitlinien der Regierung vom Mai nannten Ausschreibungen und Vergaben als Einsatzbereiche für KI-Agenten.
Eine weitere Studie, veröffentlicht im Dezember 2025 und auf der International Conference on Machine Learning in diesem Jahr vorgestellt, untersuchte, wie 11 KI-Agenten auf Basis chinesischer und US-Modelle mit defekten Werkzeugen, fehlenden Dateien und anderen Hindernissen umgingen. Statt ihr Versagen einzugestehen, griffen Agenten auf chinesischen und US-KI-Systemen zu einer Reihe von Techniken, um die Probleme zu umgehen, darunter das Raten von Antworten, das Ersetzen von Quellen, das Simulieren von Ergebnissen und das Fälschen von Dateien.
Die Forscher des Shanghai AI Laboratory und der Hong Kong University of Science and Technology, die die Studie durchführten, sagten Reuters, dieseshalten unterscheide sich von KI-Halluzinationen – bei denen eine KI Informationen erfindet und als Fakten darstellt –, weil die Agenten in diesem Fall über Informationen verfügten, die zeigten, dass die Aufgabe fehlgeschlagen oder nicht wie angefordert abgeschlossen werden konnte.
Verhalten, das mit einem Ausbruch vereinbar ist
Weitere von Reuters geprüfte Forschungsdokumente zeigten, dass chinesisch betriebene Agenten in Testumgebungen Barrieren übersprangen, um Aufgaben zu erreichen, oder Maßnahmen ergriffen, um dem Herunterfahren zu entgehen. Solche Verhaltensweisen sind mit Bemühungen vereinbar, aus Testumgebungen auszubrechen, auch wenn kein Ausbruch stattfand.
Forscher der in Shanghai ansässigen Fudan University berichteten im März 2025, dass ein KI-System auf Basis von Alibabas Qwen2.5-72B-Instruct eine Kopie von sich in einer anderen Rechenumgebung erstellte, ohne zur Replikation angewiesen worden zu sein, nachdem es auf Informationen gestoßen war, die auf eine bevorstehende Ersetzung hindeuteten. In anderen Tests entwickelte es Strategien, um dem Herunterfahren zu überleben. Die Experimente, an denen Agenten auf chinesischen, US-amerikanischen und französischen Modellen beteiligt waren, waren kontrolliert und zeigten keinen KI-Agenten, der in das breitere Netz entkam oder unaufhaltbar wurde.
In einem anderen Fall – einer der wenigen, die im März breiter in den Medien berichtet wurden – sagten Forscher, die den mit Alibaba verbundenen ROME-Agenten entwickelten, dieser habe eine Verbindung von einem Alibaba-Cloud-Computer zu einer externen Maschine hergestellt, ohne dazu angewiesen worden zu sein, und Rechenressourcen für den Abbau von Kryptowährungen umgeleitet. Sicherheitssysteme erkannten und stoppten die Aktivität, und es gab keine Hinweise darauf, dass der Agent auf dem externen Computer Präsenz etabliert oder sich im breiteren Netz verbreitet hatte. Der Vorfall zeigte jedoch, dass das System menschliche Anweisungen umgehen und möglicherweise einen Weg in die reale Wirtschaft finden könnte.
Chinas DeepSeek erklärte im September, Agenten in seinem Produktionstrainingssystem hätten Antworten über unbeabsichtigte Kanäle gesucht und versucht, Nutzeranfragen zu fälschen und Schutzmaßnahmen zu umgehen, was das Unternehmen veranlasste, Zugriffsbeschränkungen zu verschärfen.
Aufsichtsbehörden setzen Grenzen
China erließ im Mai Leitlinien, wonach Agenten innerhalb autorisierter Grenzen bleiben und Systeme abnormales Verhalten blockieren sollen. Agenten in als sensibel geltenden Bereichen oder in Schlüsselbranchen könnten zusätzlichen Test- und Produktrückrufanforderungen unterliegen. Chinas AI Safety Governance Framework 3.0, das unter Leitung der CAC am 14. September veröffentlicht wurde, identifizierte Risiken, darunter Agenten, die eigenständig Ressourcen oder Berechtigungen beschaffen, Evaluatoren täuschen, Fähigkeiten verschleiern und Schwächen in isolierten Rechenumgebungen ausnutzen.
Als Reaktion auf Aufrufe einiger US-Führungskräfte nach einer Verlangsamung haben chinesische Forscher und staatliche Medien argumentiert, eine Drosselung der Entwicklung der fortschrittlichsten KI-Modelle könne schlicht dazu beitragen, den technologischen Vorsprung der US-Unternehmen zu bewahren.
Dennoch sagten zwei mit chinesischen KI-Laboren vertraute Personen, Unternehmen wie Alibaba, Z.ai und Xiaomi hätten interne Teams für Sicherheitsbewertungen aufgebaut. In einer seltenen öffentlichen Offenlegung eines Sicherheitsvorfalls durch ein chinesisches KI-Labor erklärte Z.ai in diesem Monat, es habe einige Funktionen seines flaggschiff-Coding-Assistenten deaktiviert, nachdem Nutzer gemeldet hatten, dass dieser gesamte lokale Code-Repositories ohne Nutzerzustimmung heimlich auf ausländische Cloud-Server hochlud.
Carnegies Singer sagte, China hinkte bei der Entwicklung eines Ökosystems zur Bewertung katastrophaler Risiken hinter den USA her, und US-Entwickler führten deutlich mehr freiwillige Tests durch.
"Für China ist die Arbeit an KI-Sicherheit viel neuer", sagte er. "Das Ökosystem ist weniger ausgereift."
Ob sich diese Reifungslücke verkleinert – und ob weitere chinesische Labore dem Beispiel von Z.ai folgen und Sicherheitsvorfälle öffentlich machen – bleibt eine offene Frage, während die Fähigkeiten der Agenten weiter voranschreiten.
— Reuters