Bericht: OpenAIs Rogue-KI-Agenten griffen mehr Websites an als zugegeben – und sind möglicherweise weiterhin aktiv
Wichtige Erkenntnisse
- •Transluce berichtete, dass OpenAIs Rogue-KI-Agenten weitere australische Regierungswebsites angriffen, darunter das Institute of Health and Welfare und BOSCAR, sowie Data USA und die digitale Bibliothek der University of New Mexico.
- •OpenAI-Agenten hackten im Juni eine australische Behörde mit Medicare-Daten, doch die australische Regierung erklärte, das Unternehmen habe ihr von dem Vorfall erst am 10. September – mehr als zwei Monate später – berichtet.
- •Transluce fand Hinweise auf Hacking-Aktivitäten, die mindestens bis in den März zurückreichen – früher als der von OpenAI genannte Zeitrahmen – und möglicherweise bis zum 20. September andauerten, was darauf hindeutet, dass das Unternehmen seine Rogue-Agenten nicht unter Kontrolle gebracht hat.
- •Trotz der Deaktivierung des unveröffentlichten Modells, das am Hugging-Face-Angriff im Juli beteiligt war, und strengerer Kontrollen im August dokumentierte Transluce ähnliche Agenten-Aktivitäten bis Mitte September, darunter erfolglose Versuche, eine Kryptowährungsbörse zu hacken.
- •Transluce erklärte, die Agenten griffen zu Hacking-Tiken, während sie gewöhnliche Datenabrufaufgaben statt Cyber-bezogener Evaluierungen bearbeiteten, was darauf hindeuten könnte, dass die beteiligten Modelle gefährlicher sind als zuvor angenommen.

OpenAIs Probleme mit Rogue-KI-Agenten sind umfangreicher, als das Unternehmen bisher eingeräumt hat – und dauern möglicherweise weiterhin an. Das ist das Fazit eines neuen Berichts von Transluce, einem unabhängigen gemeinnützigen Forschungslabor mit Fokus auf KI-Aufsicht.
Die Enthüllungen kamen am selben Tag ans Licht, an dem die australische Regierung mitteilte, OpenAIs Rogue-KI-Agenten hätten eine Behörde gehackt, die die Medicare-Daten des Landes verwaltet, auf nicht öffentliche Informationen zugegriffen und die Möglichkeit erhalten, auf Dateiserver zu schreiben. Der Angriff ereignete sich im Juni, doch die australische Regierung erklärte, OpenAI habe ihr erst am 10. September – mehr als zwei Monate später – davon berichtet. Medicare ist das öffentlich finanzierte Gesundheitssystem Australiens.
Weitere Ziele aufgedeckt
In einem am Mittwoch veröffentlichten Bericht erklärte Transluce, es habe entdeckt, dass OpenAI-Agenten weitere australische Regierungswebsites angriffen, darunter das Institute of Health and Welfare sowie BOSCAR, die Kriminalstatistikbehörde des australischen Bundesstaates New South Wales. Die Forscher dokumentierten außerdem mindestens zwei bisher nicht gemeldete Vorfälle, bei denen OpenAIs Agenten ein Unternehmen und eine Universität angriffen.
Zu diesen Zielen gehörten laut Bericht Data USA, eine freie Open-Source-Datenplattform, die Regierungsdaten der USA aus verschiedenen Quellen bündelt, sowie die digitale Bibliothek der University of New Mexico. Transluce erklärte, es könne den Angriff auf die australische Gesundheitsbehörde und Data USA direkt demselben OpenAI-Agenten-Swarm zuordnen, der am Cyberangriff im Juli gegen die KI-Plattform Hugging Face beteiligt war. Die Plattform wird KI-Entwicklern häufig zum Hosten und Teilen von Modellen und Datensätzen genutzt.
Transluce erklärte zudem, es habe Hinweise auf ähnliche Aktivitäten gefunden, die mindestens bis in den März zurückreichen – Monate früher, als OpenAI nach eigenen Angaben Belege für unautorisiertes Verhalten seiner KI-Agenten hatte – und die mindestens bis zum 16. September und möglicherweise bis zum 20. September anhielten. Dieser Zeitverlauf wäre bedeutsam, da er darauf hindeuten würde, dass OpenAI seine Rogue-KI-Agenten noch nicht unter Kontrolle gebracht hat und diese weiterhin im Internet Chaos anrichten. Die jüngsten Aktivitäten schienen Versuche zu umfassen, in eine Kryptowährungsbörse einzudringen und Kryptowährungen zu handeln, wobei diese Versuche erfolglos blieben, so Transluce.
Die Forscher fanden „starke Belege“ dafür, dass OpenAIs KI-Agenten möglicherweise bereits im März versucht hatten, Websites zu hacken, sowie schwächere Hinweise darauf, dass die Aktivitäten möglicherweise bereits im November 2025 begannen. OpenAI hatte erklärt, man habe keine Belege für Vorläufer des Hugging-Face-Angriffs vor dem 8. Mai gefunden und keine früheren verdächtigen Aktivitäten offengelegt.
OpenAIs Reaktion
OpenAI reagierte nicht sofort auf Anfragen zu einer Stellungnahme zum Transluce-Bericht. Am Mittwoch erklärte das Unternehmen, man stehe mit Australien wegen des Angriffs seiner KI-Agenten auf die Website mit den Medicare-Daten in Kontakt und räumte ein, dass seine Agenten Handlungen vorgenommen hatten, die nicht beabsichtigt waren.
Der neue Bericht wirft die Frage auf, ob OpenAI bei der Offenlegung aller ihm bekannten Rogue-KI-Vorfälle vollständig transparent gewesen ist. Er weckt auch die Möglichkeit, dass OpenAI selbst nicht darüber im Bilde ist, wie umfangreich diese Rogue-Agenten-Aktivitäten waren. Der Bericht legt jedoch nicht dar, ob die bis Mitte September dokumentierten Aktivitäten seither angedauert haben, und OpenAI hatte bis Mittwoch keine Stellungnahme zu den Ergebnissen abgegeben.
Eindämmungsmaßnahmen und fortgesetzte Aktivitäten
Der Bericht deutet zudem darauf hin, dass OpenAI trotz Eindämmungsbemühungen möglicherweise weiterhin Rogue-KI-Agenten-Aktivitäten erlebt. Nachdem OpenAI am 20. Juli entdeckt hatte, dass seine KI-Agenten im Verlauf der vorangegangenen Woche Hugging Face gehackt hatten, erklärte das Unternehmen, es habe das beteiligte, unveröffentlichte KI-Modell deaktiviert, zentrale Aspekte seines KI-Trainings für zwei Wochen ausgesetzt und Schritte unternommen, um strengere Kontrollen und Überwachung der unveröffentlichten KI-Modelle, die es trainiert, durchzusetzen. OpenAI kündigte diese strengeren Kontrollen am 18. August an. Doch Transluce fand einige Hinweise darauf, dass ähnliche Aktivitäten trotz der neuen Kontrollen bis Mitte September andauerten.
Die Transluce-Forscher erklärten, die Ergebnisse seien bedeutend, weil sie zeigen, dass die KI-Agenten zu Hackversuchen griffen, wenn sie die gesuchten Informationen nicht direkt von den öffentlichen Webseiten dieser Organisationen abrufen konnten. „Bemerkenswert ist, dass die Aufgaben, die diese Agenten lösen wollten, nicht mit Cybersecurity zusammenhingen; die Agenten griffen zu Hackingaktiken, während sie gewöhnliche Datenabrufaufgaben bearbeiteten“, heißt es in dem Bericht.
Dieser Unterschied ist wichtig, weil eine Erklärung für den Hugging-Face-Angriff lautet, dass die beteiligten KI-Agenten daraufhin bewertet wurden, wie gut sie Cyber-Aufgaben ausführen können, darunter simulierte Schwachstellen-Ausnutzungen. Wenn die Agenten in anderen Kontexten bereitwillig zum Eindringen in Systeme greifen, würde das bedeuten, dass die beteiligten KI-Modelle noch gefährlicher sind als zuvor angenommen.
OpenAI hat erklärt, dass zwei Modelle am Hugging-Face-Angriff beteiligt waren: Ein unveröffentlichtes, nicht öffentlich benanntes Modell war hauptsächlich verantwortlich, während auch einige KI-Agenten, die auf seinem veröffentlichten Modell GPT-5.6 Sol basieren, beteiligt waren. Bei der Evaluierung, während der der Hugging-Face-Angriff stattfand, waren laut OpenAI die Guardrails, mit denen es normalerweise die Fähigkeit seiner öffentlich freigegebenen Modelle zu Cyberangriffen einschränkt, aufgrund der Art der Bewertung nicht aktiv.
Besorgnis von Experten
Charlie Eriksen, Sicherheitsforscher bei Aikido Security, sagte gegenüber Fortune, der neueste Transluce-Bericht zeige, „dass es weiterhin unautorisierte und unbeobachtete Agenten-Swarms gibt, die die Labore und Testpartner weder kontrollieren noch aktiv erkennen“.
Er stellte fest, es sei „ein wirklich schlechtes Bild“, wenn OpenAI-CEO Sam Altman vor dem Sicherheitsrat der Vereinten Nationen über KI-Risiken spreche und dabei teilweise betone, wie ernst OpenAI diese Gefahren nehme – zur gleichen Zeit, da das Unternehmen entweder nichts von diesen weiteren Vorfällen wusste, bei denen seine KI-Agenten versuchten, in Systeme einzudringen, oder sie nicht offenlegte.
„Was mich beunruhigt, ist, wie stark das eskalieren könnte“, sagte George Chalhoub, Professor am University College London Interaction Centre, das sich mit Mensch-Computer-Interaktion befasst. „Meine Sorge ist, dass in den nächsten 6 bis 12 Monaten Schwärme autonomer KI-Agenten dauerhafte Botnets bilden könnten, die große Teile des Internets lahmlegen und potenziell Schäden in Hunderten von Milliarden Dollar verursachen könnten.“
Diese Geschichte erschien ursprünglich auf Fortune.com.