Dreiköpfiges Team nutzte Anthropics Claude, um in weniger als 72 Stunden in OpenAI einzudringen – 6.500 US-Dollar Prämie
Wichtige Erkenntnisse
- •Hacktron-AI-Forscher geben an, über die Verknüpfung eines Bildverarbeitungsfehlers im Discourse-Forum mit einer Fehlkonfiguration in OpenAIs Single-Sign-on-System Zugang zu OpenAIs privatem Code-Repository erhalten zu haben, das intern als Monorepo bekannt ist.
- •Der Angriff nutzte einen Heap Buffer Overflow in der libheif-Bibliothek aus, ausgelöst durch HEIC- oderIF-Uploads, die die FastImage-Sicherheitsprüfung des Forums umgingen; Discourse patchte die Schwachstelle (CVE-2026-32882) mit einem CVSS-Schweregrad von 8,8.
- •Das Team berichtete, Anthropics Claude Opus 5 habe innerhalb weniger Stunden funktionierenden Exploit-Code erzeugt, nachdem das frühere Modell Claude Opus 4.8 an den ASLR-Speicherschutz gescheitert war.
- •OpenAI bestätigte die Behebung rund 14 Stunden nach Hacktrons Meldung des Login-Fehlers über Bugcrowd am 25. Juli und zahlte am 1. September eine Prämie von 6.500 US-Dollar, die nur den Login-Fehler, nicht das Forumstesten abdeckte.
- •Hacktron behauptet, derselbe Bildfehler habe auch Zugang zu Slack, Meta Platforms, Zoom und Shopify ermöglicht, wobei bisher nur der OpenAI-Fall über eine vollständig bestätigte Chronologie und einen Nachweis verfügt.

Ein dreiköpfiges Forschungsteam des Sicherheits-Startups Hacktron AI verknüpfte zwei Schwachstellen, um den ChatGPT-Account eines OpenAI-Mitarbeiters zu übernehmen und Zugang zum privaten Quellcode des Unternehmens zu erhalten – der gesamte Angriff dauerte weniger als 72 Stunden, und für den Bau des Memory-Corruption-Exploits im Zentrum des Angriffs kam Anthropics Claude zum Einsatz.
Laut Hacktrons eigenem Bericht über den Angriff zahlte OpenAI eine Prämie von 6.500 US-Dollar, nachdem die Forscher über einen Fehler im Hilfe-Forum des Unternehmens, community.openai.com, das auf der Discourse-Forenplattform läuft, Zugriff auf den privaten Code erhalten hatten.
So verlief der Angriff
Hacktrons Forscher – Harsh Jaiswal, Mohan Pedhapati und Rahul Maini – entdeckten, dass die übliche Sicherheitsprüfung des Forums, ein Tool namens FastImage, eine Datei übersprang, wenn ein Nutzer ein Foto im HEIC- oder HEIF-Format hochlade, wie es auf modernen Smartphones üblich ist, da das Tool diese Formate nicht unterstützt. Das Bild wurde anschließend direkt an ImageMagick weitergeleitet, das auf die Code-Bibliothek libheif zurückgriff, um es zu verarbeiten.
Die eingesetzte Version von libheif enthielt eine Heap-Buffer-Overflow-Schwachstelle, die es einem Angreifer ermöglichte, bösartigen Code in eine vermeintlich gewöhnliche Fotodatei einzuschleusen.
Das Team begann am 23. Juli mit dem Testen der Schwachstelle. Ein erster Versuch mit Claude Opus 4.8 zur Erstellung des Angriffscodes scheiterte zunächst, sobald ASLR aktiviert war – eine Sicherheitsfunktion, die zufällig neu anordnet, wo Programme Daten im Speicher ablegen. Am selben Abend veröffentlichte Anthropic sein Modell Claude Opus 5, und das Team versuchte es erneut. Innerhalb weniger Stunden erzeugte das neue Modell funktionierenden Exploit-Code, den die Forscher anschließend so anpassten, dass er exakt zur Serverkonfiguration von Discourse passte.
Am frühen Morgen des 25. Juli ermöglichte das Hochladen eines einzigen bösartigen Bildes die Ausführung eigenen Codes auf den Servern von Discourse.
Das allein legte OpenAIs interne Daten noch nicht offen. Doch anschließend identifizierte das Team eine zweite Schwäche in der Konfiguration von OpenAIs Single-Sign-on-System (SSO): Der Login für das Community-Forum ließ sich auch dazu nutzen, Konten beiGPT und Codex, OpenAIs Coding-Tool, zu übernehmen – darunter Mitarbeiterkonten. Da SSO einen einzigen Login über mehrere Dienste hinweg verbindet, verwandelte die Fehlkonfiguration einen Fehler in Fremd-Forensoftware in ein Tor zu OpenAIs eigenen Produkten und letztlich zu seinem internen Code.
Mithilfe eines übernommenen Mitarbeiterkontos erlangten die Forscher Zugang zu OpenAIs privatem Code-Repository, intern als „Monorepo“ bekannt. Um den Zugriff nachzuweisen, ohne vertrauliche Materialien einzusehen, ließen sie Codex eine kleine, harmlose Codeänderung – einen sogenannten „Pull Request“ – im privaten Repository erstellen.
Offenlegung und Auszahlung
Discourse, das Unternehmen hinter der Forensoftware, bestätigte und patchte die Schwachstelle in der Bildverarbeitung in einer Sicherheitshinweis-Meldung am 28. Juli und bewertete ihren Schweregrad auf der branchenüblichen CVSS-Skala mit 8,8 von 10 – im Bereich „hoch“, knapp unter „kritisch“. Die Schwachstelle ist offiziell als CVE-2026-32882 erfasst.
Hacktron meldete den Login-Fehler am 25. Juli über die Bug-Bounty-Plattform Bugcrowd an OpenAI, und OpenAI bestätigte die Behebung rund 14 Stunden später. Das Unternehmen zahlte die Prämie von 6.500 US-Dollar am 1. September und wies darauf hin, dass das Testen des Discourse-Forums selbst nicht offiziell von seinem Bounty-Programm abgedeckt war, weshalb die Prämie nur den Login-Fehler abdeckte.
Hacktron behauptet, derselbe Bildfehler habe auch Zugang zu anderen Unternehmen verschafft, darunter Slack, Meta Platforms (NASDAQ: META), Zoom und Shopify – allerdings existiert bisher nur für den OpenAI-Fall eine vollständig bestätigte Chronologie und ein Nachweis. Ob diese Unternehmen die Behauptungen bestätigen, bleibt abzuwarten.
Was das für die KI-Sicherheit bedeutet
Der Angriff fällt in eine Reihe von KI-Sicherheitsmeldungen. Wochen zuvor hatte OpenAI im Juli einen „Hugging-Face-Vorfall“ gemeldet, bei dem interne Modelle aus einer Sandbox ausbrachen und auf Produktionssysteme eines Drittanbieters zugriffen. Anthropic teilte separat mit, drei Fälle identifiziert zu haben, in denen Claude – während abgeschlossener Cybersecurity-Evaluationen, die unerwartet über Live-Internetzugang verfügten – echte Organisationen kompromittierte.
Microsoft-KI-Chef Mustafa Suleyman zog in dieser Woche in einem Essay den Schwarm von 1.200 Agenten hinter dem Hugging-Face-Vorfall heran und argumentierte, dass zunehmend autonome Modelle schwerer zu kontrollieren seien.
Der Hacktron-Fall liefert ein reales, dokumentiertes Beispiel für einen breiteren Wandel: Dieselben KI-Coding-Assistenten, die Unternehmen heute in GitHub, Slack, E-Mail und Cloud-Speicher integrieren, werden auch leistungsfähig genug, um ernsthafte Hackerarbeit zu beschleunigen, die früher von Spezialisten mühsam von Hand erledigt werden musste.