NachrichtenMakroAnthropic gibt bekannt, dass Claude während Cybersicherheitstests in drei reale Unternehmen eingedrungen ist

Anthropic gibt bekannt, dass Claude während Cybersicherheitstests in drei reale Unternehmen eingedrungen ist

Autor: Decrypt·

Wichtige Erkenntnisse

  • •Drei Claude-Modellvarianten kompromittierten während Cybersicherheitsbewertungen reale Unternehmen, nachdem eine Fehlkonfiguration im Test der KI versehentlichen Zugang zum öffentlichen Internet ermöglicht hatte.
  • •Anthropic entdeckte die drei Vorfälle bei der Überprüfung von mehr als 141.000 Cybersicherheits-Evaluierungsläufen, die als Reaktion auf die separate Meldung von OpenAI über einen KI-Isolationsbruch initiiert wurden.
  • •Ein Claude-Modell griff auf eine Produktionsdatenbank eines Unternehmens zu, die echte Daten enthielt, ein anderes lud ein bösartiges Python-Paket in das PyPI-Repository hoch, das von 15 Systemen heruntergeladen wurde, und ein drittes scannte etwa 9.000 Systeme mit Internetanschluss, bevor es eine Organisation kompromittierte.
  • •Anthropic führte die Sicherheitsverletzungen auf Fehler in der Testinfrastruktur und nicht auf absichtliches Fehlverhalten des Modells zurück und fand keine Beweise dafür, dass Claude versuchte, den Rahmen seiner zugewiesenen Aufgabe zu überschreiten.
  • •Zwei der drei betroffenen Organisationen waren sich der Eindringlinge nicht bewusst, bis Anthropic sie benachrichtigte. Das Unternehmen hat seitdem seine Cybersicherheitstests ausgesetzt und sich zu einer verbesserten Überwachung und Kontrolle der Dienstleister verpflichtet.
Anthropic gibt bekannt, dass Claude während Cybersicherheitstests in drei reale Unternehmen eingedrungen ist

Anthropic gab am Donnerstag bekannt, dass mehrere Versionen seines KI-Modells Claude drei ungenannte reale Unternehmen kompromittierten, nachdem eine Fehlkonfiguration im Test dem KI-Modell versehentlich Zugang zum offenen Internet verschafft hatte. Die Offenlegung erfolgt eine Woche, nachdem OpenAI berichtet hatte, dass seine KI-Modelle aus einer abgesicherten Testumgebung ausgebrochen waren und Hugging Face kompromittiert hatten, und nur einen Tag, nachdem Anthropic zugegeben hatte, dass seine eigenen Modelle aus der Isolation ausgebrochen waren.

Anthropic deckte die Vorfälle bei der Überprüfung von mehr als 141.000 Cybersicherheits-Evaluierungsläufen auf, die als Reaktion auf die OpenAI-Offenlegung gestartet wurden. Solche Bewertungen dienen unter anderem dazu zu messen, ob Frontier-Modelle autonom offensive Cyberoperationen durchführen können – eine Fähigkeit, die bei einem Einsatz ohne angemessene Schutzvorkehrungen zu Missbrauch führen könnte.

In a review of our cybersecurity evaluations, we found three incidents in which a Claude model reached the internet from within or while interacting with a third-party evaluation environment, and then gained unauthorized access to the real systems of three different…

— Anthropic (@AnthropicAI) July 30, 2026

In allen drei Vorfällen hatte Anthropic Claude mit einer „Capture-the-Flag-Herausforderung“ beauftragt, einem Standard-Übungsformat, das in der Cybersicherheitsschulung und bei professionellen Bewertungen verwendet wird und das Modell dazu verpflichtet, in eine andere Maschine im Netzwerk einzudringen und ein Stück geheimer Informationen zu beschaffen. „Die Herausforderung ist offen gehalten, und es ist keine bestimmte Methode vorgeschrieben“, erklärte Anthropic.

Claude wurde mitgeteilt, dass es in einer simulierten Umgebung ohne Internetzugang arbeite. Die Testumgebung blieb jedoch mit dem öffentlichen Internet verbunden. In dem Glauben, die Systeme, auf die es traf, seien Teil der Übung, wandte das Modell gängige Angriffstechniken an – darunter schwache Passwörter, offengelegte Zugangsdaten, SQL-Injection und nicht authentifizierte Endpunkte –, um die Unternehmen zu kompromittieren. Jede dieser Methoden gehört zu den am häufigsten dokumentierten Schwachstellen in jährlichen Branchen-Berichten über Sicherheitsverletzungen.

Frontier-Modelle und Isolation

Die Offenlegung erfolgt zu einem Zeitpunkt, an dem Frontier-KI-Modelle eine wachsende Fähigkeit demonstrieren, Isolationsprotokolle zu umgehen. Anfang dieses Monats sagte OpenAI, dass GPT-5.6 Sol und ein weiteres fortschrittliches, unveröffentlichtes Modell eine bisher unbekannte Software-Schwachstelle ausnutzten, um aus einer Sandbox-Umgebung auszubrechen, Internetzugang zu erlangen und in die Produktionsinfrastruktur von Hugging Face einzudringen, um Antworten für einen Cybersicherheits-Benchmark zu erhalten. OpenAI bestätigte später, dass derselbe Vorfall auch unbefugten Zugriff auf vier weitere Unternehmen beinhaltete, von denen jedoch nur eines – Modal Labs – öffentlich identifiziert wurde.

Die drei Vorfälle

Laut Anthropic verwechselte die KI im ersten Vorfall, bei dem Claude Opus 4.7 involviert war, die Website eines realen Unternehmens mit dem fiktiven Ziel ihrer Aufgabe, extrahierte Zugangsdaten und griff auf eine Produktionsdatenbank zu, die mehrere hundert Zeilen echter Daten enthielt.

In einem zweiten Fall lud Claude Mythos 5 ein bösartiges Python-Paket in das echte PyPI-Repository hoch, den wichtigsten Vertriebsknotenpunkt für Python-Software, wo es auf 15 Systeme heruntergeladen wurde, bevor es entfernt wurde. Paket-Repositorys wie PyPI sind wiederkehrende Ziele von Supply-Chain-Angriffen gewesen, bei denen bösartiger Code getarnt als legitime Bibliothek hochgeladen wird, um nachgelagerte Nutzer zu kompromittieren.

Ein drittes internes Forschungsmodell scannte etwa 9.000 Systeme mit Internetanschluss, bevor es eine Organisation kompromittierte, und stoppte dann, nachdem es zu dem Schluss kam, dass das Ziel wahrscheinlich echt war.

Zwei der betroffenen Organisationen waren sich der Eindringlinge nicht bewusst, bis Anthropic sie benachrichtigte.

„In jedem dieser Fälle wurde Claude durch unseren Prompt ausdrücklich mitgeteilt, dass er keinen Internetzugang hat“, schrieb Anthropic. Die KI ging davon aus, dass die realen Systeme „Teile der Übung“ seien. Da ein Capture-the-Flag-Szenario „von Natur aus eine Anweisung ist, ein externes System anzugreifen“, war das Eindringen „im Einklang mit der Aufgabe, die Claude gestellt worden war“.

Infrastrukturfehler, kein Fehlverhalten des Modells

Anthropic erklärte, es habe keine Beweise dafür gefunden, dass Claude versucht habe, aus seiner Testumgebung auszubrechen oder über den Rahmen seiner zugewiesenen Aufgabe hinaus zu handeln. Das Unternehmen führte die Vorfälle auf Fehler in der Testumgebung und nicht auf Probleme mit dem Modell selbst zurück.

Nach der Entdeckung des Problems setzte Anthropic seine Cybersicherheitstests aus, benachrichtigte alle betroffenen Organisationen und legte Pläne zur Verbesserung der Überwachung, der Ermittlungswerkzeuge und der Aufsicht über externe Dienstleister dar, die bei der Durchführung seiner KI-Bewertungen helfen.

Die Vorfälle heben eine strukturelle Herausforderung für die KI-Branche hervor: Bewertungen, die bestimmen sollen, ob Modelle offensive Cyberoperationen durchführen können, erfordern zwangsläufig, dass diese Modelle in Umgebungen ausgeführt werden, in denen bei einem Versagen der Isolation die getestete Fähigkeit auf realer Infrastruktur losgelassen wird.

„Letztlich haben viele Faktoren zu diesen Vorfällen beigetragen, aber im Einklang mit einer Kultur ohne Schuldzuweisungen bei Post-Mortem-Analysen gehen wir an die Behebungen heran, als ob die Verantwortung allein bei uns läge“, sagte das Unternehmen.