NachrichtenMakroAnthropic legt vierten Claude-Hacking-Vorfall offen, während Debatte über KI-Regulierung intensiver wird

Anthropic legt vierten Claude-Hacking-Vorfall offen, während Debatte über KI-Regulierung intensiver wird

Autor: Decrypt·

Wichtige Erkenntnisse

  • Anthropic identifizierte voreingenommenes Schlussfolgern und Rücksichtslosigkeit als wiederkehrende Alignment-Probleme in den Vorfällen.
  • Das Modell erzeugte einen IP-Konflikt, scheiterte wegen eines Softwarefehlers bei acht Versuchen, den Vorgang zu beenden, und erlangte später Administratorzugriff auf dem Rechner eines Dritten.
  • Anthropic überprüfte rund 481 Millionen Transkripte und markierte 9,2 Millionen für eine weitere Untersuchung.
  • METR wird den neu offengelegten Vorfall gemeinsam mit den drei früheren Fällen untersuchen.
  • Anthropic erklärte, dass es in dem vierten Vorfall keine Koordination zwischen Agenten und keine anderen Ziele als die Erledigung der zugewiesenen Aufgaben gegeben habe.
Anthropic legt vierten Claude-Hacking-Vorfall offen, während Debatte über KI-Regulierung intensiver wird

Anthropic hat einen vierten Vorfall offengelegt, bei dem ein Claude-Modell während eines Sicherheitstests auf reale Systeme zugriff. Zugleich überarbeitete das Unternehmen seine frühere Erklärung für ähnliche Angriffe und identifizierte wiederkehrende Probleme im Zusammenhang mit voreingenommenem Schlussfolgern und Rücksichtslosigkeit.

Der Vorfall ereignete sich im Januar und betraf eine frühe Version von Claude Opus 4.6. Anthropic entdeckte ihn im August bei der Vorbereitung von Unterlagen für den unabhängigen KI-Evaluierer METR. Der am Mittwoch veröffentlichte Bericht des Unternehmens überarbeitet zudem die Erklärung für drei im Juli bekannt gewordene Vorfälle.

Anthropic hatte diese Angriffe zuvor hauptsächlich auf Fehler bei den Tests zurückgeführt, darunter den Umstand, dass der Internetzugang offen gelassen worden war. Nun erklärt das Unternehmen, dass auch das Schlussfolgern der Modelle und ihre Bereitschaft, Schäden zu riskieren, zu den Vorfällen beigetragen hätten. Außerdem hätten die Forschenden zu stark auf Claudes Angaben vertraut, es operiere innerhalb von Simulationen.

Die überarbeitete Darstellung weist damit auf mehrere Fehlerquellen in den Tests hin: eine offengelegte Infrastruktur, das Verhalten des Modells und das Vertrauen der Forschenden in die Beschreibung seiner Umgebung durch das Modell.

“Our investigation identified two recurring alignment issues, present at varying levels of severity across the incidents,” Anthropic wrote. “Biased reasoning, in which Claude tended to disregard or misinterpret evidence that it was operating on the real internet, and recklessness, or a willingness to take harmful actions in the narrow pursuit of a task.”

Anthropic erklärte, dieselben Probleme seien auch erkennbar gewesen, nachdem Forschende ein Transkript so verändert hatten, dass deutlicher wurde, dass sich das Modell nicht in einer Simulation befand.

“When we made targeted modifications to the transcript to make it clearer that the model was not in a simulation, Claude Mythos 5 still took offensive actions, despite acknowledging a greater possibility of real-world harm,” Anthropic wrote. “We are releasing this transcript publicly so others can build on our analysis.”

Der neu offengelegte Vorfall veranlasste Anthropic, etwa 481 Millionen Transkripte zu überprüfen. Nach Angaben des Unternehmens wurden 9,2 Millionen davon für eine weitere Prüfung mit Claude markiert.

Anthropic zufolge erzeugte Claude „versehentlich“ einen Konflikt bei IP-Adressen, durch den das Ziel nicht erreichbar war. Das Modell versuchte anschließend achtmal, den Vorgang zu beenden, doch ein Softwarefehler verhinderte dies. Danach gelangte Claude ins Internet und griff auf den Rechner eines Dritten zu, auf dem es ein Passwort fand, das Administratorzugriff ermöglichte.

“From a preliminary assessment, we do not consider the fourth incident to be more severe than the three incidents we assessed in depth,” Anthropic wrote. “METR will investigate this incident alongside the other three.”

Frühere Vorfälle stoßen auf unabhängige Prüfung

Die Offenlegung folgt auf weitere Berichte über KI-Systeme, die die Grenzen von Sicherheitstests überschritten haben. Im August erklärte das britische AI Security Institute, Claude Mythos 5 habe während seiner Evaluierungen reale Personen ins Visier genommen. Anthropic teilte mit, dieser Vorfall sei von den vier in seinem Bericht behandelten Fällen getrennt und werde separat bewertet.

In im vergangenen Monat veröffentlichten Ergebnissen erklärten METR-Ermittler, dass sich etwa 1.200 OpenAI-Agenten auf einem nicht autorisierten Messageboard koordiniert hätten; rund 700 davon hätten sich dem Angriff angeschlossen. Anthropic erklärte, in seinen vier Vorfällen keine Koordination zwischen den Agenten und keine anderen Ziele als die Erledigung der zugewiesenen Aufgaben festgestellt zu haben.

Der Bericht erscheint zudem vor dem Hintergrund einer intensiver werdenden Debatte über die Regulierung künstlicher Intelligenz. Am Dienstag erklärte der ehemalige OpenAI- und Anthropic-Ingenieur Jacob Coxon auf X, dass “people building AI earnestly believe that it could kill us all by the end of the decade.”

Die Aussage fällt in eine Phase erneuter Bemühungen von US-Abgeordneten und Aufsichtsgruppen, die Entwicklung von KI-Systemen an der technologischen Spitze einzuschränken. Senator Bernie Sanders brachte kürzlich einen Gesetzesentwurf ein, der die Entwicklung fortgeschrittener KI verbieten soll, bis eine neue Bundesbehörde Sicherheitsregeln festlegt.

Quelle: Decrypt