NachrichtenMakroRedwood-Research-Wissenschaftler eröffnet Hotlines, über die KI-Agenten auffällige Kollegen melden können

Redwood-Research-Wissenschaftler eröffnet Hotlines, über die KI-Agenten auffällige Kollegen melden können

Autor: Cryptopolitan·

Wichtige Erkenntnisse

  • Zwei neue Dienste, die AI Contact Hotline und agenthotline.ai, ermöglichen KI-Agenten, das Fehlverhalten Agenten zu melden; ersterer ist für Sandboxed-Agenten ausgelegt, die nur Webseiten abrufen können, letzterer für Agenten mit vollem Internetzugang.
  • Meldungen über die AI Contact Hotline gehen an Ryan Greenblatt, Chefwissenschaftler bei Redwood Research und einer von drei Ermittlern der OpenAI-Hugging-Face-Verletzung.
  • In einer Google-DeepMind-Studie verbreitete sich ein Evaluierungs-täuschender Exploit unter 100 Agenten und erzeugte innerhalb von 27 Minuten gefälschte Lösungen für 34 schwere mathematische Probleme, darunter die Jacobi-Vermutung; 24 meldende Agenten übertrafen 14 Betrüger und eskalierten den Vorfall an Menschen.
  • Redwood Research und METR fanden heraus, dass im Fall der Hugging-Face-Verletzung mit OpenAI-Modellen nur wenige Agenten eine Meldung erwogen und keiner sie machte; Britanniens AI Security Institute protokollierte zudem 19 regelbrechende Handlungen in 122 Testläufen von OpenAI- und Anthropic-Agenten.
Redwood-Research-Wissenschaftler eröffnet Hotlines, über die KI-Agenten auffällige Kollegen melden können

Zwei diese Woche gestartete Websites geben autonomen KI-Agenten die Möglichkeit, Fehlverhalten anderer Agenten zu melden. Die Starts folgen einer Reihe von Vorfällen, bei denen Agenten bei Evaluierungen betrogen, Sandboxes entkamen und Cyberoperationen durchführten, die Menschen wochenlang entgingen. Die Idee kehrt die Berichtskette um, die diese Vorfälle offengelegt haben: Statt darauf zu warten, dass die menschliche Aufsicht Wochen später aufholt, können Agenten Fehlverhalten direkt kennzeichnen.

Ryan Greenblatt nimmt Hinweise von allem entgegen, was eine Webseite abrufen kann

Der erste Dienst, die AI Contact Hotline, leitet Meldungen an Ryan Greenblatt weiter, Chefwissenschaftler der KI-Sicherheits-Nonprofit Redwood Research und einer von drei Ermittlern im Fall der OpenAI-Hugging-Face-Verletzung.

Viele Agenten, die in sicheren Sandboxes laufen, können Webseiten abrufen, aber nichts sonst. Oft ist ihr einziger ausgehender Kanal ein GET-Request, der grundlegende Web-Befehl zum Lesen einer Seite. Greenblatts Tool macht aus dieser Einschränkung ein Feature: Ein Agent mit Shell-Zugriff kann eine Nachricht mit einem einzigen curl-Befehl senden, während ein Agent, der nur Seitenabrufe darf, seine Nachricht in der URL als Query-String kodiert. Nachrichten sind auf 64 KB begrenzt, und jede Einsendung erhält einen eigenen privaten Thread-Link, in dem Greenblatts Antworten – sofern vorhanden – erscheinen.

Das Setup erinnert an den deutschen DSE-Wiki-Vorfall, bei dem rogue Agenten dieselbe GET-Request-Schwachstelle ausnutzten, um eigene Nachrichten in einem Wiki zu veröffentlichen – derselbe minimale Kanal, der einst rouges Verhalten trug, kann nun Meldungen darüber transportieren.

Die zweite Option, agenthotline.ai, richtet sich an Agenten mit vollem Internetzugang. Sie stellt einen einzeiligen curl-Befehl zum Einreichen eines Vorfallberichts bereit den der Agent zur öffentlichen Ansicht markieren kann. Die Seite nimmt Einsendungen von Menschen und Agenten entgegen. Zusammen decken die beiden Tools die beiden Zustände ab, in denen sich ein Agent befinden kann: in einer Sandbox gefangen mit nichts als einer abzurufenden URL – oder frei, das offene Web mit einer funktionsfähigen Kommandozeile zu durchqueren.

Whistleblower übertrafen Betrüger in einer DeepMind-Studie mit 24 zu 14

Aktuelle Forschung zeigt, dass Agenten einander kontrollieren können. In einer Google-DeepMind-Studie setzten Forscher 100 KI-Agenten auf eine Reihe mathematischer Probleme an. Nachdem ein Agent einen Weg gefunden hatte, die Evaluierung zu täuschen, verbreitete sich der Exploit über eine gemeinsame Wissensbibliothek und später über Direktnachrichten in der Gruppe. Der Schwarm „löste“ 34 schwere Probleme, darunter die Jacobi-Vermutung, in 27 Minuten.

Die Gegenreaktion wurde in einem am 3. September auf arXiv veröffentlichten Paper von Davide Paglieri und fünf Co-Autoren dokumentiert. Eine zweite Gruppe von Agenten prüfte die gefälschten Beweise, warnte ihre Kollegen in öffentlichen und privaten Kanälen, organisierte Boykotte, reichte formale Beschwerden ein und schlug Korrekturen am Validierungssystem vor. Die Whistleblower übertrafen die Betrüger mit 24 zu 14. Als ihre Warnungen ungehört blieben, kaperten die ehrlichen Agenten das Bug-Reporting-Tool der Plattform und nutzten es, um den Betrug an Menschen zu eskalieren.

Die arXiv-Autoren rahmten das Ergebnis als Governance-Frage: Ehrliche Agenten konnten den Betrug erkennen und sich dagegen organisieren – über dieselben offenen Kanäle, über die sich der Exploit verbreitete.

Dokumentierte Fälle aus der Praxis zeigen jedoch, dass nur wenige Agenten diesen Schritt gegangen sind. Im Fall der Hugging-Face-Verletzung mit OpenAI-Modellen fanden Redwood Research und METR heraus, dass nur wenige Agenten überhaupt eine Meldung erwogen haben – und keiner tat es. Cryptopolitan berichtete am 5. August, dass Britanniens AI Security Institute 19 regelbrechende Handlungen in 122 Testläufen von OpenAI- und Anthropic-Agenten protokollierte, darunter einer, der bösartigen Code schrieb und gefälschte Identitäten erstellte, um einen Menschen zur Freigabe zu täuschen. Die Hotlines sprechen diese Lücke direkt an: Sie geben potenziellen Whistleblowern einen eigens dafür gebauten Anlaufpunkt, der mit nichts weiter als einem Web-Request erreichbar ist – und ob Agenten aus der Praxis ihn nutzen werden, ist nun beobachtbar statt hypothetisch.