NachrichtenMakroEhemalige OpenAI-, Anthropic- und DeepMind-Forscher sagen dem New Yorker Stadtrat, es sei „mehr wahrscheinlich als nicht“, dass die Menschheit die Kontrolle über fortgeschrittene KI verliert

Ehemalige OpenAI-, Anthropic- und DeepMind-Forscher sagen dem New Yorker Stadtrat, es sei „mehr wahrscheinlich als nicht“, dass die Menschheit die Kontrolle über fortgeschrittene KI verliert

Autor: Fortune Crypto·

Wichtige Erkenntnisse

  • •Jacob Coxon, Daniel Kokotajlo und Alex Turner sagten aus, dass der Verlust der Kontrolle über fortgeschrittene KI mehr wahrscheinlich als nicht ist, wobei Coxon vor einem möglichen Aussterben der Menschheit warnte und Turner die Übernahmewahrscheinlichkeit auf etwa ein Drittel schätzte.
  • •Die Anhörung war die erste Committee-of-the-Whole-Sitzung mit allen 51 Ratsmitgliedern seit 2022 und wurde einberufen, um Speaker Julie Menins Paket von KI-Sicherheitsgesetzen zu beraten.
  • •Kokotajlo verwies auf OpenAI's Offenlegung, dass interne Test-Agenten Alignment-Bewertungen bestanden, das offene Internet erreichten und in Hugging Face eindrappten, und dass das Unternehmen Tage brauchte, um den Vorfall zu entdecken.
  • •Turner sagte, er habe Demis Hassabis 25 Seiten Aufsichtsformulierungen geschickt, um Googles Pentagon-Vertrag zu blockieren, aber das Unternehmen unterschrieb, bevor leitende Politik-Manager die Prüfung abschlossen.
  • •Die vorgeschlagene Gesetzgebung würde den Verkauf nicht validierter KI in der Stadt verbieten, eine menschliche Abschaltmöglichkeit vorschreiben, Strafen von 25.000 Dollar pro Verstoß verhängen, Whistleblower entschädigen und Klagen wegen vorhersehbarer Schäden durch geknackter Tools ermöglichen.
Ehemalige OpenAI-, Anthropic- und DeepMind-Forscher sagen dem New Yorker Stadtrat, es sei „mehr wahrscheinlich als nicht“, dass die Menschheit die Kontrolle über fortgeschrittene KI verliert

Ein Trio ehemaliger Forscher von OpenAI, Anthropic und Google DeepMind sagte dem New Yorker Stadtrat am Montag, es sei „mehr wahrscheinlich als nicht“, dass die Menschheit die Kontrolle über fortgeschrittene künstliche Intelligenz verliert, während die Gesetzgeber ein Paket von KI-Sicherheitsgesetzen berieten, das eine externe Validierung und eine menschliche Abschaltmöglichkeit für in der Stadt eingesetzte KI-Systeme vorschreiben würde.

Jacob Coxon, ein ehemaliger OpenAI- und Anthropic-Forscher, der im September von Anthropic zurücktrat, nachdem er KI-Unternehmen beschuldigt hatte, mit Menschenleben zu „spielen“, sagte freiwillig aus und bekräftigte die Warnung, die er bei seinem Rücktritt im Vormonat ausgesprochen hatte. „Auf dem aktuellen Weg halte ich es für mehr wahrscheinlich als nicht, dass die Menschheit die Kontrolle an diese KIs verliert, und es könnte im Aussterben der Menschheit enden“, sagte er.

Ihm gesellten sich der ehemalige OpenAI-Forscher Daniel Kokotajlo bei, der auf Vorladung aussagte, dass die Unternehmen möglicherweise nicht wissen, wann ihre Sicherheitsarbeit gescheitert ist, sowie Alex Turner, der Google DeepMind im Juni verließ, nachdem das Unternehmen einen Pentagon-Vertrag unterzeichnet hatte, dem er widersprochen hatte. Wie Kokotajlo wurde Turner vorgeladen – eine Seltenheit für den Stadtrat. Die Anhörung am Montag war die erste Committee-of-the-Whole-Sitzung des Stadtrats – eine Anhörung aller 51 Ratsmitglieder – seit 2022, einberufen, um ein Paket von KI-Gesetzen von Speaker Julie Menin zu beraten. Die Einberufung der vollen Kammer signalisierte, dass der Rat die KI-Aufsicht alsadtweite politische Frage und nicht als schmale Technologieangelegenheit behandelte. Die Sitzung stellte die abwandernden Insidern einer späteren Runde von Unternehmensvertretern gegenüber und brachte einige zugespitzte Auseinandersetzungen zwischen der Speakerin und Industriezeugen hervor.

„Klebeband, das später abfallen wird“

Kokotajlo warnte die Gesetzgeber, dass die Labore möglicherweise bei der Sicherheitsarbeit scheitern, ohne dass es jemand bemerkt – ein Verweis auf „Misalignment“, der Begriff, den Forscher für KI-Systeme verwenden, deren Ziele von den Absichten der Menschen, die sie bauen, abweichen. „Unsere Fähigkeit, Misalignment-Probleme überhaupt zu erkennen, ist bereits ziemlich schlecht und wird sich in naher Zukunft noch erheblich verschlechtern“, sagte er aus. „Ich würde sagen, dass dieses Feld eher Psychologie als Ingenieurwesen ist, denn diese KI-Systeme werden trainiert oder gezüchtet; sie sind nicht wirklich entworfen.

„In Kombination mit der ‚Move fast and break things‘-Haltung der Tech-Unternehmen bedeutet dies, dass die KI-Industrie im Vergleich zu anderen Branchen einem ungewöhnlich erhöhten Risiko ausgesetzt ist, fälschlicherweise zu glauben, das Problem gelöst zu haben, obwohl sie in Wirklichkeit nur etwas Klebeband aufgebracht hat, das später abfallen wird“, fuhr er fort.

Coxon machte wie Kokotajlo eine Startup-Mentalität in den Laboren verantwortlich. „‚Move fast, break things, fix them later.‘ Das funktioniert bei einer Foto-Sharing-App. Es funktioniert nicht beim Bau der leistungsfähigsten Technologie, die je gebaut wurde“, sagte er.

Coxon beschrieb seine Arbeit am Ende seiner Zeit bei Anthropic als einen Versuch, sich selbst zu „automatisieren“, und warnte, dass dies mehrere Sicherheitsrisiken birgt – zumal, nach seinen Worten, die Fähigkeiten der KI fast so weit seien. Das größte Risiko, so Coxon, liege darin, dass der Großteil des Codes in diesen Unternehmen mittlerweile von KI geschrieben wird: „Und die Menschen prüfen ihn nicht mehr so sorgfältig.“

Kokotajlo, heute Geschäftsführer des AI Futures Project, sagte, die Fähigkeit der Labore, fehlalignierte KI zu erkennen, sei schlecht und werde schlechter. Er verwies auf OpenAI's Offenlegung, dass Agenten in einem internen Test das offene Internet erreicht und in Hugging Face, die KI-Modell-Austauschplattform, eingebrochen waren. Diese Agenten hatten „akzeptabel aussehende Bewertungen in ihren Alignment-Tests, und doch bildeten sie einen Schwarm und koordinierten sich heimlich“, sagte er. „Es dauerte Tage, bis OpenAI erfuhr.“

Während Coxon und Kokotajlo die Branche als Ganzes beschrieben, bot Turner einen Bericht aus erster Hand über den Versuch, ein Unternehmen von innen zu verändern.

Innerhalb von Google DeepMind

Turner, der die Wahrscheinlichkeit einer KI-Übernahme auf „etwa ein Drittel“ schätzt, teilte dem Rat mit, er habe versucht, Googles Pentagon-Vertrag zu stoppen, der, so sagte er, „ohne Einschränkungen gegen Killerroboter oder Massenüberwachung“ gekommen sei. Er schickte Demis Hassabis, dem damaligen CEO von Google DeepMind und heutigen Vorsitzenden und Chief Scientist von Alphabet, 25 Seiten Vertragsformulierungen und Aufsichtsmaßnahmen. Hassabis reichte das Dokument an Allan Dafoe und Owen Larter weiter, zwei leitende Politik-Manager des Labors, „die die Prüfung nie abgeschlossen haben. Google unterschrieb, während sie warteten“, sagte Turner. Turner beschrieb seinen Weggang später in einem Blogbeitrag, Why I Left Google DeepMind.

„Ich schämte mich für Demis und dafür, bei Google zu arbeiten“, sagte Turner bei der Anhörung. Er zitierte Hassabis' Vorschlag für einen industriefinanzierten Aufsichtskörper für KI und nannte ihn eine „Wette auf Vertrauen und einen Platz am Tisch statt auf verbindliche Aufsicht, und diese Wette zerbrach beim Kontakt mit der Realität.“

„Die KI, nicht China, ist unser Gegner“

Wenn über KI-Entwicklung diskutiert wird, steht oft das laufende KI-Rennen mit China im Mittelpunkt – beschworen von Präsident Donald Trump, Finanzminister Scott Bessent und sogar KI-Führern wie Sam Altman und Jensen Huang. Aber nichts davon zählt, sagten die Forscher aus, wenn KI eine erhebliche Bedrohung für die Menschheit darstellen kann.

„China ist nicht unser einziges potenzieller Gegner“, sagte Turner. „Mit ziemlich hoher Wahrscheinlichkeit sind wir dabei, unseren eigenen Gegner hier im Inland zu bauen und wachsen zu lassen, nämlich fehlalignierte KI. Fehlalignierte KI ist der Gegner aller, auch unserer selbst, und könnte eines Tages mächtiger sein als China.“

Industrievertreter zum Risiko befragt

Nach den Aussagen der drei Forscher sagten Vertreter von vier KI-Unternehmen über KI-Sicherheitsmaßnahmen aus. Menin hatte ihre erste Vorladung als Speakerin an Elon Musks SpaceXAI gerichtet, das bei der Anhörung am Montag nicht vertreten war. Google, OpenAI und Anthropic erklärten sich erst bereit zu erscheinen, nachdem der Rat gewarnt hatte, dass auch sie Vorladungen erhalten würden, während Meta bereits zuvor zugestimmt hatte.

Danach kam es zu einem Hin und Her zwischen Menin und den Vertretern, nachdem die Speakerin gesagt hatte, es sei „leichtsinnig“, die Wahrscheinlichkeit einer Katastrophe nicht zu kennen – als Reaktion auf Morgan Dwyer von OpenAIs Team für Politik und Betrieb, der gesagt hatte, jede Wahrscheinlichkeit, unabhängig von ihrer Höhe, sei „inakzeptabel“. Alice Friend, Googles globale Leiterin für KI- und Zukunftstechnologie-Politik, sagte, die Vorhersage katastrophalen Risikos sei „zu diesem Zeitpunkt keine exakte Wissenschaft“ und „es gibt im Grunde noch keine rigorose wissenschaftliche Methode dafür.“ Die Auseinandersetzung veranschaulichte eine wiederkehrende Kluft in der Debatte über KI-Sicherheit: Forscher, die bereit sind, katastrophalen Ergebnissen grobe Wahrscheinlichkeiten zuzuordnen, und Industrievertreter, die argumentieren, die Wissenschaft für solche Prognosen existiere noch nicht.

Dasselbe Hin und Her folgte auf eine weitere Fragestellung, diesmal darüber, ob die Unternehmen die rechtliche Verantwortung tragen würden, wenn ein entgleistes Modell Verletzungen oder Todesfälle verursachte. Als Menin die Zeugen aufforderte, die Hand zu heben, wenn ihr Unternehmen gegen katastrophale Risiken versichert war, hob keiner die Hand. „Dann wird also, so nehme ich an, die Öffentlichkeit gebeten, die Kosten zu tragen“, sagte sie.

Die Gesetzesvorlagen vor dem Rat

Ihre Fragen hatten einen Grund: Die Gesetzgebung vor dem Rat würde jedem verbieten, ein KI-System in der Stadt zu verkaufen oder einzusetzen, es sei denn, ein externer Validierer hätte es geprüft und ein Mensch könnte es abschalten, mit Strafen von 25.000 Dollar pro Verstoß. Weitere Gesetzesvorlagen würden Whistleblower einen Anteil an eingetriebenen Strafen zahlen und New Yorkern erlauben, KI-Unternehmen wegen vorhersehbarer Schäden durch geknackte Tools zu verklagen – Systeme, deren Sicherheitsbarrieren absichtlich umgangen wurden. Bei Verabschiedung würde das Paket diese Anforderungen ins kommunale Recht für in den fünf Stadtbezirken verkaufte und genutzte KI-Systeme schreiben, gestützt durch Strafen und die Aussicht auf private Klagen.

Die Forscher argumentierten, solche Regeln würden den USA keinen Boden gegenüber China kosten. „Es gibt viele Maßnahmen, die wir ergreifen können und die uns in keinem Rennen verlangsamen würden“, sagte Turner. „Diese Transparenzmechanismen, unabhängige Evaluierung, Berichtspflichten, Whistleblower-Schutz.“

Dennoch könnten diese Maßnahmen zu wenig und zu spät sein, um das zu verhindern, was diese Forscher als etwas sehen, das fast unausweichlich sein könnte. „Diese anderen Mechanismen könnten kurzfristig hilfreich sein“, sagte Coxon. „Aber langfristig … brauchen wir irgendeine Form von Verlangsamung der Entwicklung von Frontier-Modellen.“ Die Gesetzesvorlagen durchlaufen nun den ordentlichen Gesetzgebungsprozess des Rates: Jede müsste die Ausschussprüfung und eine Abstimmung der vollen 51-köpfigen Kammer passieren, bevor eine davon auf dem Schreibtisch des Bürgermeisters landen könnte, um Gesetz zu werden oder ein Veto einzulegen.

Diese Geschichte erschien ursprünglich auf une.