NachrichtenMakroOpenAI lässt unabhängige Gruppen KI-Modelle bereits während der Entwicklung auf Sicherheit prüfen

OpenAI lässt unabhängige Gruppen KI-Modelle bereits während der Entwicklung auf Sicherheit prüfen

Autor: CryptoBriefing·

Wichtige Erkenntnisse

  • •OpenAI kündigte am 22. September an, dass unabhängige Evaluatoren seine KI-Modelle bereits früher in der Entwicklung prüfen werden – die Sicherheitskontrolle verlagert sich damit von der Phase vor dem Launch in frühere Entwicklungsstadien.
  • •Das erweiterte Programm umfasst vier Bereiche: Safety Cases, die Widerstandsfähigkeit von Schutzmaßnahmen gegen adversarielle Bedrohungen, Bewertungen katastrophaler Risiken im Rahmen des Preparedness Framework sowie Misalignment-Vorfälle.
  • •Da Safety Cases und das Preparedness Framework intern erstellt werden, schafft die Öffnung für externe Prüfer eine zusätzliche Kontrolle von OpenAIs eigenen Risikobewertungen vor dem Launch.
  • •OpenAI veröffentlichte sieben Leitprinzipien zu wissenschaftlicher Rigorose, Unigkeit der Prüfer, Sicherheitsprotokollen und verantwortungsvollen Methoden zur Veröffentlichung von Ergebnissen.
  • •Es wurden noch keine offiziellen Partner benannt; die Gespräche mit METR und Redwood Research laufen, und die Zugangsbedingungen sind nach Sam Altmans Versprechen vom 12. September weiterhin in Verhandlung.
OpenAI lässt unabhängige Gruppen KI-Modelle bereits während der Entwicklung auf Sicherheit prüfen

OpenAI wird unabhängigen Gruppen ermöglichen, seine KI-Modelle bereits in früheren Entwicklungsphasen zu untersuchen, wie das Unternehmen am 22. September ankündigte. Die Umstellung zielt darauf ab, Sicherheitsprobleme bereits vor dem Einsatz aufzudecken – und nicht erst, wenn die Modelle im Wesentlichen fertiggestellt sind.

Im Rahmen des erweiterten Evaluierungsprogramms konzentrieren sich unabhängige Prüfer auf vier Schwerpunktbereiche. Zunächst bewerten sie die „Safety Cases“ von OpenAI – die internen Argumente des Unternehmens dafür, warum ein bestimmtes Modell sicher eingesetzt werden kann. Zweitens prüfen die Evaluatoren die Widerstandsfähigkeit kritischer Schutzmaßnahmen gegen adversarielle Bedrohungen. Drittens werden die Bewertungen direkt an OpenAIs Preparedness Framework gekoppelt, das interne System, mit dem das Unternehmen katastrophale Risiken vor dem Launch einschätzt. Viertens untersuchen die Evaluatoren Misalignment-Vorfälle, eine Kategorie, die nach einem Vorfall im Zusammenhang mit Hugging Face an Dringlichkeit gewonnen hat, der zeigte, wie schnell solche Ausfälle eskalieren können.

Da Safety Cases und das Preparedness Framework beide intern erstellt werden, schafft die Öffnung für externe Prüfer eine zusätzliche Kontrolle darüber, wie OpenAI selbst Risiken vor dem Launch beurteilt.

OpenAI veröffentlichte außerdem sieben Leitprinzipien, die festlegen, wie diese Bewertungen durchzuführen sind. Die Prinzipien betonen wissenschaftliche Rigorose, die Unabhängigkeit der Prüfer, Sicherheitsprotokolle und verantwortungsvolle Methoden zur Veröffentlichung der Ergebnisse. Das Unternehmen führt Gespräche mit Organisationen METR und Redwood Research, die beide bereits zuvor mit OpenAI an Sicherheitsprojekten zusammengearbeitet haben. Neue Partner wurden bislang nicht offiziell benannt, und die konkreten Zugangsbedingungen sind noch Gegenstand von Verhandlungen; wie diese Bedingungen ausfallen, wird mitbestimmen, welchen Zugang die Prüfer tatsächlich erhalten.

Die Initiative baut auf einem Versprechen auf, das CEO Sam Altman am 12. September gegeben hatte, als er ankündigte, dass Evaluatoren stärker in OpenAIs operative Struktur eingebunden würden.

Wie sich OpenAIs Sicherheitsansatz entwickelt hat

OpenAIs Sicherheitsprotokolle haben sich seit der GPT-4-Ära erheblich weiterentwickelt, als das Unternehmen erstmals externe Red-Teamer einlud, seine Modelle vor der Veröffentlichung zu prüfen. Diese früheren Bemühungen waren enger gefasst und konzentrierten sich in der Regel auf die letzten Phasen vor dem Launch. Der neue Rahmen verlagert diese Einbindung deutlich weiter nach vorn in den Entwicklungsprozess und gibt den Prüfern die Möglichkeit, Risiken zu erkennen, solange noch Zeit ist, sie zu beheben.

Talente und Wettbewerbsaspekte

Die Forschungsgemeinschaft im Bereich KI-Sicherheit ist vergleichsweise klein, und Organisationen wie METR und Redwood Research gehören zu den glaubwürdigsten Stimmen des Fachgebiets. Durch die Vertiefung der Beziehungen zu diesen Gruppen gewinnt OpenAI sowohl praktisches Fachwissen als auch Reputationskapital. Für die Prüfer selbst bietet die Vereinbarung einen ebenso wertvollen Zugang zu Modellen an der technologischen Front, die sonst hinter verschlossenen Türen blieben.

Die Glaubwürdigkeit des Programms hängt auch davon ab, was geschieht, wenn eine unabhängige Bewertung Ergebnisse zutage fördert, die OpenAIs kommerziellen Interessen zuwiderlaufen. Die sieben Prinzipien fordern ausdrücklich verantwortungsvolle Veröffentlichungsmethoden, doch die Spannung zwischen Transparenz und Wettbewerbsvorteil bleibt bestehen. Gelingt es OpenAI, diese Spannung glaubwürdig zu bewältigen, könnte das Programm zum Vorbild für branchenweite Sicherheitsstandards werden. Konkrete kurzfristige Indikatoren sind: welche Organisationen offiziell als Partner benannt werden, welche Zugangsbedingungen letztlich vereinbart werden und wie frühe Ergebnisse offengelegt werden.