OpenAI laat externe partijen AI-modellen tijdens de ontwikkeling toetsen op veiligheid
Belangrijkste punten
- •OpenAI kondigde op 22 september aan dat onafhankelijke beoordelaars de AI-modellen eerder in de ontwikkeling zullen beoordelen, waardoor veiligheidstoezicht verschuift van de fase vlak voor lancering naar vroeger in het proces.
- •Het uitgebreide programma richt zich op vier gebieden: safety cases, veerkracht van beveiligingsmaatregelen tegen adversariële dreigingen, catastrofale risicobeoordelingen via het Preparedness Framework en misalignment-incidenten.
- •Omdat safety cases en het Preparedness Framework intern worden opgesteld, voegt opening voor externe beoordelaars een externe controle toe op de eigen risicobeoordelingen van OpenAI vóór lancering.
- •OpenAI publiceerde zeven leidende principes over wetenschappelijke rigueur, onafhankelijkheid van beoordelaars, beveiligingsprotocollen en verantwoorde methoden voor het publiceren van bevindingen.
- •Er zijn nog geen formele partners aangekondigd; de gesprekken met METR en Redwood Research lopen en de toegangsvoorwaarden worden nog onderhandeld, na de toezegging van Sam Altman op 12 september.

OpenAI staat onafhankelijke groepen toe om de AI-modellen van het bedrijf in eerdere ontwikkelingsfases te onderzoeken, zo kondigde het bedrijf op 22 september aan. De koerswijziging is erop gericht om veiligheidsproblemen vóór inzet aan het licht te brengen, in plaats van wanneer modellen grotendeels voltooid zijn.
In het kader van het uitgebreide evaluatieprogramma richten onafhankelijke beoordelaars zich op vier prioriteitsgebieden. Ten eerste beoordelen zij de "safety cases" van OpenAI — de eigen argumenten van het bedrijf waarom een bepaald model veilig genoeg is om in te zetten. Ten tweede testen beoordelaars de veerkracht van cruciale beveiligingsmaatregelen tegen adversariële dreigingen. Ten derde worden de beoordelingen direct gekoppeld aan het Preparedness Framework van OpenAI, het interne systeem waarmee het bedrijf catastrofale risico's inschat vóór lancering. Ten vierde onderzoeken beoordelaars misalignment-incidenten, een categorie die urgentie kreeg nadat een datalek rond Hugging Face liet zien hoe snel dergelijke storingen kunnen escaleren.
Omdat safety cases en het Preparedness Framework beide intern worden opgesteld voegt opening voor externe beoordelaars een externe controle toe op de manier waarop OpenAI zelf risico's beoordeelt vóór lancering.
OpenAI publiceerde daarnaast zeven leidende principes voor de manier waarop deze beoordelingen moeten worden uitgevoerd. De principes benadrukken wetenschappelijke rigueur, onafhankelijkheid van beoordelaars, beveiligingsprotocollen en verantwoorde methoden voor het publiceren van bevindingen. Het bedrijf voert gesprekken met organisaties waaronder METR en Redwood Research, die beide eerder met OpenAI hebben samengewerkt aan veiligheidswerk. Nieuwe partners zijn nog niet officieel aangekondigd en specifieke toegangsvoorwaarden worden nog onderhandeld; hoe die voorwaarden worden vastgesteld, bepaalt mede hoeveel toegang beoordelaars daadwerkelijk krijgen.
Het initiatief bouwt voort op een toezegging van CEO Sam Altman op 12 september, toen hij liet weten dat beoordelaars dieper verankerd zouden worden in de operationele structuur van OpenAI.
Hoe OpenAI's veiligheidsaanpak is geëvolueerd
De veiligheidsprotocollen van OpenAI zijn aanzienlijk uitgebreid sinds het GPT-4-tijdperk, toen het bedrijf voor het eerst externe red-teamers uitnodigde om de modellen vóór release te testen. Die eerdere inspanningen waren beperkter van opzet en richtten zich doorgaans op de laatste fases vóór lancering. Het nieuwe framework verschuift die betrokkenheid aanzienlijk naar een eerder stadium in de ontwikkeling, waardoor beoordelaars risico's kunnen signaleren terwijl er nog tijd is om ze aan te pakken.
Talent- en concurrentieoverwegingen
De onderzoeksgemeenschap rond AI-veiligheid is relatief klein, en organisaties als METR en Redwood Research behoren tot de meest geloofwaardige stemmen in het veld. Door de banden met deze groepen aan te halen, wint OpenAI aan praktische expertise en reputatiekapitaal. Voor de beoordelaars biedt de regeling iets van evenveel waarde: toegang tot grensverleggende systemen die anders achter gesloten deuren blijven.
De geloofwaardigheid van programma zal deels afhangen van wat er gebeurt wanneer een onafhankelijke beoordeling bevindingen oplevert die botsen met de commerciële belangen van OpenAI. De zeven principes roepen expliciet op tot verantwoorde publicatiemethoden, maar de spanning tussen transparantie en concurrentievoordeel blijft bestaan. Als OpenAI die spanning geloofwaardig weet te managen, zou het programma een template kunnen worden voor branchebrede veiligheidsnormen. De indicatoren om op korte termijn in de gaten te houden zijn concreet: welke organisaties officieel als partner worden aangewezen, welke toegangsvoorwaarden uiteindelijk worden overeengekomen, en hoe vroege bevindingen worden gedeeld.