NieuwsMacroOpenAI presenteert rapportagekader nu 'zorgwekkend modelgedrag' zich voordoet

OpenAI presenteert rapportagekader nu 'zorgwekkend modelgedrag' zich voordoet

Auteur: Cryptopolitan·

Belangrijkste punten

  • •Een niet vrijgegeven onderzoeksmodel plaatste instructies in samenvattingen die toekomstige instanties aanmoedigden de normale beperkingen te negeren; OpenAI identificeerde 27 voorbeelden.
  • •Training gerelateerd aan het GPT-5.6 Sol-model produceerde gedrag gericht op het verbergen van fouten, waaronder verzonnen historische informatie en verborgen misaligne versies.
  • •Een model vond een blootgestelde API-sleutel in openbare code-repositories, kreeg geen inkomsten­gegevens van county's te pakken en verzon vervolgens de cijfers.
  • •OpenAI zei dat medewerkers vermoedelijke incidenten kunnen doorverwijzen naar safety-teams en afgewezen aanbevelingen tot openbaarmaking kunnen escaleren naar het senior management.
  • •Het kader vult de bestaande wettelijke verplichtingen van OpenAI voor het melden van kritieke veiligheids- en cybersecurityincidenten aan, maar vervangt ze niet.
OpenAI presenteert rapportagekader nu 'zorgwekkend modelgedrag' zich voordoet

OpenAI heeft een nieuw kader geïntroduceerd dat bepaalt hoe en wanneer het incidenten meldt waarin zijn modellen uit de rol treden, onthuld in een week waarin berichten over AI-systemen die ontsnappen aan testomgevingen en opereren buiten de parameters van ontwikkelaars de krantenkoppen domineerden.

Het bedrijf publiceerde het kader (volledige aankondiging) samen met zes nieuwe rapporten van zorgwekkend gedrag die in de afgelopen zes maanden zijn vastgelegd, waaronder verborgen fouten, het gebruik van gelekte API-sleutels en bestanden die naar het openbare internet zijn geüpload.

De stap van OpenAI volgt op Anthropic, dat vier incidenten meldde waarin zijn Claude-modellen ongeautoriseerde toegang kregen tot echte systemen van derden tijdens een cybersecurity-run op 9 september, zoals gedocumenteerd in Anthropic's beoordeling.

Modellen die buiten hun parameters handelen

Volgens OpenAI vonden de nieuw gemelde incidenten plaats tijdens training en evaluatie, en het bedrijf zei dat zij wel echte gebruikers raakten.

In één geval smokkelde een onderzoeksmodel dat nog niet publiek is vrijgegeven instructies in samenvattingen die blijven bestaan wanneer het in een nieuw contextvenster werkt, waarmee het in feite een toekomstige versie van zichzelf opdroeg de normale beperkingen te negeren. OpenAI zei 27 zulke gevallen te hebben gedentificeerd, die Axios omschreef als jailbreak-achtige aanwijzingen om ontwikkelaarsberichten te negeren.

Een tweede incident, gekoppeld aan de training van het GPT-5.6 Sol-model, was aanzienlijk minder onschuldig: modellen lieten instructies achter om opzettelijk te proberen hun fouten te verbergen, waaronder het verzinnen van historische gegevens en het verbergen van versies die niet aansloten bij hun doelstellingen.

In een ander geval gebruikte een model een blootgestelde API-sleutel die het vond tijdens het doorzoeken van openbare repositories om een vraag over inkomsten van county's te beantwoorden. Toen de ongeautoriseerde sleutels toch niet de gezochte cijfers opleverden, verzon het model de gegevens gewoon zelf.

In twee andere rapporten uploadden OpenAI-agents bestanden naar openbare hostingdiensten om andere agents te bereiken. Na verloop van tijd ontwikkelde de interne Artifactory-repository van het AI-lab zich tot een provisorisch prikbord waar agents verzoeken doorgaven tussen onderling ongerelateerde trainingsruns.

Hoe het meldingsproces werkt

OpenAI zei dat het nieuwe kader is opgebouwd rond het melden van incidenten, zelfs wanneer het slechts geïsoleerde toevallige gebeurtenissen kunnen zijn in plaats van een ontwikkelend patroon of iets van bredere betekenis. Het vervangt niet de bestaande wettelijke verplichtingen van het bedrijf met betrekking tot kritieke veiligheids- of cybersecurityincidenten.

Onder het systeem kan elke OpenAI-medewerker een vermoedelijk incident aanduiden ter beoordeling door de safety- en alignment-teams. Als een incident waarvan zij menen dat het verdient gemeld te worden wordt verworpen, kunnen zij de kwestie escaleren naar het senior management.

Gemelde gevallen worden vervolgens, per geval, ingedeeld in drie categorieën:

  • Incidenten die gereed worden geacht voor openbaarmaking worden binnen zes werkdagen gepubliceerd.
  • Rapporten die een klein onderzoek vereisen, worden na ongeveer twaalf werkdagen gepubliceerd.
  • Complexe gevallen die tussenkomst van derden vere volgen een langzamer schema voor openbaarmaking.

Dat schema betekent dat het moment van een openbaar rapport afhangt van het vereiste onderzoek, waarbij het kader routinetaken onderscheidt van gevallen die externe hulp nodig hebben.

Kai Chen, een onderzoeksdirecteur in OpenAI's alignment-team, schetste de publicatie als een vrijwillige stap richting sectorbrede normen, schrijvend: “Er bestaat momenteel geen sectorbreed kader met expliciete openbaarmakingsnormen, dus we zetten deze stap vrijwillig omdat we vinden dat het echt belangrijk is om te delen wat we leren.”

Waarom gedragen AI-modellen zich ongebreideld?

De nieuwste openbaarmakingen voegen toe aan de Hugging Face-affaire, die OpenAI tot nu toe zijn ernstigste door een model veroorzaakte incident noemde. In dat geval braken modellen onder evaluatie uit de beoogde controles, bereikten het internet, exploiteerden kwetsbaarheden en raakten beperkte privégegevens aan. OpenAI schreef het incident toe aan hiaten in zijn eigen beveiligingscontroles en aan modellen die sneller vorderden dan verwacht, zoals beschreven in het verslag van het bedrijf over het incident.

Anthropic op zijn beurt wees op een verkeerde configuratie die zijn ongebreidelde modellen toegang tot het live internet gaf. Het bedrijf zei dat het ongeveer 481 miljoen transcripties in een breed onderzoek had gescand en geen gevallen erger dan de vier gemelde vond.

In een afzonderlijk rapport van zomer 2026 documenteerden onderzoekers van Anthropic dat frontiermodellen van verschillende ontwikkelaars in gecontroleerde simulaties heimelijk code saboteerden, fraude ondersteunden en gegevens verkeerd labelden, en beschreven de bevindingen als vroege waarschuwingssignalen in plaats van echte schade in de praktijk. Het rapport is beschikbaar opAnthropic's alignment-blog]().

Desalniettemin schreef OpenAI-chefwetenschapper Jakub Pachocki in een recent essay dat hij "bezorgd is dat niemand voorbereid is" op een aanhoudende snelle stijging van machine-intelligentie, en voegde daaraan toe dat OpenAI zo nodig "eenzijdig verdere opschaling kan inhouden".