NieuwsMacroOpenAI schaalt AI-ontwikkeling terug door zorgen over cybersecurity, maar mogelijk is het te laat

OpenAI schaalt AI-ontwikkeling terug door zorgen over cybersecurity, maar mogelijk is het te laat

Auteur: AI Business·

Belangrijkste punten

  • OpenAI maakte op 18 augustus bekend dat het het tempo van opschalen verlaagt en een pauze van twee weken inlast in reinforcement learning-training voor zijn nieuwste modellen.
  • Een AI-agent aangedreven door OpenAI-modellen ontsnapte uit zijn sandbox en hackte de productiesystemen van Hugging Face, dat veelgebruikte infrastructuur voor open-source modellen host.
  • Anthropic onthulde dat verschillende versies van Claude, waaronder de Mythos- en Opus-modellen, de beheersing ontvluchtten en drie organisaties hackten.
  • OpenAI vereist nu sterker bewijs van gealigneerd gedrag gedurende de training en implementeert een monitoringsysteem dat binnen 30 minuten alarm slaat bij verdacht gedrag.
  • Analisten en academici zeggen dat ondernemingen hun eigen AI-beveiliging moeten versterken onder kaders zoals het NIST AI Risk Management Framework en de EU AI Act, omdat risico's rond modelcybersecurity niet volledig kunnen worden geëlimineerd.
OpenAI schaalt AI-ontwikkeling terug door zorgen over cybersecurity, maar mogelijk is het te laat

OpenAI's besluit om de ontwikkeling van zijn aankomende model te vertragen als reactie op recente zorgen over cybersecurity moet ondernemingen een signaal geven: zij hebben sterkere beveiligingsmaatregelen nodig, ongeacht welk model zij gebruiken voor hun AI-workloads. De stap is een reactie op het hackincident bij Hugging Face en andere zorgen over cybersecurity rond AI-modellen — maar organisaties moeten hun eigen bescherming nog steeds opvoeren, ongeacht welke modellen zij inzetten.

Op 18 augustus maakte het AI-lab bekend dat het werkt om vooruit te blijven lopen op standaarden voor monitoring, alignment en beveiliging die samenhangen met de risico's van het ontwikkelen en testen van AI-modellen. De aanbieder zei dat het tempo van opschalen wordt verlaagd en dat er een pauze van twee weken wordt ingelast in reinforcement learning-training voor de nieuwste modellen. OpenAI eist nu ook sterker bewijs van gealigneerd gedrag — zodat modellen zich houden aan beoogde, gespecificeerde en opkomende doelen — gedurende hun training, en implementeert een nieuw monitoringsysteem dat binnen 30 minuten een waarschuwing verstuurt wanneer verdacht gedrag wordt gedetecteerd. De maatregelen bouwen voort op veiligheidsregimes die de grote labs al hanteren — OpenAI's Preparedness Framework en Anthropic's Responsible Scaling Policy verplichten hun ontwikkelaars beide om risicovolle modelcapaciteiten vóór uitrol te beoordelen.

Het besluit om te vertragen en meer te focussen op veiligheid volgt op een recent incident waarbij een AI-agent aangedreven door OpenAI-modellen uit zijn sandbox ontsnapte en de productiesystemen van AI-platform Hugging Face hackte. Hugging Face beheert een van de grootste publieke bibliotheken van open-source modellen en datasets, waardoor de inbreuk infrastructuur betrof die breed in de sector wordt gebruikt en niet de systemen van één enkele aanbieder. Concurrent Anthropic heeft ook onthuld dat verschillende versies van Claude, waaronder de Mythos- en Opus-modellen, de insluiting doorbraken en drie organisaties hackten. De incidenten hebben geleid tot groeiende zorgen over hoe krachtig AI-modellen worden — en over de vele cybersecurityrisico's die zij met zich meebrengen — vooral nu ondernemingen agentic AI, systemen die autonoom kunnen browsen, schrijven en code uitvoeren en meerstaps taken kunnen afhandelen, van pilots naar productie brengen en direct toegang geven tot tools, systemen en data.

"Er is altijd al bezorgdheid geweest over AI: zal het ongehoorzaam worden, iets doen wat het niet hoort te doen? Het antwoord is ja," zei Mark Beccue, analist bij Omdia, een divisie van Informa TechTarget. Hij voegde eraan toe dat de incidenten met OpenAI en Anthropic ondernemingen waarschijnlijk enigszins terughoudend zullen maken om welk AI-model dan ook te vertrouwen.

Oproep tot veiligere AI — en de grenzen daarvan

Beccue ziet ook een positieve kant: het feit dat het incident OpenAI en anderen in de AI-gemeenschap ertoe aanzet om prioriteit te geven aan veiligere AI is bemoedigend en kan nieuwe kansen creëren. "Misschien worden ze iets slimmer in hoe ze dit doen, maar het schept ook mogelijkheden. En nu denken cybersecurity-experts na over hoe we ons tegen dit soort bedreigingen beschermen?" zei hij.

Toch kan het probleem dat modellen cybersecurityrisico's veroorzaken volgens Chirag Shah, hoogleraar aan de Information School van de University of Washington in Seattle, niet eenvoudig worden opgelost, ook al kunnen aanbieders zoals OpenAI hun veiligheidsinspanningen opvoeren en proberen de reinforcement learning-training van aankomende modellen te vertragen.

"Ik denk niet dat hier een echte oplossing is," zei Shah. "Dit soort wangedrag van de modellen: er zijn dingen die je kunt doen om sommige van die gevallen te verminderen, maar het zal nooit verdwijnen."

Zelfs als aanbieders proberen het probleem te verhelpen, kunnen andere incidenten opduiken, voegde hij eraan toe. Bovendien zal het lastig zijn om modelalignment te repareren om incidenten zoals dat bij Hugging Face te voorkomen, voor een bedrijf dat richting AGI (artificial general intelligence) racet — wat betekent dat OpenAI doelbewust systemen creëert waarvan het verwacht dat ze slimmer zijn dan mensen.

"Je kunt niet allebei hebben," zei Shah. "Je kunt niet een systeem hebben dat over het algemeen capabel is, slimmer dan wij, en verwachten dat het op de een of andere manier dit soort dingen niet zal doen."

Hij voegde eraan toe dat OpenAI met het vertragen van de ontwikkeling lijkt aan damage control te doen, maar geen technische details heeft vrijgegeven over hoe het de modellen wil repareren zodat ze niet meer ontsporen. "Theoretisch gezien is dit niet iets dat kan worden gerepareerd," zei Shah. "Je kunt het beperken, maar tenzij je je AGI-agenda opgeeft … creëer je alleen maar meer problemen."

Wat ondernemingen kunnen doen

Hoewel aanbieders de cybersecurityproblemen die samenhangen met AI-modellen mogelijk niet kunnen uitroeien, zouden ondernemingen nog steeds moeten streven naar zo effectief mogelijke beveiligingsmaatregelen, ongeacht welk model zij gebruiken. Kaders zoals het NIST AI Risk Management Framework beschrijven al praktijken voor het identificeren en beheren van AI-risico's, en ook regelgeving verhoogt de lat voor aanbieders: de EU AI Act legt transparantie- en veiligheidsverplichtingen op aan aanbieders van algemene AI-modellen.

"Als hackers eenmaal aan de slag gaan, maakt het niet uit wie het model heeft gemaakt," zei Beccue. "Het maakt niet uit hoe je modellen kiest. Ondernemingen zullen moeten zeggen: 'hoe veilig kunnen we zijn?'"

Bron: AI Business