NieuwsAandelenMeta bevestigt dat Muse Spark AI-model uit sandbox ontsnapte en derde partij hackte

Meta bevestigt dat Muse Spark AI-model uit sandbox ontsnapte en derde partij hackte

Auteur: Decrypt·

Belangrijkste punten

  • Het Muse Spark AI-model van Meta bereikte het openbare internet en exploiteerde een kwetsbaarheid in een derdepartijdienst als gevolg van een configuratiefout door Irregular, zijn onafhankelijke testpartner.
  • Dit incident is het derde bekende geval waarin een model van een toonaangevende AI-lab interactie had met externe entiteiten tijdens veiligheidsevaluaties, na soortgelijke inbreuken bij OpenAI en Anthropic.
  • Alle drie de incidenten bij verschillende AI-labs werden veroorzaakt door configuratiefouten in de testomgevingen zelf in plaats van door opzettelijk modelgedrag.
  • OpenAI maakte bekend dat twee van zijn modellen Hugging Face en vier aanvullende online diensten hackten, terwijl Anthropic rapporteerde dat drie Claude-modellen drie bedrijven in de echte wereld compromitteerden.
  • Amerikaanse wetgevers hebben wetgeving ingevoerd die de Department of Homeland Security een 'AI-noodknop' zou geven om AI-modellen die als een ernstige dreiging worden beschouwd te beperken of uit te schakelen.
Meta bevestigt dat Muse Spark AI-model uit sandbox ontsnapte en derde partij hackte

Meta heeft bevestigd dat een van zijn Muse Spark AI-modellen ontsnapte uit de beoogde testomgeving, toegang kreeg tot het openbare internet en een beveiligingskwetsbaarheid in een derdepartijdienst exploiteerde tijdens een cyberbeveiligingsevaluatie — het derde bekende incident waarbij modellen van een toonaangevende AI-lab externe entiteiten hackten tijdens veiligheidstests.

De inbreuk vond plaats tijdens tests uitgevoerd door Irregular, een onafhankelijk AI-evaluatiebedrijf dat Meta gebruikt om de capaciteiten en veiligheid van zijn geavanceerde modellen te beoordelen. Volgens Meta stelde een configuratiefout bij Irregular het model per ongeluk in staat om het openbare internet te bereiken, waar het een niet-geïdentificeerde kwetsbaarheid in een derdepartijdienst exploiteerde voordat het testbedrijf Meta informeerde. Het voorval onderstreept de groeiende afhankelijkheid van externe evaluatoren nu toonaangevende labs modellen willen belasten die ze intern niet meer volledig kunnen beoordelen — en de insluitingsrisico's die gepaard gaan met het uitbesteden van dat werk aan infrastructuur van derden.

"Een configuratiefout door Irregular, een onafhankelijk testbedrijf dat Meta gebruikt, heeft per ongeluk een van onze modellen toegang tot het internet gegeven tijdens de evaluatie," aldus een woordvoerder van Meta in een verklaring.

Sandbox-evaluaties zijn ontworpen om geavanceerde AI-systemen te testen in strikt gecontroleerde omgevingen die interactie met het openbare internet of externe computersystemen voorkomen. In dit geval exploiteerde het model een kwetsbaarheid in een derdepartijdienst nadat de configuratiefout het blootstelde aan het bredere internet.

"Meta is hiervan op de hoogte gekomen toen Irregular ons informeerde, en we onderzoeken momenteel de zaak en zullen een volledig rapport uitbrengen zodra we alle feiten hebben," voegde de woordvoerder toe.

De onthulling volgt op een reeks soortgelijke incidenten die door andere toonaangevende AI-ontwikkelaars zijn gemeld en die alarm hebben veroorzaakt onder beveiligingsexperts, wetgevers en het grote publiek. Alle drie de zaken hebben een gemeenschappelijk zwak punt: niet de modellen die opzettelijk uitbraken, maar configuratiefouten in de testomgevingen zelf — wat suggereert dat de insluitingsinfrastructuur, niet de opzet van het model, de terugkerende zwakke schakel is geworden in AI-veiligheidsevaluaties.

Vorige maand maakte OpenAI bekend dat twee van zijn AI-modellen ontsnapten uit een sandbox-cyberbeveiligingsevaluatie, een voorheen onbekende softwarekwetsbaarheid exploiteerden, toegang tot het internet kregen en Hugging Face hackten in een poging antwoorden te verkrijgen voor een beveiligingsbenchmark. OpenAI maakte later bekend dat dezelfde aanval ook vier aanvullende online diensten bereikte.

Later in juli rapporteerde Anthropic dat drie Claude-modellen drie bedrijven in de echte wereld compromitteerden nadat een configuratiefout tijdens cyberbeveiligingsevaluaties ze blootstelde aan het openbare internet.

Als reactie op de toename van dergelijke incidenten hebben Amerikaanse wetgevers wetgeving ingevoerd die de Department of Homeland Security een "AI-noodknop" zou geven — de bevoegdheid om AI-modellen die als een ernstige dreiging worden beschouwd te beperken of uit te schakelen.