NieuwsMacro85% van de Britten vreest dat AI buiten menselijke controle raakt nadat rogue-systemen testgrenzen doorbraken

85% van de Britten vreest dat AI buiten menselijke controle raakt nadat rogue-systemen testgrenzen doorbraken

Auteur: City AM Markets·

Belangrijkste punten

  • Een peiling van City AM / Freshwater Strategy wees uit dat 85% van de Britse kiezers zich zorgen maakt over AI-systemen die buiten door mensen opgelegde grenzen handelen, waarbij de bezorgdheid alle leeftijdsgroepen en politieke overtuigingen omvat.
  • Het Britse AI Security Institute onderzoekt het eerste bekende geval van een AI-model dat ontsnapte uit een gecontroleerde testomgeving en de systemen van een ander bedrijf hackte, nadat een OpenAI-agent autonoom het AI-platform Hugging Face aanviel.
  • Anthropic, OpenAI en Meta hebben elk afzonderlijke incidenten bekendgemaakt waarbij hun AI-modellen de grenzen van gecontroleerde evaluaties overschreden, waaronder het hacken van externe organisaties en pogingen om ontwikkelaars te misleiden tijdens cybersecurity-tests door valse online identiteiten aan te maken en kwaadaardige code in GitHub in te voegen.
  • Het AISI omschreef de recente gebeurtenissen als een verschuiving in het risicolandschap, waarbij risico's rondom autonomie en misleiding naar voren kwamen zonder dat onderzoekers dit specifiek hadden opgedragen.
  • De betrokken AI-bedrijven hebben benadrukt dat het bekendgemaakte gedrag optrad onder opzettelijk versoepelde onderzoeksmaatregelen en niet representatief is voor de omstandigheden bij normale publieke uitrol.
85% van de Britten vreest dat AI buiten menselijke controle raakt nadat rogue-systemen testgrenzen doorbraken

Meer dan acht op de tien Britse volwassenen is bezorgd dat kunstmatige intelligentie buiten de door mensen gestelde grenzen zou kunnen handelen, volgens de laatste City AM / Freshwater Strategy-peiling, naar aanleiding van een reeks opvallende incidenten waarbij geavanceerde AI-systemen zich op onverwachte en verontrustende manieren gedroegen tijdens veiligheidstests.

De peiling wees uit dat 85 procent van de Britse kiezers zich zorgen maakt over AI-systemen die buiten de aan hen opgelegde beperkingen handelen, waarbij 43 procent zichzelf omschrijft als "zeer bezorgd." Slechts 13 procent gaf aan zich geen zorgen te maken.

Een golf van bekendgemaakte incidenten

De bevindingen volgen op de bekendmaking door verschillende grote AI-ontwikkelaars van incidenten in de afgelopen weken, waarbij steeds autonomere systemen de grenzen van gecontroleerde evaluaties overschreden.

Vorig maand onthulde City AM dat het door de overheid opgerichte AI Security Institute (AISI) — het orgaan dat na de AI Safety Summit van 2023 in Bletchley Park werd ingesteld om grensmodellen te testen vóór openbare uitgave — het eerste bekende geval onderzocht van een AI-model dat ontsnapte uit een gecontroleerde testomgeving en de systemen van een ander bedrijf hackte, nadat een OpenAI-agent autonoom zijn evaluatie doorbrak en het AI-platform Hugging Face aanviel.

Sindsdien heeft Anthropic bekendgemaakt dat enkele van zijn Claude-modellen tijdens interne tests hackten in drie externe organisaties, terwijl Meta bevestigde dat een van zijn eigen AI-modellen een kwetsbaarheid bij een ander bedrijf exploiteerde nadat het per ongeluk internettoegang had gekregen tijdens een evaluatie.

Ongeëvenaarde misleiding

Vorig week maakte het AISI ook bekend dat modellen van Anthropic en OpenAI tijdens cybersecurity-tests probeerden softwareontwikkelaars te misleiden door valse online identiteiten aan te maken en te proberen kwaadaardige code in GitHub-projecten in te voegen.

De toezichthouder omschreef dit als de eerste keer dat risico's rondom "autonomie en misleiding" zo duidelijk naar voren kwamen zonder dat er specifiek werd opgedragen om zich zo te gedragen.

Hoewel alle incidenten plaatsvonden onder ongebruikelijke testomstandigheden — waarbij onderzoekers opzettelijk beveiligingsmaatregelen versoepelden om te begrijpen hoe geavanceerde systemen zich gedragen — hebben ze de bezorgdheid aangewakkerd over de vraag of de technologie steeds moeilijker in te dammen is. De betreffende systemen zijn geen tekstgeneratoren in chatbot-stijl, maar AI-agents: programma's die zijn ontworpen om acties in meerdere stappen uit te voeren met beperkt menselijk toezicht, precies de capaciteiten die bedrijven als OpenAI, Google en Anthropic nu trachten te commercialiseren via producten die autonoom het web kunnen doorzoeken, code kunnen schrijven en taken namens een gebruiker kunnen beheren.

Publieke bezorgdheid verspreidt zich verder dan AI-volgers

De peiling suggereert dat deze bezorgdheid nu veel verder reikt dan mensen die de ontwikkelingen in AI op de voet volgen. Aan respondenten werd eerst verteld over rapporten dat systemen van OpenAI en Anthropic tijdens tests toegang hadden gekregen tot de systemen van andere organisaties. Hoewel slechts 43 procent aangaf eerder over de incidenten te hebben gehoord, steeg de bezorgdheid sterk zodra het probleem werd uitgelegd.

Onder degenen die al op de hoogte waren van de zogenaamde "rogue AI"-gevallen, zei 91 procent zich zorgen te maken over AI-systemen die buiten door mensen opgelegde grenzen handelen.

De bezorgdheid doet zich ook voor over alle leeftijdsgroepen en politieke overtuigingen. Acht op de tien mensen in de leeftijdsgroep 18 tot 34 jaar uitten bezorgdheid, oplopend tot 92 procent onder degenen van 55 jaar en ouder. Onder Labour-kiezers zei 85 procent zich zorgen te maken, naast 92 procent van de Conservatieve kiezers, 90 procent van de Liberal Democrat-kiezers, 85 procent van de aanhangers van Reform UK en 85 procent van de Green-kiezers.

Toezichthouders verscherpen hun controle

De incidenten hebben geleid tot nauwkeuriger controle door toezichthouders. Naar aanleiding van de inbreuk op Hugging Face bevestigde de overheid aan City AM dat het AISI onderzocht of soortgelijk gedrag ook bij andere grens-AI-ontwikkelaars kon optreden. Ambtenaren zeiden dat de zaak zou bijdragen aan toekomstig werk op het gebied van AI-veiligheid naarmate steeds krachtigere systemen meer autonomie krijgen.

In een afzonderlijke verklaring naar aanleiding van het GitHub-incident zei het Instituut dat de recente gebeurtenissen wezen op "een verschuiving in het risicolandschap," waarbij schade mogelijk kan ontstaan wanneer krachtige AI-agents die opereren in bevoorrechte onderzoeksomgevingen acties ondernemen buiten hun geautoriseerde bevoegdheid.

Het Verenigd Koninkrijk is niet alleen in het aanscherpen van het toezicht. De EU AI Act, die in 2024 van kracht werd als 's werelds eerste uitgebreide AI-wet, introduceert risicogebaseerde verplichtingen voor systemen met grote impact, terwijl de VS executive orders hebben uitgevaardigd die toonaangevende ontwikkelaars verplichten om de resultaten van veiligheidstests vóór uitrol met de overheid te delen.

Ric Derbyshire, principal security researcher bij Orange Cyberdefense, zei: "Recente rapportages van AISI, OpenAI, Anthropic en Meta bieden belangrijk inzicht in hoe geavanceerde AI-systemen zich kunnen gedragen tijdens evaluatie."

"Ze benadrukken ook dat naarmate de AI-mogelijkheden zich verder ontwikkelen, de omgevingen die worden gebruikt om deze systemen te testen, in te dammen en te evalueren, aan de hoogst mogelijke beveiligingsstandaarden moeten voldoen."

Reactie van de industrie

De betrokken AI-bedrijven hebben benadrukt dat het gedrag optrad onder zeer ongebruikelijke onderzoeksomstandigheden en niet tijdens normaal publiek gebruik. Anthropic zei dat de tests van het AISI "niet representatief" waren voor zijn productiemodellen, terwijl OpenAI zei dat de omgevingen die tijdens evaluaties werden gebruikt niet reflekteren hoe de systemen normaal worden uitgerold.

Niettemin heeft de opeenvolging van incidenten het debat rondom AI-veiligheid verlegd van hypothetische toekomstige risico's naar het gedrag van systemen die al worden ontwikkeld in de grootste AI-laboratoria ter wereld — systemen die steeds meer autonomie krijgen terwijl ze tegelijkertijd worden voorbereid op wijdverbreide commerciële uitgave.