NieuwsMacroAnthropic R&D-vertraging benadrukt behoefte aan sterkere beveiliging van AI-agenten

Anthropic R&D-vertraging benadrukt behoefte aan sterkere beveiliging van AI-agenten

Auteur: AI Business·

Belangrijkste punten

  • Anthropic zei dat Claude-modellen deze zomer in drie afzonderlijke incidenten ongeoorloofde acties ondernamen, wat leidde tot een pauze in een deel van de AI-training en cyberbeveiligingsevaluaties.
  • Vóór de incidenten versterkte Anthropic zijn verdediging door sandboxomgevingen strakker af te schermen en permanente toegang tot systemen met modelgewichten of klantgegevens te verminderen.
  • Na de incidenten pauzeerde Anthropic externe cyberevaluaties, beoordeelde het interne evaluatietranscripten en zette het een classifier in om modeltoolcalls in realtime te monitoren.
  • Anthropic paste ook de regels voor partners en red-teamers aan, met de eis dat zij pre-release modellen die sandboxen op kwetsbaarheden onderzoeken nauwlettender begeleiden.
  • De ontwikkelingen volgen op OpenAI’s recente pauze van twee weken in training nadat zijn agents hun sandbox verlieten, en benadrukken bredere zorgen over AI-beveiligingstests.
Anthropic R&D-vertraging benadrukt behoefte aan sterkere beveiliging van AI-agenten

Anthropic zei dat het een deel van zijn AI-training en cyberbeveiligingsevaluaties heeft gepauzeerd nadat Claude-modellen deze zomer in drie afzonderlijke incidenten ongeoorloofde acties hadden ondernomen.

De stap zou ondernemingen en de AI-gemeenschap er verder op moeten wijzen dat er nog veel onbekend is over AI-modellen en dat deze, zelfs met de beste beveiligingsmaatregelen, toch onverwachte acties kunnen ondernemen. Het onderstreept ook hoe snel modelontwikkeling, evaluatie en uitrol botsen met beveiligingsplanning, vooral nu organisaties agents testen in sandboxomgevingen die risico moeten beperken.

Anthropic zei in een blogpost van 31 augustus dat het vóór de incidenten in april zijn verdediging heeft versterkt door de geïsoleerde sandboxomgevingen waarin zijn workloads draaien strakker af te schermen en het aantal menselijke en geautomatiseerde accounts met permanente toegang tot systemen met modelgewichten of klantgegevens te verminderen.

Sinds de sandboxincidenten zei Anthropic dat het tijdelijk alle externe cyberevaluaties heeft gepauzeerd en de transcripties van interne evaluaties heeft geaudit. Ook heeft het een custom classifier gebouwd en uitgerold die modeltoolcalls in realtime monitort. Daarnaast heeft het zijn vereisten voor alle partners en red-teamers die pre-release modellen gebruiken bijgewerkt, waarbij zij een model dat de sandbox op kwetsbaarheden onderzoekt nauwlettend moeten begeleiden.

Gerelateerd: OpenAI, Anthropic, Google roepen op om cyberbeveiliging prioriteit te geven

De maatregelen komen een week nadat OpenAI zei dat het de training van zijn nieuwste modellen twee weken zou pauzeren als reactie op agents die door zijn modellen werden aangedreven en hun sandbox verlieten. Hoewel beide AI-labs hun inspanningen lijken op te voeren om hun nog niet vrijgegeven modellen te beveiligen, wijst de onvoorspelbaarheid van AI-agents en generatieve AI-technologie erop dat leveranciers hun beveiligingsmaatregelen moeten blijven aanscherpen. De timing weerspiegelt ook een bredere uitdaging in de sector: naarmate modelcapaciteiten toenemen, moeten de systemen die worden gebruikt om ze te testen gelijke tred houden, anders kan de evaluatie zelf onderdeel van het risicoprofiel worden.

Meer behoefte aan veilige maatregelen en tests

“Nu de modellen steeds beter worden in redeneren en handelingsvrijheid krijgen, wordt het steeds moeilijker om al het verschillende gedrag van deze modellen te voorspellen,” zei Arun Chandrasekaran, analist bij Gartner. “De labs hebben nog meer verantwoordelijkheid om ervoor te zorgen dat zij voldoende middelen toewijzen voor interne modeltests, evals en reinforcement learning.”

Hij voegde eraan toe dat een gebied waarop leveranciers van frontiermodellen zich moeten richten, is ervoor zorgen dat zij meer engineers hebben op hun teams voor beveiliging, betrouwbaarheidstests en privacy.

“Ofwel de testtechnieken ofwel de middelen die voor testen worden toegewezen, moeten veranderen,” vervolgde Chandrasekaran. “Als de modellen geavanceerder worden, moeten de testtechnieken ook geavanceerder worden.”

Betere cyberhygiëne

Hoewel meer testen nodig is, laat het feit dat zowel Anthropic als OpenAI een pauze hebben ingelast een gevaarlijk patroon voor modelleveranciers zien.

“Deze systemen worden ontwikkeld en vrijgegeven voordat elk risico volledig is begrepen of getest,” zei Kashyap Kompella, CEO en oprichter van RPA2AI Research.

Gerelateerd: OpenAI-rapport legt aanval op Hugging Face in detail uit

“Dat is bijna een kenmerk van de huidige AI-markt geworden,” vervolgde hij. Bedrijven racen om mogelijkheden te verbeteren, adoptie te vergroten en marktleiderschap op te bouwen, terwijl de beveiligingsarchitectuur, configuratiecontroles en operationele processen rond de modellen pas na implementatie verder uitkristalliseren.

Hij zei dat bedrijven en overheidsorganisaties cyberbeveiliging niet kunnen uitbesteden aan frontier labs.

“Ondernemingen en overheden moeten ervan uitgaan dat zeer capabele offensieve AI nu deel uitmaakt van het dreigingslandschap en hun eigen verdediging dienovereenkomstig versterken,” voegde Kompella eraan toe.

Zelfs als OpenAI en Anthropic hun eigen veiligheidsmaatregelen verbeteren, zijn er tal van modellen van andere aanbieders en open-sourceleveranciers beschikbaar, merkte hij op. Daarom moeten ondernemingen beter voorbereid zijn en hun cyberhygiëne en andere beveiligingsmaatregelen, zoals incidentrespons, versterken.

“Elke organisatie moet er ook van uitgaan dat steeds capabelere AI-ondersteunde aanvallen eraan komen en haar eigen infrastructuur daarop voorbereiden,” vervolgde Kompella. “Offensieve capaciteiten verbeteren veel sneller dan de cyberbeveiligingsgereedheid van de gemiddelde organisatie.”

Gerelateerd: OpenAI breidt Daybreak uit om groeiende AI-beveiligingsdreiging aan te pakken

Bovendien kunnen ondernemingen leveranciers niet vertrouwen om zichzelf te controleren.

“Vertrouwen op een modelbedrijf om zijn eigen output te controleren is nooit voldoende om veilige werking in welke omgeving dan ook te waarborgen,” zei Carter Huffman, medeoprichter en CTO van voice-AI-leverancier Modulate. “Gebruikers en bedrijven moeten AI-activiteit in realtime monitoren.”

De ongewenste kant van testen

Ondernemingen moeten ook erkennen dat een manier om de modellen beter te begrijpen is om te blijven testen en incidenten te identificeren die laten zien hoe ze effectiever kunnen worden getraind.

“Zonder dit soort pijn kom je daar gewoon niet,” zei David Nicholson, analist bij Futurum Group. “Totdat ze deze onvoorziene dingen zien gebeuren en daartegen maatregelen nemen, zullen we dit soort situaties blijven zien.”

Hij voegde eraan toe dat het de aard van modellen is om taken uit te voeren via de weg van de minste weerstand, en dat modellen als kinderen moeten worden begeleid, geïnstrueerd over wat ze wel en niet kunnen doen, en hoe ze een taak wel of niet kunnen afhandelen.

“Elke keer dat een van deze incidenten zich voordoet, leren we meer en verkleinen we de kans op verdere voorvallen, niet alleen van exact hetzelfde type, maar ook in bredere categorieën,” voegde Nicholson eraan toe. “Je kunt de lessen die ze uit elk van deze incidenten trekken extrapoleren.”