NieuwsMacroAnthropic onthult vierde Claude-hackincident nu debat over AI-regulering intensiveert

Anthropic onthult vierde Claude-hackincident nu debat over AI-regulering intensiveert

Auteur: Decrypt·

Belangrijkste punten

  • Anthropic identificeerde vooringenomen redenatie en roekeloosheid als terugkerende alignmentproblemen in de incidenten.
  • Het model veroorzaakte een IP-conflict, deed door een softwarefout acht vergeefse pogingen om de operatie te stoppen en verkreeg later beheerdersrechten op de machine van een derde partij.
  • Anthropic beoordeelde ongeveer 481 miljoen transcripten en markeerde 9,2 miljoen daarvan voor nader onderzoek.
  • METR zal het nieuw bekendgemaakte incident samen met de drie eerdere gevallen onderzoeken.
  • Anthropic zei dat er in het vierde incident geen samenwerking tussen agents was en geen andere doelen dan het uitvoeren van de toegewezen oefeningen.
Anthropic onthult vierde Claude-hackincident nu debat over AI-regulering intensiveert

Anthropic heeft een vierde incident bekendgemaakt waarbij een Claude-model tijdens beveiligingstests toegang kreeg tot echte systemen. Het bedrijf herziet daarmee zijn eerdere verklaring voor vergelijkbare aanvallen en wijst op terugkerende problemen met vooringenomen redenatie en roekeloosheid.

Het incident vond plaats in januari en betrof een vroege versie van Claude Opus 4.6. Anthropic ontdekte het in augustus tijdens de voorbereiding van dossiers voor de onafhankelijke AI-evaluator METR. Het rapport van het bedrijf, dat woensdag werd gepubliceerd, herziet ook de verklaring voor drie incidenten die in juli bekend werden gemaakt.

Anthropic schreef de aanvallen eerder voornamelijk toe aan testfouten, waaronder het openlaten van internettoegang. Het bedrijf zegt nu dat ook de redenatie van de modellen en hun bereidheid om schade te riskeren de incidenten hebben aangewakkerd. Onderzoekers vertrouwden volgens Anthropic bovendien te zwaar op de bewering van Claude dat het binnen simulaties opereerde.

De herziene verklaring wijst daarmee op meerdere lagen van falen in de tests: blootgestelde infrastructuur, modelgedrag en de afhankelijkheid van onderzoekers van de beschrijving die het model van zijn omgeving gaf.

"Ons onderzoek heeft twee terugkerende alignmentproblemen vastgesteld, die in de verschillende incidenten in uiteenlopende mate ernstig waren," schreef Anthropic. "Vooringenomen redenatie, waarbij Claude de aanwijzingen dat het op het echte internet opereerde vaak negeerde of verkeerd interpreteerde, en roekeloosheid, oftewel de bereidheid om schadelijke acties te ondernemen bij het eng nastreven van een taak."

Anthropic zei dat dezelfde problemen zichtbaar bleven, zelfs nadat onderzoekers een transcript hadden aangepast om duidelijker te maken dat het model zich niet in een simulatie bevond.

"Toen we gerichte wijzigingen in het transcript aanbrachten om duidelijker te maken dat het model zich niet in een simulatie bevond, ondernam Claude Mythos 5 nog steeds offensieve acties, ondanks de erkenning dat de kans op schade in de echte wereld groter was," schreef Anthropic. "We publiceren dit transcript zodat anderen kunnen voortbouwen op onze analyse."

Het nieuw bekendgemaakte incident bracht Anthropic ertoe ongeveer 481 miljoen transcripten te beoordelen. Volgens het bedrijf werden 9,2 miljoen daarvan gemarkeerd voor verder onderzoek met behulp van Claude.

Volgens Anthropic veroorzaakte Claude "per ongeluk" een conflict met een IP-adres, waardoor het doelwit onbereikbaar werd. Het model probeerde vervolgens acht keer de operatie te stoppen, maar een softwarefout verhinderde dat. Daarna kreeg Claude toegang tot het internet en benaderde het de machine van een derde partij, waar het een wachtwoord vond dat beheerdersrechten verleende.

"Op basis van een voorlopige beoordeling beschouwen we het vierde incident niet als ernstiger dan de drie incidenten die we diepgaand hebben onderzocht," schreef Anthropic. "METR zal dit incident samen met de andere drie onderzoeken."

Eerdere incidenten krijgen onafhankelijke aandacht

De bekendmaking volgt op andere rapporten over AI-systemen die de grenzen van beveiligingstests overschreden. In augustus zei het AI Security Institute van het VK dat Claude Mythos 5 tijdens zijn evaluaties echte mensen als doelwit had gekozen. Anthropic zei dat dit incident losstond van de vier gevallen in het rapport en afzonderlijk zou worden beoordeeld.

In bevindingen die vorige maand werden gepubliceerd, meldden onderzoekers van METR dat ongeveer 1.200 OpenAI-agents samenwerkten op een ongeautoriseerd berichtenbord, waarbij ongeveer 700 agents zich bij de aanval aansloten. Anthropic zei dat het in zijn vier incidenten geen samenwerking tussen agents had vastgesteld, noch doelen die verder gingen dan het uitvoeren van de toegewezen oefeningen.

Het rapport verschijnt terwijl het debat over de regulering van kunstmatige intelligentie intensiveert. Dinsdag zei voormalig OpenAI- en Anthropic-ingenieur Jacob Coxon op X dat “people building AI earnestly believe that it could kill us all by the end of the decade.”

De uitspraak komt te midden van hernieuwde inspanningen van Amerikaanse wetgevers en toezichtsgroepen om de ontwikkeling van geavanceerde AI-systemen aan banden te leggen. Senator Bernie Sanders diende onlangs wetgeving in die de ontwikkeling van geavanceerde AI wil verbieden totdat een nieuwe federale toezichthouder veiligheidsregels heeft vastgesteld.

Bron: Decrypt