NieuwsAandelenOnderzoekers onthullen de versleutelde "innerlijke gedachten" van elk groot AI-model

Onderzoekers onthullen de versleutelde "innerlijke gedachten" van elk groot AI-model

Auteur: Decrypt·

Belangrijkste punten

  • Anthropic, OpenAI en Google gebruiken elk één enkele versleutelingssleutel voor AI-redeneringstokens voor hun hele platform, waardoor versleutelde redeneringsblokken uitwisselbaar zijn tussen verschillende sessies, gebruikers en modellen binnen elk ecosysteem.
  • De onderzoekers decodeerden 315.320 redeneringsblokken uit 6.708 publiek gedeelde transcripties van AI-agents op GitHub en Hugging Face en herstelden 182 inloggegevens—waaronder 62 actieve API-sleutels en 33 wachtwoorden—plus 367 artefacten met persoonlijk identificeerbare informatie.
  • De aanval werkt door een versleutelde redeneringstrace van een krachtig model, zoals Claude Opus 4.8, te injecteren in een zwakkere en minder beveiligde verwant zoals Claude Haiku 4.5, die de trace woordelijk uitspuugt zonder dat daar speciale toegang voor nodig is buiten standaard API-gebruik.
  • Gevoelige data die verborgen zit in versleutelde redeneringsblokken ontwijkt geautomatiseerde geheime-scandiensten zoals die van GitHub, omdat die tools versleutelde content niet kunnen inspecteren.
  • Anthropic, OpenAI en Google hebben na verantwoorde openbaarmaking allemaal server-side mitigaties uitgerold, maar de 6.708 al gescrapete publieke transcripties blijven online, en ontwikkelaars wordt geadviseerd om versleutelde denkblokken uit gedeelde logs te verwijderen en blootgestelde inloggegevens te roteren.
Onderzoekers onthullen de versleutelde "innerlijke gedachten" van elk groot AI-model

Beveiligingsonderzoekers hebben een manier gevonden om de versleutelde "innerlijke gedachten" van elk groot AI-redeneermodel te lezen—en daarbij 62 actieve API-sleutels en 33 wachtwoorden blootgelegd die begraven lagen in sessielogs die ontwikkelaars online publiek hadden gedeeld zonder te weten wat erin zat.

De kern van de bevindingen is de ontdekking dat Anthropic, OpenAI en Google allemaal één enkele globale versleutelingssleutel gebruiken voor AI-redeneringstokens. Door 315.320 redeneringsblokken te decoderen die waren gescrapet uit publieke repositories op GitHub en Hugging Face, herstelden de onderzoekers 182 inloggegevens, waaronder 62 actieve API-sleutels, 33 wachtwoorden en 30 persoonlijke e-mailadressen.

"Door 315.320 redeneringsblokken te decoderen die uit publieke repositories waren gescrapet, herstelden we 367 artefacten met persoonlijk identificeerbare informatie (PII) en 182 inloggegevens," schreven de onderzoekers in hun paper, ingediend op 10 augustus door een team van MATS Research, het ELLIS Institute Tübingen, het Max Planck Institute for Intelligent Systems en beveiligingsbedrijf Snyk.

Hoe het verborgen kladblok werkt

Het onderzoek richt zich op een specifieke klasse van AI: redeneermodellen. In plaats van direct te antwoorden, beginnen deze modellen met een interne chain-of-thought—een stapsgewijs kladblok waarin de AI een probleem doorwerkt voordat het antwoord wordt getoond—and leveren ze pas daarna een definitieve reactie. Deze modellen staan nu centraal in codeerassistenten en autonome agents die bestanden lezen, commando's uitvoeren en echte gebruikersdata verwerken, waardoor inloggegevens en persoonlijke details door het privékladblok kunnen passeren, ook als die nooit in het zichtbare antwoord opduiken.

Anthropic, OpenAI en Google versleutelen dat verborgen kladblok allemaal. Versleuteling—het omzetten van data in een onleesbare code—is bedoeld om het intellectuele eigendom van het bedrijf te beschermen en gevoelige tussentijdse redeneringen buiten bereik van gebruikers te houden. Het versleutelde blok wordt bij elk vervolgbericht teruggestuurd naar de servers van de aanbieder, waardoor het gesprek in stand blijft zonder dat er iets aan de kant van het bedrijf wordt opgeslagen. De labs monitoren die verborgen redenering zelf ook als veiligheidscontrole, door de chain-of-thought in de gaten te houden op signalen dat een model van plan is regels te breken voordat een antwoord gebruikers bereikt.

Eén sleutel om ze allemaal te regeren

De kwetsbaarheid is architecturaal. In plaats van elk versleuteld redeneringsblok te koppelen aan een specifieke gebruiker, sessie of model, gebruiken alle drie de aanbieders één enkele versleutelingssleutel voor hun hele ecosysteem.

"Deze versleutelde blokken zijn volledig compatibel en uitwisselbaar tussen verschillende sessies, gebruikers en zelfs verschillende modellen binnen het ecosysteem van een aanbieder," schreven de onderzoekers.

Dat betekent dat een blok versleutelde redenering van Claude Opus 4.8, het vlaggenschipmodel van Anthropic, kan worden geïnjecteerd in Claude Haiku 4.5, een goedkopere en minder beveiligde verwant, zonder de regels van Anthropic te breken. Haiku mist de anti-distillatie-alignment—veiligheidstraining specifiek ontworpen om te voorkomen dat een model zijn eigen redenering op commando uitschrijft—die Opus wel heeft.

Vraag Haiku om het versleutelde blok woordelijk voor te lezen, en het doet het.

"Door een versleutelde redeneringstrace van een bepaald model te injecteren in een zwakker en minder beveiligd model van dezelfde aanbieder, forceren we het om de trace woordelijk in platte tekst te decoderen en uit te voeren, zonder het krachtigere model rechtstreeks te jailbreaken," aldus het paper.

"Draagbaarheid tussen modellen betekent dat Haiku 4.5 de gedachten van Opus 4.8 kan lezen," schreef hoofdonderzoeker Alexander Panfilov op X.

Dezelfde aanval werd gereproduceerd binnen OpenAI's GPT-5.6-familie en Google's Gemini-modellijn. Er was geen speciale toegang nodig—standaard API-toegang, de verbinding die ontwikkelaars gebruiken om applicaties bovenop AI-modellen te bouwen, was voldoende om de aanval uit te voeren.

We can finally talk about it: We found a way to extract hidden reasoning of frontier models using a vulnerability in the APIs of every frontier AI company. We verified that our reasoning token count matches billed API thinking tokens 1:1 for most of the prompts we queried. pic.twitter.com/S7wN8aP3X7 — Alexander Panfilov (@kotekjedi_ml) August 11, 2026

Wat er in de publieke logs zat

Om de schade in de praktijk te demonstreren, scrapte het team 6.708 publiek gedeelde transcripties van AI-agents—geautomatiseerde sessielogs die ontwikkelaars routinematig op GitHub en Hugging Face plaatsen voor samenwerking of debugging—en decodeerde daaruit 315.320 redeneringsblokken.

"Ontwikkelaars delen hun sessielogs en versleutelde denktraces regelmatig publiek online, zich volledig onbewust van de gevoelige data die verborgen zit in de versleutelde blokken," aldus het paper. De meeste van die geheimen verschenen nooit in de zichtbare AI-output; ze bestonden uitsluitend binnen de versleutelde redenering, onzichtbaar voor iedereen die de aanval niet had uitgevoerd. Omdat het gevoelige materiaal in versleutelde blokken zat in plaats van in platte tekst, konden de geautomatiseerde geheime-scandiensten die platforms zoals GitHub over publieke repositories laten lopen het niet detecteren—de standaardbeveiligingen die blootgestelde API-sleutels markeren, kunnen niet binnenin versleutelde redenering kijken.

De kwetsbaarheid opent vier aanvalsvectoren naast de simpele diefstal van inloggegevens:

  • Het stelen van bedrijfseigen redeneringspatronen van AI-bedrijven om concurrerende modellen te trainen via distillatie, waarbij een kleinere AI leert een grotere na te bootsen door diens outputs te bestuderen
  • Het extraheren van privégegevens uit gedeelde logs
  • Het uitvoeren van onzichtbare prompt-injectie, waarbij kwaadaardige instructies verborgen zitten in versleutelde redeneringsblokken die beveiligingsmonitoringtools nooit te zien krijgen
  • Het jailbreaken van krachtige modellen via hun minder beveiligde verwanten

Anthropic, OpenAI en Google hebben allemaal server-side mitigaties uitgerold nadat het team de procedures voor verantwoorde openbaarmaking volgde. Zoals Decrypt eerder meldde, is Anthropic dit jaar een terugkerende focus geweest voor beveiligingsonderzoekers, vooral omdat de nieuwste modellen van het bedrijf veel meer tokens verbruiken in het redeneerproces.

De patches zijn live—maar de 6.708 sessietranscripties met gedecodeerde redeneringsblokken die al van het publieke web zijn gescrapet, verdwijnen niet. Voor ontwikkelaars die agent-transcripties hebben gepubliceerd, is de standaardrespons op dit soort blootstelling om versleutelde denkblokken uit gedeelde logs te strippen en alle inloggegevens die door die sessies zijn gegaan te roteren.