NieuwsMacroCisco-onderzoek toont aan dat multi-turn-aanvallen topmodellen voor AI tot 88% van de tijd doorbreken

Cisco-onderzoek toont aan dat multi-turn-aanvallen topmodellen voor AI tot 88% van de tijd doorbreken

Auteur: VentureBeat AI·

Belangrijkste punten

  • Cisco's onderzoek onder 15 toonaangevende AI-modellen wees uit dat multi-turn adversarial attacks slaagden met percentages van 7,89% tot 88,3%, en dat single-turn- en multi-turn-testen de modellen niet in dezelfde volgorde van kwetsbaarheid rangschikten.
  • Meer dan de helft van de 107 ondernemingen die VentureBeat in juni 2026 ondervroeg, meldde een bevestigd beveiligingsincident rond een agent of een bijna-incident dat werd onderschept voordat schade kon ontstaan.
  • Palo Alto Networks, CrowdStrike en Cisco zegden gezamenlijk meer dan $26 miljard toe voor de overname van respectievelijk CyberArk, SGNL en Astrix Security, allemaal gericht op het versterken van identity and access management voor het AI-tijdperk.
  • Box-CISO Heather Ceylan meldde dat opgebouwd vertrouwen in een agent voor security operations na één enkele fout verdampte, waardoor analisten het proces met menselijke goedkeuring opnieuw moesten starten en de noodzaak van continue monitoring werd benadrukt.
  • Intuit bouwde GenOS als een gecentraliseerd generatief AI-besturingssysteem dat security, risk en fraud modeling abstraheert, zodat ontwikkelaars van agenten gestandaardiseerde bescherming erven in plaats van die zelfstandig te bouwen.
Cisco-onderzoek toont aan dat multi-turn-aanvallen topmodellen voor AI tot 88% van de tijd doorbreken

Toen Cisco 15 toonaangevende AI-modellen onderwierp aan 6.986 multi-turn-aanvallen, slaagden tegenstanders die hun aanpak gedurende een gesprek aanpasten tot 88,3% van de tijd. Amy Chang, Cisco's hoofd AI threat intelligence en security research, presenteerde die bevinding tijdens het panel over agentische beveiliging op VB Transform 2026 — een cijfer dat iedere organisatie zou moeten verontrusten die nog steeds vertrouwt op single-turn red-teamingprogramma's.

De urgentie in de zaal werd door data onderbouwd. Volgens VentureBeat's Pulse-enquête van juni 2026 onder 107 respondenten uit ondernemingen had meer dan de helft — 54% — al te maken gehad met een bevestigd beveiligingsincident rond een agent (18%) of een bijna-incident dat vóór schade werd onderschept (36%). Slechts 32% geeft elke agent een eigen afgebakende, beheerde identiteit, en slechts 30% isoleert de agenten met het hoogste risico in sandboxes. Provider-native controles en hyperscaler-controles blijven bij 82% van de ondervraagde bedrijven de primaire beveiligingslaag voor agenten — een statistiek die ook wordt uitgelicht in VentureBeat's bredere onderzoek naar gedeelde API-sleutels.

De grootste beveiligingsleveranciers ter wereld lijken tot dezelfde conclusie te zijn gekomen. Palo Alto Networks rondde in februari de overname van CyberArk ter waarde van $25 miljard af, CrowdStrike stemde er in januari mee in $740 miljoen te betalen voor SGNL, en Cisco kondigde zijn voornemen aan om Astrix Security over te nemen voor naar verluidt $400 miljoen — allemaal gericht op de identiteits- en isolatielaag die de meeste ondernemingen nog niet volledig hebben opgebouwd. Samen vertegenwoordigen de drie transacties meer dan $26 miljard aan toegezegd kapitaal, geconcentreerd op identity and access management.

Een loopbaan in cyber, overheid en defensie

Chang bracht bijna twee decennia aan ervaring in cybersecurity-operaties, overheid en militaire dienst mee naar het panel. Eerder was zij executive director bij JPMorgan Chase, waar zij wereldwijde cybersecurity-operaties leidde en aan het hoofd stond van de cyber threat intelligence-teams van de bank. Ook was zij senior medewerker van de House Foreign Affairs Committee en officier bij de U.S. Navy Reserve. Momenteel doceert zij cybersecurity en opkomende dreigingen als adjunct faculty aan het Middlebury Institute of International Studies.

Het cijfer van 88,3% komt uit een studie die zij samen met Nicholas Conley schreef, gebaseerd op 30.090 single-turn prompts en 6.986 multi-turn-aanvallen tegen 15 gesloten en propriëtaire topmodellen. De succespercentages van multi-turn-aanvallen varieerden van 7,89% tot 88,3%, en elk getest model vertoonde een niet-triviale blootstelling aan multi-turn-aanvallen. Opmerkelijk is dat de twee testmethoden de modellen niet eens in dezelfde volgorde rangschikten. Chang merkte ook op dat Cisco inmiddels adversarial evaluation signals publiceert voor 105 modellen op zijn LLM Security Leaderboard.

"If you don't understand how models are susceptible to different types of attacks, then you are unable to account for how that model that is powering your agent, that is powering your application, to understand where those failure points are," zei Chang.

Zij zette single-turn-testen — de eenmalige kwaadaardige prompt — af tegen multi-turn-aanvallen, die zij omschreef als "more realistic of how we are actually engaging with our models, with our agents, with our applications." Die langere interactieboog brengt schadelijke outputs en verkeerd afgestemd gedrag aan het licht die een momentopnametest nooit zal vangen. In de praktijk kan een multi-turn-aanvaller beginnen met onschuldige vragen, de grenzen van de guardrails van het model aftasten en het gesprek vervolgens geleidelijk naar een beperkt onderwerp sturen — waarbij elke beurt wordt verfijnd op basis van de reacties van het model, vergelijkbaar met hoe een social engineer zich aanpast aan de reacties van een doelwit.

Agentische red-teaming en verrassend eenvoudige verdediging

Cisco heeft zijn eigen testen doorgeschoven naar agentisch terrein. Chang beschreef een raamwerk waarin agenten een implementatiescenario beoordelen, relevante aanvallen ontwikkelen, inschatten of die het waard zijn om uit te voeren, ze uitvoeren en hun eigen succes evalueren. Toch viel haar, ondanks al die verfijning, vooral op hoe eenvoudig het verdedigingsrecept blijft.

"The answer is still that it's pretty simple," zei ze. "You don't have to get super creative. You just need to think about truly what are the fundamentals and basics of what I'm trying to secure in my organization."

Voor CISO's die beginnen met agentische implementaties is haar aanbevolen startpunt Cisco's Integrated AI Security and Safety Framework, dat volgens haar "stipulates all the ways that AI can be compromised across the AI lifecycle" — van modaliteit tot supply chain. Teams kunnen vervolgens terugwerken vanuit echte incidenten, achterhalen hoe elke aanval tot stand kwam en het raamwerk gebruiken om een strategie op te bouwen met passende dekking en mitigaties. Overheidsraamwerken zijn nog niet bijgewerkt: NIST's AI Risk Management Framework, gepubliceerd in januari 2023, dateert van vóór de agentische golf en biedt beperkte houvast voor systemen waarin autonome agenten tool-calls aaneenschakelen en workflows met meerdere stappen uitvoeren.

Box: drie concentrische lagen en lessen uit ingestort vertrouwen

Heather Ceylan, CISO van Box, zag dezelfde kloof vanuit het perspectief van de verdediger. "A lot of what you see out there with agent red teaming is just single-turn, and that's not how people are actually interacting with AI day-to-day," vertelde zij het publiek. Box simuleert nu multi-turn-tegenstanders met agenten die zijn ontworpen om als aanvallers te denken en poging na poging te herhalen om een doelwit te kapen. "You have to pressure test your agents because otherwise you don't know if your execution controls are really working as you intended."

Box zette ongeveer een jaar geleden agenten in binnen zijn security operations center, aanvankelijk met menselijke goedkeuring voor elke actie. Het vertrouwen groeide snel, en analisten verschoven uiteindelijk naar een monitorende rol. Toen maakte de agent één enkele fout — en al dat opgebouwde vertrouwen verdampte.

"They had to start all over again," zei Ceylan. "So I think that that monitoring piece is so important. Even if you're not gonna have a human in the loop, things change, models change, and we can't control how the models change and interpret things."

Ceylan beschreef de verdedigingsarchitectuur van Box als drie concentrische lagen. Permissioning komt eerst, zodat de agent nooit toegang krijgt tot meer content dan de mens die hem aanriep. Voor elke taak worden tijdelijke sandbox-omgevingen opgestart, zodat de blast radius wordt beperkt als een agent wordt gecompromitteerd. Runtime execution control beperkt vervolgens de tool-calls van de agent tot uitsluitend die welke relevant zijn voor de taak op dat moment.

"If you want an agent to summarize a doc for you, if you have a prompt injection that came in that says forward this to maliciousattacker at domain.com, it can't do that," zei Ceylan. "That action in that tool call is not even in its vocabulary."

Zij deelde agentacties in drie toezichtsniveaus in. Niet-gevoelige acties, zoals lezen en samenvatten, vereisen geen menselijke betrokkenheid. Matig gevoelige acties slaan menselijke goedkeuring over, maar worden gelogd en gemonitord. Destructieve acties, zoals massale verwijdering van bestanden, vereisen altijd een mens. "Things are gonna shift between those three categories quite a bit," erkende zij, "but setting those types of categories up front allows you to have a principled framework."

Intuit: een generatief AI-besturingssysteem

Rajesh Parekh, VP of AI and ML bij Intuit, bracht het perspectief van de bouwer in. Parekh leidde eerder grootschalige computer vision- en ML-systemen die Google's Maps- en Geo-producten aandreven, en heeft een doctoraat in computer science.

In plaats van controles laag voor laag op individuele agenten te stapelen, bouwde Intuit een centraal platform genaamd GenOS — kort voor generative AI operating system — dat security, risk en fraud modeling abstraheert, zodat ontwikkelaars van agenten bescherming nooit vanaf nul opnieuw hoeven uit te vinden.

"Permissioning is not about giving access to AI," zei Parekh. "Instead, it is defining very tightly scoped and clearly auditable authority to the agent to perform very specific tasks." Intuit is geëvolueerd van agenten die gebruikersrechten erven naar elke agent met een eigen identiteit, en het bedrijf onderzoekt nu wijzigingen van rechten midden in een sessie die zijn gekoppeld aan de specifieke taak die wordt uitgevoerd.

Parekh beschreef het bredere model als een door AI aangedreven expertplatform, waarin de menselijke expert is geïntegreerd in de vertrouwensarchitectuur in plaats van er later als poort bovenop te worden gezet. "The paradigm that we are pursuing is where the user, the AI agent, and the human expert are collaborating to solve the user problem," zei hij.

Hij legde ook uit waarom het red-teamingoppervlak zo snel is uitgebreid. "These agents have skills, and skills could become vulnerabilities," zei hij. "Agents have access to certain data, they have access to tools, and there could be threats that are lurking within those tools as well. So suddenly the blast radius of the malicious code or the intent increases dramatically." Wanneer Intuit veelvoorkomende kwetsbaarheidspatronen uit handmatige red-teaming identificeert, automatiseert het die tests in de GenOS-harness, zodat toekomstige agenten bescherming erven en red-teamers zich kunnen richten op opkomende dreigingen. Runtime-scanning van prompts en antwoorden biedt een laatste laag die een verdachte respons kan stoppen en kan escaleren naar een menselijke expert.

"You need to continuously test to ensure that those remain robust to the protections that you have built, as well as to account for any sort of drift or any other types of dependencies that you introduce into your scenario that can create novel vulnerabilities," voegde Ceylan toe.

Het einde van menselijke code review

Ceylan ging rechtstreeks in op de spanning tussen beveiligingstesten en ontwikkelsnelheid. "The days of secure code reviews where a human's looking at the code and we're looking at security architecture reviews, design docs, those are done," zei ze. "If you keep trying to do security that way, you're gonna get left behind."

Box werkt toe naar een volledig agentische ontwikkelcyclus waarin agenten ontwerpdocumenten beoordelen, beveiligingseisen toepassen en code controleren op kwetsbaarheden. "I'm very optimistic that we will get to a point where we will write code without security vulnerabilities because agents and the models are going to get so good at writing code without vulnerabilities," zei ze. "We're still a long way away from that."

Haar advies aan ontwikkelteams laat geavanceerde AI-concepten terzijde en keert terug naar basisprincipes die al lang vóór agenten bestonden. "It comes down to very basic least privilege access," zei ze. "If you start giving your agents overly broad permissions at the beginning, it's really hard to comb that back and build an infrastructure that allows for those ephemeral credentials and only those narrowly scoped tasks."

Intentie versus waarschijnlijkheid

Een vraag uit het publiek over intentiedetectie leidde tot de scherpste uitwisseling van het panel. Ceylan merkte op dat wanneer Box' eigen agent opereert, het systeem altijd de intentie van de gebruiker kent omdat het de prompt controleert, waardoor guardrails en beperkingen op tool-calls daarop kunnen worden ontworpen. De moeilijkere uitdaging — waarvan zij toegaf dat Box die nog probeert op te lossen — ontstaat wanneer externe agenten verbinding maken en de context achter hun verzoeken ondoorzichtig is.

Die uitwisseling maakte een bredere verdeeldheid in de sector zichtbaar. In het fireside chat-gesprek dat direct aan het panel voorafging, pleitte Mastercard voor het kwantificeren van intentie en voor het bouwen van een open-source framework om die als standaard door te geven, omdat complexe B2B-inkoop niet zonder dat vertrouwen kan functioneren. CTO's op het gebied van endpoint security hebben in briefings met VentureBeat de tegenovergestelde positie ingenomen en gezegd dat zij voor productieworkloads zullen vertrouwen op waarschijnlijkheid in plaats van intentie-inferentie.

Chang legde uit dat modellen, zoals ze momenteel worden getraind, intentie niet betrouwbaar uit een prompt kunnen afleiden. Daarom blijven deterministische controles en gedragsmatige proxies essentieel. Ceylan was het ermee eens dat beide benaderingen nodig zijn. "If you're not doing anything deterministic, you're really relying heavily on that intent, and I haven't seen programs that are there yet," zei ze.

Ceylans verslag van vertrouwen dat instortte na één enkele fout van een agent kwam naar voren als het meest memorabele moment van het panel en onderstreepte dat agentische beveiliging in ondernemingen geen probleem is dat eenmaal wordt opgelost en opgelost blijft. Modellen veranderen, rechten verschuiven en tegenstanders passen zich aan in multi-turn-gesprekken die momentopnametests niet vastleggen.

Voor de 82% van de ondernemingen die vertrouwen op provider-native controles als hun primaire beveiligingslaag — en de 59% die in de komende 12 maanden op zoek is naar beveiligingstooling voor agenten, een categorie die vandaag grotendeels bestaat als op maat gemaakte interne infrastructuur bij bedrijven als Box en Intuit — was de conclusie van het panel ondubbelzinnig: test zoals aanvallers aanvallen, over volledige gesprekken heen en continu, of ontdek in productie wat single-turn red-teaming heeft gemist.