НовостиМакроИсследование Cisco: многоходовые атаки взламывают флагманские ИИ-модели в 88% случаев

Исследование Cisco: многоходовые атаки взламывают флагманские ИИ-модели в 88% случаев

Автор: VentureBeat AI·

Ключевые выводы

  • Исследование Cisco по 15 флагманским ИИ-моделям показало, что многоходовые состязательные атаки успешны с частотой от 7.89% до 88.3%, а одноходовое и многоходовое тестирование ранжировали модели по уязвимости в разном порядке.
  • Более половины из 107 предприятий, опрошенных VentureBeat в июне 2026 года, сообщили о подтвержденном инциденте безопасности агента или почти инциденте, перехваченном до причинения вреда.
  • Palo Alto Networks, CrowdStrike и Cisco совокупно направили более $26 млрд на приобретение CyberArk, SGNL и Astrix Security соответственно, сосредоточившись на усилении управления идентификацией и доступом для эпохи ИИ.
  • CISO Box Heather Ceylan сообщила, что накопленное доверие к агенту в центре операций безопасности исчезло после одной ошибки, вынудив аналитиков заново начать процесс человеческого одобрения и подчеркнув необходимость непрерывного мониторинга.
  • Intuit создала GenOS как централизованную операционную систему генеративного ИИ, которая абстрагирует моделирование безопасности, рисков и мошенничества, чтобы разработчики агентов наследовали стандартизированную защиту, а не создавали ее самостоятельно.
Исследование Cisco: многоходовые атаки взламывают флагманские ИИ-модели в 88% случаев

Когда Cisco подвергла 15 флагманских ИИ-моделей 6,986 многоходовым атакам, противники, адаптировавшие свой подход по ходу диалога, добивались успеха вплоть до 88.3% случаев. Amy Chang, руководитель Cisco по разведке ИИ-угроз и исследованиям безопасности, представила этот результат на панели по агентной безопасности на VB Transform 2026 — показатель, который должен обеспокоить любую организацию, все еще полагающуюся на одноходовые программы red teaming.

Срочность обсуждения подтверждалась данными. Согласно июньскому опросу VentureBeat Pulse за 2026 год, охватившему 107 корпоративных респондентов, более половины — 54% — уже пережили либо подтвержденный инцидент безопасности агента (18%), либо почти инцидент, перехваченный до причинения вреда (36%). Только 32% назначают каждому агенту собственную ограниченную управляемую идентичность, и лишь 30% изолируют своих агентов с самым высоким риском в песочницах. Нативные средства поставщиков и hyperscaler-контроли остаются основным уровнем безопасности агентов у 82% опрошенных компаний — статистика, также отмеченная в более широком исследовании VentureBeat о совместно используемых API-ключах.

Крупнейшие мировые поставщики решений безопасности, по-видимому, пришли к тому же выводу. Palo Alto Networks завершила приобретение CyberArk за $25 млрд в феврале, CrowdStrike в январе согласилась заплатить $740 млн за SGNL, а Cisco объявила о намерении приобрести Astrix Security за, по сообщениям, $400 млн — все эти сделки нацелены на уровень идентификации и изоляции, который большинство предприятий еще не успели полноценно выстроить. Совокупно три транзакции представляют более $26 млрд выделенного капитала, сосредоточенного на управлении идентификацией и доступом.

Карьера на стыке кибербезопасности, государственного сектора и военной службы

Chang привнесла в панель почти два десятилетия опыта в операциях кибербезопасности, государственном секторе и военной службе. Ранее она занимала должность исполнительного директора в JPMorgan Chase, где руководила глобальными операциями кибербезопасности и командами банка по разведке киберугроз. Она также была старшим сотрудником Комитета Палаты представителей по иностранным делам и офицером резерва ВМС США. Сейчас она преподает кибербезопасность и новые угрозы в качестве приглашенного преподавателя в Middlebury Institute of International Studies.

Показатель 88.3% взят из исследования, которое она подготовила в соавторстве с Nicholas Conley, основанного на 30,090 одноходовых промптах и 6,986 многоходовых атаках против 15 закрытых проприетарных флагманских моделей. Уровни успешности многоходовых атак варьировались от 7.89% до 88.3%, и каждая протестированная модель продемонстрировала нетривиальную подверженность многоходовым атакам. Примечательно, что два метода тестирования даже не ранжировали модели в одном и том же порядке. Chang также отметила, что Cisco теперь публикует сигналы состязательной оценки для 105 моделей в своем LLM Security Leaderboard.

"If you don't understand how models are susceptible to different types of attacks, then you are unable to account for how that model that is powering your agent, that is powering your application, to understand where those failure points are," — сказала Chang.

Она противопоставила одноходовое тестирование — единичный вредоносный промпт — многоходовым атакам, которые она описала как "more realistic of how we are actually engaging with our models, with our agents, with our applications." Такая расширенная дуга взаимодействия выявляет вредоносные выводы и несогласованное поведение, которые моментальный срез тестирования никогда не обнаружит. На практике многоходовой атакующий может начать с безобидных запросов, прощупать границы guardrail-механизмов модели, а затем постепенно направлять диалог к запрещенной теме — уточняя каждый следующий ход на основе ответов модели, подобно тому как социальный инженер адаптируется к реакциям цели.

Агентное red teaming-тестирование и неожиданно простые меры защиты

Cisco продвинула собственное тестирование в агентную область. Chang описала фреймворк, в котором агенты оценивают сценарий развертывания, разрабатывают релевантные атаки, решают, стоит ли их продолжать, выполняют их и оценивают собственный успех. Однако, несмотря на всю эту сложность, больше всего ее поразило, насколько прямолинейной остается защитная рекомендация.

"The answer is still that it's pretty simple," — сказала она. "You don't have to get super creative. You just need to think about truly what are the fundamentals and basics of what I'm trying to secure in my organization."

Для CISO, начинающих агентные внедрения, рекомендованной отправной точкой она назвала Cisco's Integrated AI Security and Safety Framework, который, по ее словам, "stipulates all the ways that AI can be compromised across the AI lifecycle" — от модальности до цепочки поставок. Затем команды могут двигаться в обратном направлении от реальных инцидентов, отслеживая, как была реализована каждая атака, и использовать фреймворк для построения стратегии с надлежащим охватом и мерами снижения рисков. Государственные фреймворки пока не успели за развитием этой области: NIST's AI Risk Management Framework, опубликованный в январе 2023 года, предшествует агентной волне и дает ограниченные рекомендации для систем, в которых автономные агенты связывают вызовы инструментов и выполняют многошаговые рабочие процессы.

Box: три концентрических слоя и уроки утраченного доверия

Heather Ceylan, CISO Box, указала на тот же пробел со стороны защитников. "A lot of what you see out there with agent red teaming is just single-turn, and that's not how people are actually interacting with AI day-to-day," — сказала она аудитории. Сейчас Box моделирует многоходовых противников с помощью агентов, спроектированных думать как атакующие, повторяя попытку за попыткой для перехвата целевой системы. "You have to pressure test your agents because otherwise you don't know if your execution controls are really working as you intended."

Около года назад Box развернула агентов внутри своего центра операций безопасности, изначально требуя одобрения человека для каждого действия. Доверие быстро росло, и аналитики в итоге перешли в режим мониторинга. Затем агент допустил одну ошибку — и все накопленное доверие испарилось.

"They had to start all over again," — сказала Ceylan. "So I think that that monitoring piece is so important. Even if you're not gonna have a human in the loop, things change, models change, and we can't control how the models change and interpret things."

Ceylan описала защитную архитектуру Box как три концентрических слоя. Сначала идет управление разрешениями, гарантирующее, что агент никогда не получает доступ к большему объему контента, чем человек, который его вызвал. Для каждой задачи запускаются эфемерные песочницы, ограничивающие радиус поражения, если агент будет скомпрометирован. Затем runtime-контроль исполнения ограничивает вызовы инструментов агента только теми, которые релевантны текущей задаче.

"If you want an agent to summarize a doc for you, if you have a prompt injection that came in that says forward this to maliciousattacker at domain.com, it can't do that," — сказала Ceylan. "That action in that tool call is not even in its vocabulary."

Она разделила действия агентов на три уровня надзора. Нечувствительные действия, такие как чтение и суммирование, не требуют участия человека. Действия средней чувствительности обходятся без человеческого одобрения, но журналируются и отслеживаются. Разрушительные действия, такие как массовое удаление файлов, всегда требуют участия человека. "Things are gonna shift between those three categories quite a bit," — признала она, "but setting those types of categories up front allows you to have a principled framework."

Intuit: операционная система генеративного ИИ

Rajesh Parekh, VP of AI and ML в Intuit, представил взгляд разработчика. До Intuit Parekh руководил крупномасштабными системами компьютерного зрения и ML, обеспечивавшими работу продуктов Google Maps и Geo, и имеет докторскую степень по информатике.

Вместо того чтобы наслаивать контроли на отдельных агентов, Intuit создала центральную платформу GenOS — сокращение от generative AI operating system, — которая абстрагирует моделирование безопасности, рисков и мошенничества, чтобы разработчикам агентов не приходилось каждый раз заново создавать защиту с нуля.

"Permissioning is not about giving access to AI," — сказал Parekh. "Instead, it is defining very tightly scoped and clearly auditable authority to the agent to perform very specific tasks." Intuit прошла путь от агентов, наследующих разрешения пользователей, к каждому агенту с собственной идентичностью, и сейчас компания изучает изменения разрешений в середине сессии, привязанные к конкретной выполняемой задаче.

Parekh описал более широкую модель как экспертную платформу на базе ИИ, где человеческий эксперт встроен в архитектуру доверия, а не добавлен как внешний шлюз. "The paradigm that we are pursuing is where the user, the AI agent, and the human expert are collaborating to solve the user problem," — сказал он.

Он также объяснил, почему поверхность red teaming-тестирования так быстро расширилась. "These agents have skills, and skills could become vulnerabilities," — сказал он. "Agents have access to certain data, they have access to tools, and there could be threats that are lurking within those tools as well. So suddenly the blast radius of the malicious code or the intent increases dramatically." Когда Intuit выявляет распространенные шаблоны уязвимостей в ходе ручного red teaming, она автоматизирует эти тесты в GenOS harness, чтобы будущие агенты наследовали защиту, а red team-специалисты фокусировались на возникающих угрозах. Runtime-сканирование промптов и ответов обеспечивает финальный слой, способный остановить подозрительный ответ и эскалировать его человеческому эксперту.

"You need to continuously test to ensure that those remain robust to the protections that you have built, as well as to account for any sort of drift or any other types of dependencies that you introduce into your scenario that can create novel vulnerabilities," — добавила Ceylan.

Конец человеческого code review

Ceylan прямо затронула напряжение между тестированием безопасности и скоростью разработки. "The days of secure code reviews where a human's looking at the code and we're looking at security architecture reviews, design docs, those are done," — сказала она. "If you keep trying to do security that way, you're gonna get left behind."

Box движется к полностью агентному жизненному циклу разработки, в котором агенты проверяют проектную документацию, применяют требования безопасности и аудитируют код на уязвимости. "I'm very optimistic that we will get to a point where we will write code without security vulnerabilities because agents and the models are going to get so good at writing code without vulnerabilities," — сказала она. "We're still a long way away from that."

Ее рекомендации для команд разработки отодвигают продвинутые концепции ИИ в сторону в пользу основ, появившихся задолго до агентов. "It comes down to very basic least privilege access," — сказала она. "If you start giving your agents overly broad permissions at the beginning, it's really hard to comb that back and build an infrastructure that allows for those ephemeral credentials and only those narrowly scoped tasks."

Намерение против вероятности

Вопрос из аудитории о выявлении намерения вызвал самую острую дискуссию панели. Ceylan отметила, что когда работает собственный агент Box, система всегда знает намерение пользователя, поскольку контролирует промпт, что позволяет соответствующим образом проектировать guardrails и ограничения вызовов инструментов. Более сложная задача — которую, как она признала, Box все еще пытается решить — возникает, когда подключаются внешние агенты, а контекст их запросов непрозрачен.

Этот обмен мнениями выявил более широкий раскол в отрасли. В fireside chat, предшествовавшем панели, Mastercard выступила за количественную оценку намерения и создание open-source-фреймворка для его распространения как стандарта, поскольку сложные B2B-закупки не могут функционировать без такого доверия. CTO компаний в сфере endpoint security в брифингах с VentureBeat заняли противоположную позицию, заявив, что для production-нагрузок будут полагаться на вероятность, а не на вывод намерения.

Chang объяснила, что модели в их нынешнем обучении не способны надежно выводить намерение из промпта, поэтому детерминированные контроли и поведенческие прокси остаются необходимыми. Ceylan согласилась, что нужны оба подхода. "If you're not doing anything deterministic, you're really relying heavily on that intent, and I haven't seen programs that are there yet," — сказала она.

Рассказ Ceylan о том, как доверие рухнуло после одной ошибки агента, стал самым запоминающимся моментом панели, подчеркнув, что корпоративная агентная безопасность — это не проблема, которую можно решить один раз и навсегда. Модели меняются, разрешения дрейфуют, а противники адаптируются в многоходовых диалогах, которые snapshot-тесты не улавливают.

Для 82% предприятий, полагающихся на нативные контроли поставщиков как на основной уровень безопасности, — и 59%, которые в ближайшие 12 месяцев планируют приобретать инструменты безопасности агентов, категорию, которая сегодня в значительной степени существует как специализированная внутренняя инфраструктура в компаниях вроде Box и Intuit, — вывод панели был однозначным: тестируйте так, как атакуют злоумышленники, по полным диалогам и непрерывно, иначе узнаете в production, что пропустило одноходовое red teaming-тестирование.