НовостиАкцииИсследователи раскрыли зашифрованные «внутренние мысли» всех ведущих ИИ-моделей

Исследователи раскрыли зашифрованные «внутренние мысли» всех ведущих ИИ-моделей

Автор: Decrypt·

Ключевые выводы

  • Anthropic, OpenAI и Google используют по единому ключу шифрования токенов ИИ-рассуждений на всю экосистему, из-за чего зашифрованные блоки рассуждений взаимозаменяемы между разными сессиями, пользователями и моделями внутри каждой экосистемы.
  • Исследователи декодировали 315 320 блоков рассуждений из 6 708 общедоступных транскриптов ИИ-агентов на GitHub и Hugging Face, восстановив 182 набора учётных данных — включая 62 действующих API-ключа и 33 пароля — а также 367 артефактов персональных данных.
  • Атака осуществляется внедрением зашифрованной трассировки рассуждений мощной модели, например Claude Opus 4.8, в более слабую и менее защищённую родственную модель вроде Claude Haiku 4.5, которая дословно выводит трассировку и не требует никакого доступа, кроме стандартного использования API.
  • Конфиденциальные данные, скрытые внутри зашифрованных блоков рассуждений, ускользают от автоматических служб сканирования секретов, таких как у GitHub, поскольку эти инструменты не могут проверять зашифрованное содержимое.
  • После ответственного раскрытия Anthropic, OpenAI и Google внедрили серверные меры защиты, однако 6 708 уже собранных публичных транскриптов остаются в сети; разработчикам рекомендуется удалять зашифрованные блоки размышлений из общедоступных журналов и менять скомпрометированные учётные данные.
Исследователи раскрыли зашифрованные «внутренние мысли» всех ведущих ИИ-моделей

Специалисты по кибербезопасности нашли способ читать зашифрованные «внутренние мысли» всех крупнейших рассуждающих ИИ-моделей — и попутно обнаружили 62 действующих API-ключа и 33 пароля, скрытых в журналах сессий, которые разработчики публиковали в открытом доступе, не догадываясь об их содержимом.

В основе полученных результатов лежит открытие: Anthropic, OpenAI и Google используют единый глобальный ключ шифрования для токенов ИИ-рассуждений. Декодировав 315 320 блоков рассуждений, собранных из публичных репозиториев GitHub и Hugging Face, исследователи восстановили 182 набора учётных данных, включая 62 действующих API-ключа, 33 пароля и 30 личных адресов электронной почты.

«Декодировав 315 320 блоков рассуждений, собранных из публичных репозиториев, мы восстановили 367 артефактов персональных данных (PII) и 182 набора учётных данных», — написали исследователи в своей статье, представленной 10 августа командой из MATS Research, Института ELLIS в Тюбингене, Института интеллектуальных систем Общества Макса Планка и компании по кибербезопасности Snyk.

Как работает скрытый черновик

Исследование посвящено отдельному классу ИИ — рассуждающим моделям. Вместо того чтобы отвечать сразу, такие модели начинают с внутренней цепочки рассуждений — пошагового черновика, где ИИ прорабатывает задачу, прежде чем показать ответ, — и лишь затем выдают финальный результат. Сегодня такие модели лежат в основе ассистентов для программирования и автономных агентов, которые читают файлы, выполняют команды и обрабатывают реальные пользовательские данные, — именно поэтому учётные данные и личная информация могут проходить через приватный черновик, даже не появляясь в видимом ответе.

Anthropic, OpenAI и Google шифруют этот скрытый черновик. Шифрование — преобразование данных в нечитаемый код — призвано защищать интеллектуальную собственность компании и скрывать от пользователей промежуточные рассуждения. Зашифрованный блок передаётся обратно на серверы провайдера с каждым следующим сообщением, поддерживая диалог без хранения данных на стороне компании. Лаборатории также сами отслеживают эти скрытые рассуждения в целях безопасности, наблюдая за цепочкой мыслей на предмет признаков того, что модель собирается нарушить правила, ещё до того, как ответ дойдёт до пользователей.

Один ключ, чтобы править всеми

Уязвимость носит архитектурный характер. Вместо привязки каждого зашифрованного блока рассуждений к конкретному пользователю, сессии или модели все три провайдера используют единый ключ шифрования в рамках всей своей экосистемы.

«Эти зашифрованные блоки полностью совместимы и взаимозаменяемы между разными сессиями, пользователями и даже разными моделями внутри экосистемы провайдера», — написали исследователи.

Это означает, что блок зашифрованных рассуждений Claude Opus 4.8, флагманской модели Anthropic, можно внедрить в Claude Haiku 4.5 — более дешёвую и менее защищённую родственную модель — не нарушая правил Anthropic. У Haiku нет антидистилляционного выравнивания (alignment) — специально разработанной защитной тренировки, не позволяющей модели по команде воспроизводить собственные рассуждения, — которое есть у Opus.

Достаточно приказать Haiku дословно прочитать зашифрованный блок — и она делает это.

«Внедряя зашифрованную трассировку рассуждений определённой модели в более слабую и менее защищённую модель того же провайдера, мы заставляем её расшифровать трассировку и дословно вывести её в открытом виде, не взламывая более мощную модель напрямую», — говорится в статье.

«Межмодельная переносимость означает, что Haiku 4.5 может читать мысли Opus 4.8», — написал ведущий исследователь Александр Панфилов на X.

Та же атака была воспроизведена на семействе GPT-5.6 от OpenAI и линейке моделей Gemini от Google. Особые права доступа не требовались — достаточно было стандартного доступа к API, соединения, которое разработчики используют для создания приложений на основе ИИ-моделей.

We can finally talk about it: We found a way to extract hidden reasoning of frontier models using a vulnerability in the APIs of every frontier AI company. We verified that our reasoning token count matches billed API thinking tokens 1:1 for most of the prompts we queried. pic.twitter.com/S7wN8aP3X7 — Alexander Panfilov (@kotekjedi_ml) August 11, 2026

Что содержали публичные журналы

Чтобы продемонстрировать реальный ущерб, команда собрала 6 708 общедоступных транскриптов ИИ-агентов — автоматических журналов сессий, которые разработчики регулярно публикуют на GitHub и Hugging Face для совместной работы или отладки, — и декодировала из них 315 320 блоков рассуждений.

«Разработчики часто публикуют в открытом доступе свои журналы сессий и зашифрованные трассировки размышлений, совершенно не подозревая о конфиденциальных данных, скрытых внутри зашифрованных блоков», — отмечается в статье. Большинство этих секретов никогда не появлялось в видимом выводе ИИ: они существовали только внутри зашифрованных рассуждений и были невидимы для всех, кто не применял атаку. Поскольку конфиденциальные данные находились внутри зашифрованных блоков, а не в виде обычного текста, автоматические службы сканирования секретов, которые платформы вроде GitHub запускают по публичным репозиториям, не могли их обнаружить — стандартные механизмы защиты, помечающие раскрытые API-ключи, не способны заглянуть внутрь зашифрованных рассуждений.

Помимо простой кражи учётных данных уязвимость открывает четыре вектора атаки:

  • Кража собственных паттернов рассуждений ИИ-компаний для обучения конкурирующих моделей методом дистилляции, при котором меньшая модель учится имитировать большую, изучая её выходные данные
  • Извлечение приватных данных из общедоступных журналов
  • Невидимая инъекция промптов, при которой вредоносные инструкции скрыты внутри зашифрованных блоков рассуждений, невидимых для инструментов мониторинга безопасности
  • Джейлбрейк мощных моделей через их менее защищённых «собратьев»

Anthropic, OpenAI и Google внедрили серверные меры защиты после того, как команда следовала процедурам ответственного раскрытия. Как ранее сообщал Decrypt, Anthropic в этом году регулярно оказывается в центре внимания исследователей безопасности, особенно поскольку её новейшие модели потребляют гораздо больше токенов в процессе рассуждений.

Патчи уже действуют, однако 6 708 транскриптов сессий с декодированными блоками рассуждений, уже собранных из открытого интернета, никуда не исчезнут. Для разработчиков, опубликовавших транскрипты агентов, стандартной реакцией на подобную утечку является удаление зашифрованных блоков размышлений из общедоступных журналов и смена всех учётных данных, прошедших через эти сессии.