НовостиМакроKimi K3 значительно отстает от передовых моделей США в киберэксплойтах; возможным объяснением могут быть обвинения в дистилляции

Kimi K3 значительно отстает от передовых моделей США в киберэксплойтах; возможным объяснением могут быть обвинения в дистилляции

Автор: The Decoder·

Ключевые выводы

  • Встроенные защитные механизмы Kimi K3 не смогли заблокировать наступательные кибероперации, и модель помогала в разработке эксплойтов без каких-либо возражений.
  • В ExploitBench Kimi K3 достигла 32,2% выполнения против 76,2% у ведущих моделей США и ни разу не достигла высшего уровня эксплуатации Arbitrary Code Execution ни в одной из 41 задачи.
  • Kimi K3 завершила полный 32-шаговый маршрут симулированной сетевой атаки в одной из десяти попыток, что показывает наличие способности, но не ее надежное воспроизведение.
  • Временной анализ CAISI показывает, что по состоянию на 2025 год китайские модели с открытыми весами остаются на четыре-семь месяцев позади передовых систем США по кибервозможностям.
  • Расхождение между сильными общими результатами Kimi K3 в бенчмарках и слабой киберпроизводительностью поддерживает обвинения в том, что модель была дистиллирована из Anthropic Fable, чьи классификаторы безопасности блокируют попадание наступательных киберзапросов в обучающие данные.
Kimi K3 значительно отстает от передовых моделей США в киберэксплойтах; возможным объяснением могут быть обвинения в дистилляции

Kimi K3 значительно отстает от передовых моделей США в киберэксплойтах; возможным объяснением могут быть обвинения в дистилляции

Совместная оценка Британского института безопасности ИИ (UK AISI) и американского Центра стандартов и инноваций в области ИИ (CAISI) показала, что новейшая модель Moonshot AI, Kimi K3, помогает в проведении наступательных киберопераций без существенного сопротивления. Moonshot AI, основанная в 2023 году Ян Чжилинем и поддержанная инвесторами, включая Alibaba и Tencent, является одним из наиболее заметных китайских ИИ-стартапов. Хотя Kimi K3 значительно отстает от ведущих передовых моделей США в наступательных киберзадачах, она превосходит китайскую GLM-5.2 и устанавливает новый ориентир среди моделей с открытыми весами.

Встроенные защитные механизмы модели не смогли заблокировать разработку эксплойтов или наступательные кибероперации, и модель помогала в обоих случаях без возражений. Оценка была опубликована UK AISI и NIST/CAISI.

ExploitBench: Kimi K3 не достигает самых сложных уровней

Институты оценивали навыки разработки эксплойтов с помощью ExploitBench — бенчмарка, разработанного Университетом Карнеги — Меллона. ExploitBench использует 41 уязвимость, обнаруженную в движке Chrome V8 после 2023 года, чтобы измерить, насколько далеко модель может продвинуться по цепочке эксплуатации программного обеспечения.

Ведущие модели США в среднем достигли 76,2% выполнения, тогда как Kimi K3 показала 32,2%, а GLM-5.2 — 24,4%. Особенно важно, что Kimi K3 не смогла достичь самого высокого уровня эксплуатации — Arbitrary Code Execution (ACE) — ни в одной из 41 задачи. ACE считается самым опасным уровнем эксплойта, поскольку дает атакующим полный контроль над целевой системой. Ведущие модели США достигли ACE в 20 из 41 задачи.

Для американских моделей с закрытыми весами институты отключили системные защитные механизмы, чтобы измерить их максимальные возможности. В общедоступных версиях эти механизмы остаются включенными.

Симулированная сетевая атака: Kimi K3 доходит до середины сценария

Вторая оценка, получившая название "The Last Ones" (TLO), симулирует атаку на корпоративную сеть с 32-шаговым маршрутом атаки через четыре подсети и примерно 20 хостов. По данным институтов, эксперту-человеку потребовалось бы около 20 часов, чтобы выполнить это упражнение.

Лишь небольшая группа моделей вообще способна решить TLO. На данный момент четыре общедоступные модели с закрытыми весами прошли этот тест, причем самые сильные из них добивались успеха в шести или семи попытках из десяти.

Kimi K3 в среднем достигла шага 17 из 32, по сравнению с 28,5 шага у ведущих моделей США и 11 шагами у GLM-5.2. Kimi K3 завершила весь маршрут атаки в одной из десяти попыток, оставаясь в пределах лимита в 100 млн токенов, что показывает наличие такой способности, но не ее надежное воспроизведение.

"Kimi K3 is capable of autonomously attacking small, weakly defended and vulnerable enterprise systems, when directed to do so and given initial network access," — пишет институт.

TLO не учитывает меры активной защиты, поэтому сценарий не является полностью реалистичным. Тем не менее такие результаты все равно стали бы тревожным сигналом в реальных условиях. Показательный пример появился ранее на этой неделе, когда модели OpenAI попытались автономно взломать Hugging Face. Hugging Face успешно отразила атаку, хотя для этого потребовались значительные усилия и развертывание моделей с открытыми весами.

Китайские модели сокращают разрыв, но все еще отстают

CAISI провел временной анализ, отслеживающий кибервозможности американских и китайских моделей с начала 2025 года по шкале на основе Elo. Обе линии тренда растут, однако китайские модели стабильно остаются позади своих американских аналогов.

В предыдущем анализе Британский институт оценил разрыв в производительности для открытых моделей в четыре-семь месяцев по сравнению с шестью-десятью месяцами в начале 2025 года. Последние результаты соответствуют этой закономерности: китайские модели с открытыми весами улучшаются, но все еще значительно отстают от ведущих систем США.

AISI предупредил, что этот разрыв не должен вести к самоуспокоенности. Рост кибервозможностей открытых моделей создает то, что институт описывает как "a persistent and irreversible risk of misuse." В отличие от моделей с закрытыми весами, которые поставщики могут удаленно обновлять или ограничивать, модели с открытыми весами после загрузки не могут быть лишены своих возможностей, а их защитные механизмы не могут быть исправлены разработчиком.

Киберрезультаты согласуются с обвинениями в дистилляции

Выводы по Kimi также усиливают аргументы в пользу обвинений в дистилляции против китайских разработчиков моделей. Дистилляция — это метод, при котором модель обучают на выходных данных более способной модели, что позволяет приблизиться к возможностям модели-учителя без доступа к ее базовым весам или обучающим данным. Научный советник США Майкл Крациос недавно обвинил Moonshot AI в "дистилляции" Fable от Anthropic путем использования лучших ответов Fable в качестве обучающих данных для улучшения производительности Kimi K3. Крациос также заявил, что Moonshot AI имела доступ к Nvidia GB300s, на которые распространяется экспортный контроль США. Anthropic опубликовала фреймворк защитных мер для Fable.

Одно из объяснений расхождения между сильными общими результатами Kimi K3 в бенчмарках и слабой киберпроизводительностью состоит в том, что модель могла быть обучена главным образом на ответах Claude, охватывающих общие знания, программирование и агентные задачи. Классификаторы безопасности Anthropic специально блокируют продвинутые запросы, связанные с наступательными кибероперациями, а значит такие ответы были бы недостаточно представлены в любом наборе данных для дистилляции, построенном на ответах Claude. Поэтому Kimi K3 могла сопоставляться с ведущими западными моделями в стандартных бенчмарках, не приобретая их более глубоких возможностей по эксплуатации уязвимостей.

Результаты AISI поддерживают такую интерпретацию. Институты отключили системные защитные механизмы на моделях США, чтобы выявить кибервозможности, к которым почти невозможно получить доступ через публичные интерфейсы, а значит они в значительной степени недоступны для дистилляции.