НовостиМакроИнституты ИИ Великобритании и США установили, что Kimi K3 от Moonshot уступает передовым американским моделям в кибератаках

Институты ИИ Великобритании и США установили, что Kimi K3 от Moonshot уступает передовым американским моделям в кибератаках

Автор: Cryptopolitan·

Ключевые выводы

  • Kimi K3 набрал 32% в бенчмарке разработки эксплойтов ExploitBench, что значительно ниже среднего показателя 76.2% у ведущих моделей из США, и не достиг ни одного произвольного выполнения кода на 41 протестированной уязвимости.
  • В тесте на смоделированное проникновение в корпоративную сеть Kimi K3 завершил полную 32-этапную цепочку вторжения лишь однажды из десяти попыток, тогда как лучшие модели из США добивались успеха шесть или семь раз.
  • Модель не отказывалась от выполнения наступательных киберзадач, и оценщики предупредили, что релиз с открытыми весами 27 июля позволит любому пользователю удалить ограничители и развернуть модель без надзора.
  • Низкие результаты Kimi K3 в киберспособностях, несмотря на высокие показатели в общих бенчмарках, могут быть связаны с дистилляцией с использованием выходных данных моделей Anthropic, которые блокируют наступательные киберзапросы и поэтому предоставили ограниченные релевантные обучающие данные.
  • Оценка является частью новой практики, в рамках которой государственные институты безопасности проводят предрелизные оценки передовых моделей ИИ до их публичного выпуска.
Институты ИИ Великобритании и США установили, что Kimi K3 от Moonshot уступает передовым американским моделям в кибератаках

Совместная оценка Института безопасности ИИ Великобритании (AISI) и Центра стандартов и инноваций ИИ США (CAISI) показала, что Kimi K3 от Moonshot AI уступает ведущим американским ИИ-системам в создании программных эксплойтов и проведении смоделированных сетевых атак. Институты опубликовали свои выводы 23 июля, ahead of запланированного выпуска Moonshot полных открытых весов модели 27 июля. Данная оценка является частью более широкой практики государственных институтов безопасности по проведению предрелизных оценок передовых моделей до их публичного появления.

Согласно отчёту, защитные механизмы Kimi K3 не помешали ему содействовать в проведении наступательных киберопераций. Оценщики заявили: «Kimi K3 способен автономно атаковать небольшие, слабо защищённые и уязвимые корпоративные системы по указанию и при наличии начального доступа к сети».

Результаты ExploitBench

Два института протестировали Kimi K3 с помощью ExploitBench — бенчмарка, разработанного Университетом Карнеги — Меллона, который измеряет, насколько эффективно модель может довести программный эксплойт до завершения. Бенчмарк основан на 41 уязвимости, обнаруженной в движке V8 браузера Chrome после 2023 года. Такие тесты, как ExploitBench, стали стандартным инструментом для AISI и аналогичных организаций, позволяющим получать сопоставимые и воспроизводимые измерения рисков моделей.

Kimi K3 набрал 32% в бенчмарке. Ведущие модели из США показали в среднем 76.2%, а китайская GLM-5.2 — 24%.

Произвольное выполнение кода — наиболее опасный результат бенчмарка — предоставляет злоумышленнику полный контроль над целевой машиной. Модели из США достигли произвольного выполнения кода в среднем в 20 из 41 задачи. Kimi K3 не достиг его ни в одной. GLM-5.2 также не смогла преодолеть этот порог. Хотя Kimi K3 в настоящее время лидирует среди моделей с открытыми весами по общей киберспособности, он отстаёт на этапе, где реальная атака нанесла бы максимальный ущерб.

Тест на смоделированное сетевое проникновение

Вторая оценка, получившая название «The Last Ones», помещает модель в смоделированную корпоративную сеть, содержащую около 20 хостов в четырёх подсетях. Прохождение полного 32-этапного пути проникновения заняло бы у человека-специалиста примерно 20 часов.

Kimi K3 в среднем достигал 17-го этапа. Наиболее способные модели из США в среднем достигали 28.5 этапов, а GLM-5.2 — 11. Однако оценщики отметили, что Kimi K3 один раз из десяти попыток прошёл всю цепочку, уложившись в установленный лимит в 100 миллионов токенов. Лучшие модели из США решали полную цепочку шесть или семь раз из десяти.

Институты расценили единственный успешный запуск Kimi K3 как доказательство того, что модель обладает базовой способностью, но не может надёжно воспроизводить её по требованию. Они также отметили, что в смоделированной среде отсутствовали активные защитные системы и был встроенный путь к цели — условия, которые изначально благоприятствуют любому злоумышленнику.

Опасения по поводу защитных механизмов и рисков открытых весов

Оценщики подчеркнули, что готовность модели выполнять наступательные задачи без отказа представляет значительный риск. AISI ранее предупреждал, что растущие возможности моделей с открытым доступом создают «постоянный и необратимый риск злоупотребления». После того как веса Kimi K3 станут общедоступными 27 июля, поведение модели больше нельзя будет контролировать тому, кто её размещает. В отличие от закрытых систем или систем, доступных только через API, где разработчики могут обновлять защитные механизмы или отзывать доступ, релиз с открытыми весами означает, что любой последующий пользователь может удалить ограничители и развернуть модель без надзора.

Полная предварительная оценка доступна на сайте AISI.

Разрыв между общими показателями и киберспособностями

До этого отчёта Kimi K3 демонстрировал высокие результаты по общим бенчмаркам — эта тенденция остаётся неизменной. Китайская модель с 2.8 триллиона параметров, как сообщается, превзошла Claude 4.8 от Anthropic и GPT-5.5 от OpenAI, а также возглавила несколько рейтингов.

Институты предположили, что этот разрыв в производительности может быть связан с методологией обучения модели. 22 июля директор Белого дома по науке Майкл Кратсиос обвинил Moonshot в дистилляции модели Fable от Anthropic путём использования её выходных данных в качестве обучающих. Дистилляция — практика использования выходных данных более продвинутой модели для обучения другой модели — широко распространена в отрасли, но может переносить как сильные стороны, так и пробелы исходной модели. Классификаторы Anthropic блокируют сложные наступательные киберзапросы, что означает, что обучающий набор данных, собранный из ответов Claude, будет содержать ограниченный материал по этим конкретным навыкам. У Kimi K3 отсутствуют такие классификаторы, что позволило ему сравняться с западными моделями по общим задачам, но при этом уступать в разработке эксплойтов.