НовостиМакроКибероценка США показала, что Kimi K3 от Moonshot AI уступает ведущим американским AI-моделям

Кибероценка США показала, что Kimi K3 от Moonshot AI уступает ведущим американским AI-моделям

Автор: BeInCrypto·

Ключевые выводы

  • Kimi K3 набрала 32% в ExploitBench, опередив китайскую GLM-5.2, но значительно уступив ведущим американским моделям с результатом около 76%.
  • В имитации 32-этапной атаки на корпоративную сеть Kimi K3 в среднем доходила до этапа 17 и завершила всю последовательность один раз из 10 попыток.
  • Оценка содержала оговорки, поскольку Kimi K3 тестировали лишь частично, а американские модели оценивались с отключенными фильтрами безопасности.
  • CAISI заявило, что защитные механизмы Kimi K3 не предотвращали попытки создавать хакерские инструменты или атаковать системы.
  • Вашингтон обвинил Moonshot в копировании Claude Fable 5 от Anthropic через дистилляцию; Anthropic поддерживает это утверждение.
Кибероценка США показала, что Kimi K3 от Moonshot AI уступает ведущим американским AI-моделям

Правительство США провело оценку кибербезопасности новейшей китайской AI-модели и пришло к выводу, что Kimi K3 от Moonshot AI значительно уступает лучшим американским моделям.

Center for AI Standards and Innovation (CAISI), американское агентство, провело тесты совместно с британским партнером. Результаты были опубликованы всего через день после того, как Вашингтон обвинил Moonshot в создании Kimi K3 с использованием похищенной американской технологии. Наступательные кибервозможности стали одним из приоритетных направлений оценок безопасности AI в США и Великобритании, поскольку правительства анализируют, могут ли frontier-модели автоматизировать хакерские задачи, которые сейчас требуют квалифицированных специалистов.

Kimi K3 уступает в американских кибербенчмарках

Министерство торговли опубликовало выводы в четверг, заявив, что Kimi K3 заняла значительно более низкое место, чем ведущие американские модели, по итогам совместной оценки с британскими экспертами.

CAISI's latest blog post evaluates Kimi K3 and its cyber capabilities. Based on a preliminary cyber-focused evaluation, Kimi K3 performed significantly below the leading U.S. frontier AI models. — U.S. Department Commerce (@CommerceGov) July 23, 2026

Moonshot запустила Kimi K3 July 16. Спрос оказался настолько высоким, что компании пришлось приостановить регистрацию новых пользователей в течение двух дней. Запуск также вызвал колебания в акциях американских производителей чипов и поставил новые вопросы о позиции США в глобальной гонке AI.

Один из бенчмарков, ExploitBench, использует реальные уязвимости браузера Chrome, разработанные Carnegie Mellon University. Kimi K3 набрала 32%, опередив китайскую GLM-5.2 с 24%, но уступив ведущим американским моделям, которые достигли примерно 76%.

Самый сложный этап предполагает получение полного контроля над целевой машиной. Kimi K3 провалила этот этап во всех 41 тестах, тогда как лучшие американские модели справились с ним в 20 случаях.

Второй тест, The Last Ones, имитирует атаку на фиктивную корпоративную сеть из 32 этапов. Человеку-эксперту обычно требуется около 20 часов, чтобы завершить его. Kimi K3 в среднем доходила до этапа 17, тогда как ведущие американские модели достигали этапа 28.5. Kimi K3 полностью завершила последовательность лишь один раз из 10 попыток, тогда как лучшие американские системы, как сообщается, делали это шесть или семь раз.

Разрыв может выглядеть больше, чем он есть

Однако одни цифры не раскрывают всей картины. В сносках самого отчета содержится несколько важных оговорок.

Во-первых, американские модели тестировались с отключенными фильтрами безопасности — в режиме, который раскрывает их полные возможности. В публичных версиях эти фильтры остаются активными, а значит, результаты США отражают лучший возможный сценарий, а не реальную производительность.

Команда оценщиков также назвала работу ранней и ограниченной. Kimi K3 получила оценку только по одному тесту, и была запущена лишь часть полного набора испытаний, что делает итоговый рейтинг неопределенным. Некоторые тесты также являются закрытыми, поэтому независимые наблюдатели не могут проверить результаты.

Есть и фундаментальное несоответствие в сравнении. Kimi K3 — открытая модель, которую может скачать любой пользователь, тогда как американские модели являются закрытыми проприетарными системами. Британский институт ранее установил, что открытые модели обычно отстают от лучших закрытых на четыре-семь месяцев. CAISI заявило, что проведет полный тест Kimi K3 только после того, как Moonshot выпустит ее для широкой публики.

Кроме того, эти тесты не являются реальными атаками. В имитируемой сети не было людей-защитников и сигналов тревоги, которые могли бы сработать. Тем не менее Kimi K3 превзошла предыдущую ведущую открытую модель и один раз завершила полную цепочку атаки.

Сроки публикации и институциональный контекст также вызывают вопросы. CAISI ранее было известно как US AI Safety Institute, прежде чем администрация Trump переименовала его в June 2025. Оно работает в составе того же ведомства, которое ограничивает продажи американских чипов в Китай. Его отчет о китайском конкуренте появился всего через день после обвинения в краже.

Слабые защитные механизмы вызывают опасения

Низкие результаты, однако, не обязательно означают, что Kimi K3 безопасна. Тест показал, что ее защитные ограничения не помешали модели пытаться создавать хакерские инструменты или атаковать системы.

Этот вывод важен с учетом дальнейших планов. Moonshot намерена выпустить полную модель July 27. После релиза ее нельзя будет отозвать — любой сможет скачать ее и удалить фильтры безопасности. Необратимость релизов с открытыми весами стала центральной темой в американских политических дебатах о том, должны ли мощные модели подпадать под ограничения на выпуск. Эта дискуссия усилилась по мере того, как китайские лаборатории все чаще публикуют способные открытые модели, несмотря на американский экспортный контроль передовых чипов.

Оценка также последовала за обвинением в краже. Вашингтон утверждает, что Moonshot создала Kimi K3 на основе похищенной американской AI-технологии. Руководитель технологического направления Белого дома Michael Kratsios заявил, что компания тайно скопировала Claude Fable 5 от Anthropic с помощью техники, называемой дистилляцией, при которой новая модель обучается на ответах более сильной модели.

Anthropic поддерживает это утверждение. В February компания связала более 3.4 million чатов Claude с Moonshot через сотни фальшивых аккаунтов. Anthropic предупредила, что скопированные модели теряют защитные механизмы оригинала — ту же уязвимость, которую выявил этот тест.

США по-прежнему тратят на AI в 23 раза больше, чем Китай, однако китайские лаборатории продолжают сокращать разрыв. Окончательная оценка станет возможной, когда Kimi K3 выйдет в публичный доступ и независимые эксперты смогут самостоятельно проверить эти утверждения.