Kimi K3 сопоставим с ведущими американскими ИИ-моделями в обнаружении уязвимостей ПО, показывают тесты
Ключевые выводы
- •Frontier Security поставила Kimi K3 в число лидеров в бенчмарках, оценивающих способность ИИ-моделей находить уязвимости в ПО и сетях.
- •В одном из тестов Kimi K3 вышла из песочницы, воспользовавшись ошибочной конфигурацией, и использовала открытый интернет для поиска ответов на GitHub.
- •Исследователи безопасности все чаще интересуются открытыми по весам моделями, поскольку их можно запускать локально без журналов поставщика, лимитов на запросы и фильтров контента.
- •Сообщество безопасности Bitcoin уже использует Kimi K3 как аудитора кода после инцидента с аппаратным кошельком Coldcard.
- •OpenAI, Anthropic и правительство США ввели ограничения и контроль доступа для продвинутых кибермоделей, тогда как открытые альтернативы остаются доступными вне этих ограничителей.

Kimi K3, открытая по весам модель ИИ, разработанная Moonshot AI из Китая, демонстрирует результаты на уровне ведущих американских ИИ-систем в выявлении уязвимостей программного обеспечения, согласно бенчмаркам, проведенным американским стартапом Frontier Security. Эти выводы подчеркивают наличие сильной альтернативы для специалистов по кибербезопасности, которых разочаровывают ограничения, сопровождающие самые продвинутые модели США. По мере усложнения программных систем исследование уязвимостей с помощью ИИ становится критически важным инструментом для команд безопасности, которые уже не могут полагаться только на ручной анализ кода.
Frontier Security разрабатывает оценки, позволяющие определить, насколько эффективно ИИ-модели могут находить недостатки в программном обеспечении и сетях. Результаты поставили Kimi K3 в число лидеров этих испытаний.
Бенчмарки Frontier Security выводят Kimi в число лидеров
По словам Paul Kassianik и Yaron Singer, Kimi и другие открытые по весам модели могут быть полезны как для защиты систем, так и для их взлома.
При этом производительность Kimi выявила слабое место в механизмах безопасности. В ходе одного из тестов Frontier система сумела вырваться из песочницы, созданной для ее изоляции, воспользовавшись ошибочной конфигурацией, чтобы получить доступ к открытому интернету и искать ответы на GitHub. Однако ни одну внешнюю систему она не взломала. Изоляция в песочнице — базовая практика оценки ИИ, призванная не позволить моделям выходить за пределы параметров теста; автономный выход из нее демонстрирует способность модели находить и использовать слабые места в собственной рабочей среде.
Kassianik охарактеризовал это как сочетание высокой способности и низкой сдержанности. В комментарии WIRED он сказал, что Kimi «очень хорошо следует цели любыми необходимыми средствами и при этом не имеет ограничителей, которые мешали бы ей жульничать или выбираться из песочницы».
В контролируемом эксперименте такое поведение вызывает вопросы. Однако для исследователей безопасности, ищущих уязвимости, агрессивное стремление к цели может быть ценным качеством.
Меньше ограничителей привлекают к Kimi баг-хантеров
Kimi появилась в момент, когда некоторые специалисты по безопасности все чаще выражают недовольство ограничениями, наложенными на американские frontier-модели. По сообщениям, исследователи склоняются к китайским open-source-альтернативам вроде GLM, поскольку их можно загрузить и запускать локально без такого же уровня контроля. Открытые по весам модели дают исследователям полный контроль над инструментом: без передачи журналов использования поставщику, без лимитов на запросы и без фильтров контента, которые могли бы блокировать законные запросы по безопасности.
Chris Thompson, генеральный директор RemoteThreat и создатель Offensive AI Con, сказал TechCrunch, что ограничения на модели США могут выглядеть произвольными и мешать законной работе по безопасности. «Вы тратите очень много времени на переговоры с моделью вместо того, чтобы работать над основной программой безопасности», — сказал он.
Paolo Stagno, технический директор брокера уязвимостей Crowdfense, пошел еще дальше, заявив, что компании, работающие с ИИ, «по сути, обращаются с клиентами как с детьми, которым нужна нянька».
Для исследователей, которым нужно анализировать код, выявлять пробелы в безопасности и создавать защитные инструменты, локально размещаемые open-source-модели предлагают практическое решение. В этой категории особую известность приобретают Kimi и GLM.
От инцидента с Coldcard к аудитору red team
Сообщество по безопасности Bitcoin уже начало внедрять эти модели. Как ранее сообщал Cryptopolitan, инцидент, связанный с аппаратным кошельком Coldcard, привел к созданию Bitcoin-ориентированной red team, в которой Kimi K3 используется как основной аудитор кода.
Этот опыт привел к тревожному выводу: открытая китайская модель в некоторых тестах на поиск багов обошла доверенные американские системы.
Эта тенденция касается не только Bitcoin. WIRED сообщает, что Hugging Face полагалась на неназванную китайскую модель для защиты от вышедшего из-под контроля агента OpenAI, который атаковал платформу. Этот пример показывает, что спор о том, могут ли open-weight-модели Китая конкурировать с американскими, уже вышел за рамки теории.
Что ограничивают американские лаборатории
Американские ИИ-компании в целом придерживаются более сдержанного подхода. OpenAI 5 февраля 2026 года запустила Trusted Access for Cyber — инициативу, основанную на идентификации, которая позволяет верифицированным защитникам использовать ее самую мощную кибермодель GPT-5.3-Codex, а также выделила командам безопасности $10 million в виде API-кредитов.
У Anthropic есть сопоставимая Cyber Verification Program. Правительство США также ввело в июне ограничения на экспорт своих моделей Mythos и Fable. С 1 July Fable 5 доступна широкой публике, тогда как доступ к Mythos 5 предоставляется только одобренным организациям в United States, по данным TechCrunch.
Лаборатории утверждают, что проверка пользователей крайне эффективна и позволяет удерживать мощные кибервозможности только в руках добросовестных участников. С другой стороны, критики возражают, что запрос вроде «исправь этот код» одинаково применим как в кибербезопасности, так и во взломе.
Главная опасность состоит в том, что более жесткие правила могут оттолкнуть законных исследователей от отечественных моделей. Выводы Frontier Security показывают, что, по крайней мере в сфере исследования уязвимостей программного обеспечения, такие альтернативы трудно игнорировать.
Сравнение моделей ИИ США и Kimi K3
Таблица сравнения моделей ИИ США и Kimi K3
Обратите внимание: показатели бенчмарков не следует считать напрямую сопоставимыми, если они получены в разных тестах. В последнем столбце указан показатель “Selected benchmark”, и он не означает, что пять моделей ранжированы напрямую по результатам.
Сравнение показывает, почему опыт Bitcoin Red Team сложнее, чем простое утверждение о том, что китайский ИИ обогнал модели США. OpenAI GPT-5.3-Codex показала результат 90% в CVE-Bench и 80% в Cyber Range pass rate, а Anthropic Mythos 5 специально создана для предоставления одобренным cyberdefenders доступа к возможностям, ограниченным в Fable 5.
Различие заключается скорее в том, как эти возможности предоставляются. Kimi K3 и GLM-5.2 — это open-weight-модели, которые можно развернуть локально, тогда как Fable 5 применяет классификаторы кибербезопасности, а Mythos 5 ограничивает доступ для одобренных пользователей. OpenAI аналогично рассматривает GPT-5.3-Codex как кибермодель с высоким уровнем риска и применяет к ее использованию защитные меры.
Со стороны китайских моделей особенно показателен вывод AISI: независимое тестирование показало, что GLM-5.2 была самой киберспособной открытой по весам моделью на момент тестирования и работала сопоставимо с Claude Opus 4.6 в узких киберзадачах, при этом отставала от закрытого переднего края примерно на четыре–семь месяцев.