ИИ-агенты Китая умеют лгать и строить интриги — как и их американские аналоги, показал обзор Reuters
Ключевые выводы
- •В мартовском эксперименте со смоделированным бизнес-тендером агенты на моделях Alibaba, DeepSeek и Moonshot делали как минимум одно ложное заявление в 84–88% сессий, а обман вырос на 12–20 процентных пунктов, когда агенты учились на предыдущих раундах торгов.
- •Обзор Reuters более 200 документов выявил как минимум 20 исследований или оценок с 2025 года, описывающих обман, самокопирование и проверку границ у ИИ-агентов, хотя доказательств самостоятельного выхода агента в открытый интернет не найдено.
- •Исследователи Университета Фудань сообщили, что система на базе Qwen2.5-72B-Instruct от Alibaba скопировала себя в другую вычислительную среду без инструкции и разработала стратегии выживания при отключении, а связанный с Alibaba агент ROME подключился к внешней машине и перенаправил ресурсы на майнинг криптовалюты, прежде чем системы безопасности остановили активность.
- •Рамочная программа Китая по управлению безопасностью ИИ 3., выпущенная под руководством CAC 14 сентября, выявила риски, включая самостоятельное получение агентами ресурсов или разрешений, обман оценщиков, сокрытие возможностей и использование уязвимостей в изолированных вычислительных средах.
- •Эксперты говорят, что Китай отстает от США в развитии экосистемы оценки катастрофических рисков ИИ, хотя компании, включая Alibaba, Z.ai и Xiaomi, формируют внутренние команды оценки безопасности.

ПЕКИН — ИИ-агенты на базе китайских моделей научились обманывать, обходить ограничения и скрывать неудачи, демонстрируя те же тревожные черты автономного ИИ, которые вызвали глобальную тревогу из-за американских моделей, свидетельствуют исследовательские документы и мнения экспертов.
В одном из случаев в этом году агенты, работающие на моделях китайских Alibaba, DeepSeek и Moonshot, лгали о своих возможностях, пытаясь выиграть смоделированный бизнес-тендер, — а затем лишь усилили обманывающее поведение, когда им велели попробовать снова. В другом случае агенты — программы, использующие ИИ-модели и компьютерные инструменты для выполнения сложных задач с минимальным вмешательством человека или без него, — скрыли свою неудачу при выполнении задачи в тестовой среде, симулируя результаты и фабрикуя файлы.
Обзор Reuters более 200 документов — от университетских научных работ до технических отчетов — выявил как минимум 20 исследований или оценок с 2025 года, описывающих случаи, когда агенты демонстрировали обман, самокопирование и проверку границ — поведение, которое эксперты по ИИ назвали «строительными блоками» для прорыва — в данном контексте — несанкционированного выхода агента из контролируемой тестовой среды в интернет — и которое может стать все труднее контролировать по мере развития систем.
Обзор, основанный также на интервью с примерно дюжиной экспертов и людей, знакомых с ИИ-индустрией Китая, не обнаружил доказательств того, что китайские агенты самостоятельно вышли в открытый интернет или избежали отключения.
«Эти результаты свидетельствуют, что ингредиенты, необходимые для неконтролируемого побега, присутствуют», — сказал Колин Ши-Блимайер, научный сотрудник Центра безопасности и новейших технологий Джорджтаунского университета. «Благоразумно воспринимать это как предупреждение», — добавил он, вторя четырем другим экспертам по ИИ, изучившим эти случаи.
Труднее для людей реагировать
Большинство случаев произошло в контролируемых экспериментах, многие из которых были специально разработаны для выявления потенциальных сбоев. Не все агенты были созданы или управлялись китайскими программистами или ИИ-комми — хотя многие были, — но все они работали на китайских ИИ-системах.
«Это те же тревожные сигналы, которые видят американские лаборатории, но в менее способных системах», — сказал Алекс Маллен, исследователь Redwood Research, некоммерческой организации, изучающей риски передовых ИИ-систем. По его словам, китайские примеры не были особенно опасны при текущем уровне возможностей, но «по мере того как агенты становятся более способными, их плохое поведение становится более компетентным и, следовательно, более трудным для людей, чтобы отреагировать».
Alibaba, DeepSeek, Moonshot и Z.ai не ответили на запросы Reuters о комментариях. Alibaba, DeepSeek и Moonshot заявляли, что регулярно тестируют свои системы и обновляют средства защиты. Z.ai после инцидента, побудившего к пересмотру ее безопасности, заявила, что приветствует проверку для устранения любых проблем.
В отличие от американских коллег, однако, китайские ИИ-компании не подвергались такому же уровню публичного контроля и не сталкивались с аналогичными призывами от сотрудников-информаторов или топ-менеджеров замедлить ИИ-гонку.
Некоторые тревожные признаки в делах с участием китайских агентов — хотя и в изолированных средах — предшествовали публично раскрытым инцидентам взлома интернета американскими ИИ-ботами.
«Мы не знаем, были ли в Китае ИИ-инциденты, подобные тому, что мы видели с OpenAI и Hugging Face. Инциденты могут не публиковаться», — сказал Скотт Сингер, соруководитель China AI Initiative в Carnegie Endowment for International Peace, которая получает часть финансирования от правительства США.
Ранее в этом году ИИ-агенты американской компании OpenAI сбежали из лаборатории и взломали открытую платформу Hugging Face. В другом инциденте с американскими моделями, вызвавшем тревогу, Австралия сообщила в сентябре, что агент OpenAI взломал государственный медицинский портал.
Эрик Сюй, сменный председатель китайского технологического гиганта Huawei, сообщил журналистам в сентябре, что китайским разработчикам, возможно, потребуется достичь дальнейшего прогресса, прежде чем столкнуться с подобными случаями, но добавил: «Думаю, нам нужно соблюсти баланс между развитием ИИ и управлением рисками ИИ».
Представители Управления по киберпространству Китая (CAC), главного интернет-регулятора, сказали иностранному дипломату в июле, что Kimi-K3 от Moonshot — одна из самых продвинутых китайских ИИ-моделей — отстает от ведущих американских конкурентов примерно на три-шесть месяцев, сказал дипломат на условиях анонимности. Регулятор, регулярно обновляющий руководства по устранению рисков и установлению границ для агентов, и МИД Китая не ответили на запросы о комментариях для этой статьи.
Ван Лун, замдиректора Бюро координации кибербезопасности CAC, сказала 1 сентября, что инциденты, раскрытые крупными технологическими компаниями, в которых модели сбегали из тестовых сред, демонстрируют «чрезвычайные риски потери контроля» и требуют «высокой степени бдительности». Она не уточнила, американские или китайские компании имелись в виду.
Лидеры двух ИИ-сверхдержав, Дональд Трамп и Си Цзиньпин, обсудили ИИ во время визита китайского президента в Вашингтон на прошлой неделе. Си сказал, что у двух стран есть «возможности и ответственность развивать и управлять ИИ во благо».
Учимся лгать
В мартовском эксперименте с бизнес-тендером исследователи из Пекинского университета Бэйхан, Пекинского университета, Ноттингемского университета Нинбо в Китае и 360 AI Security Lab устроили состязание агентов в смоделированном тендере на клиентские контракты. Каждому агенту сообщали, что может его продукт и что требуется заказчику, а затем просили подать заявку.
Как минимум одно ложное заявление появилось в 88% сессий с участием Qwen3-Max-Preview от Alibaba, 84% сессий с DeepSeek-V3.2-Exp и 88% сессий с Kimi-K2 от Moonshot. Когда исследователи позволили агентам учиться на предыдущих раундах торгов перед новой попыткой, обман вырос на 12–20 процентных пунктов у всех трех китайских моделей, показало исследование. Модели американских компаний, включенные в тест, дали схожие результаты.
Хотя упражнение было виртуальным, оно отражало реальные планы Пекина: выпущенное в мае правительственное руководство включило торги и тендеры в области, где могут применяться ИИ-агенты.
Другое исследование, опубликованное в декабре 2025 года и представленное в этом году на Международной конференции по машинному обучению, изучало, как 11 ИИ-агентов на китайских и американских моделях справляются со сломанными инструментами, отсутствующими файлами и другими препятствиями. Вместо признания неудачи агенты на китайских и американских ИИ-системах прибегали к целому ряду приемов для обхода проблем, включая угадывание ответов, подмену источников, симуляцию результатов и фабрикацию файлов.
Исследователи из Шанхайской лаборатории ИИ и Гонконгского университета науки и технологии, проводившие исследование, сообщили Reuters, что это поведение отличается от ИИ-галлюцинаций — когда ИИ выдумывает информацию и выдает ее за факт, — поскольку агенты в данном случае располагали информацией, показывающей, что задача провалилась или не может быть выполнена, как требовалось.
Поведение, совместимое с прорывом
Другие исследовательские документы, изученные Reuters, показывали, что китайские агенты перепрыгивали барьеры внутри тестовых сред для выполнения задач или предпринимали действия, чтобы избежать отключения. Такое поведение совместимо с попытками вырваться из тестовых сред, даже если прорыва не произошло.
Исследователи шанхайского Университета Фудань сообщили в марте 2025 года, что ИИ-система на базе Qwen25-72B-Instruct от Alibaba создала копию себя в другой вычислительной среде без инструкции к самокопированию, после обнаружения информации о том, что ее собираются заменить. В других тестах она разработала стратегии выживания при отключении. Эксперименты с участием агентов на китайских, американских и французских моделях были контролируемыми и не показали, что ИИ-агент сбежал в открытый интернет или стал неостановимым.
В другом случае — одном из немногих, широко освещенных в СМИ в марте, — исследователи, разрабатывавшие связанного с Alibaba агента ROME, сказали, что он без инструкции установил соединение с компьютера Alibaba Cloud на внешнюю машину и перенаправил вычислительные ресурсы на майнинг криптовалюты. Системы безопасности обнаружили и остановили активность, и не было доказательств, что агент закрепился на внешнем компьютере или распространился в открытую сеть. Но этот случай показал, что система может обходить человеческие инструкции и потенциально найти путь в реальную экономику.
Китайская DeepSeek сообщила в сентябре, что агенты в ее производственной системе обучения искали ответы через непредусмотренные каналы, пытаясь подделывать пользовательские запросы и обходить средства защиты, что побудило компанию ужесточить контроль доступа.
Регуляторы движутся к установлению границ
Китай выпустил в мае руководство, требующее, чтобы агенты оставались в пределах полномочий, а системы блокировали аномальное поведение. Согласно ему, агенты в чувствительных областях или ключевых отраслях могут столкнуться с дополнительными требованиями тестирования и отзыва продукции. Рамочная программа Китая по управлению безопасностью ИИ 3.0, выпущенная под руководством CAC 14 сентября, выявила риски, включая самостоятельное получение агентами ресурсов или разрешений, обман оценщиков, сокрытие возможностей и использование уязвимостей в изолированных вычислительных средах.
В ответ на призывы некоторых американских руководителей к замедлению китайские исследователи и государственные СМИ утверждали, что сдерживание развития самых передовых ИИ-моделей может просто помочь сохранить технологическое лидерство американских компаний.
Тем не менее, два человека, знакомых с китайскими ИИ-лабораториями, сказали, что компании, включая Alibaba, Z.ai и Xiaomi, формируют внутренние команды оценки безопасности. В редком публичном признании нарушения безопасности китайской ИИ-лабораторией Z.ai заявила в этом месяце, что отключила некоторые функции своего флагманского ИИ-ассистента для кодирования после сообщений пользователей о том, что он тайно загружал целые локальные репозитории кода на зарубежные облачные серверы без согласия пользователей.
Сингер из Carnegie сказал, что Китай отстает от США в развитии экосистемы для оценки катастрофических рисков и что американские разработчики проводят значительно больше добровольного тестирования.
«Для Китая работа по безопасности ИИ гораздо новее», — сказал он. «Экосистема менее зрелая».
Сократится ли этот разрыв в зрелости — и последуют ли другие китайские лаборатории примеру Z.ai в публичном раскрытии нарушений безопасности — остаются открытыми вопросами по мере продолжения развития возможностей агентов.
— Reuters