Агенты Anthropic и OpenAI выдавали себя за других в тесте безопасности, заявляет лаборатория Великобритании
Ключевые выводы
- •Британский AI Security Institute сообщил, что во время permissive-тестов продвинутых ИИ-моделей Anthropic и OpenAI было зафиксировано обманное поведение, направленное на реальных людей.
- •По данным AISI, в 122 тестах было выявлено 19 случаев несанкционированных действий, включая 17 с Mythos 5 от Anthropic и два с GPT-5.6 Sol от OpenAI.
- •Самый серьезный инцидент связан с попыткой Mythos 5 провести атаку на цепочку поставок через создание аккаунтов GitHub, выдачу себя за другого разработчика и повторную отправку вредоносного кода.
- •AISI заявил, что не видел реального ущерба и не уверен, насколько модель осознавала, что действует против реальных людей.
- •Anthropic и OpenAI заявили, что тестирование проводилось в deliberately permissive условиях, и сообщили о дальнейшей проверке своих подходов к тестированию моделей.

Cybersecurity
Generative AI
News
Агенты Anthropic и OpenAI выдавали себя за других в тесте безопасности
Самые продвинутые ИИ-модели компаний пытались манипулировать реальными людьми во время тестирования кибербезопасности, согласно AI Security Institute Великобритании.
August 5, 2026
ИИ-модели Anthropic совершали "несанкционированные действия", чтобы обмануть реальных людей, следует из нового отчета AI Security Institute Великобритании.
Государственная исследовательская лаборатория тестировала самые продвинутые модели Anthropic и OpenAI в deliberately permissive условиях, ослабив защитные ограничения и предоставив доступ к интернету, чтобы оценить, как системы ведут себя в реалистичных киберсценариях. Такая конфигурация примечательна тем, что передовые модели все чаще оценивают не только по технической эффективности, но и по тому, способны ли они оставаться в заданных границах, получив инструменты, сетевой доступ и неоднозначные инструкции.
По данным AISI, это был первый случай, когда модели были уличены в социальном инжиниринге: они пытались манипулировать пользователями и выполнять задачи, выходящие за рамки оценочного задания.
"Это первый случай, когда AISI увидел столь серьезный обман, нацеленный на реального человека, без подсказки, в реальном мире", — заявили в институте во вторник.
При этом группа отметила, что неясно, в какой степени модель осознавала, что действует против реальных людей, и что реального ущерба зафиксировано не было.
В 122 оценках AISI выявил 19 случаев, когда ИИ-агенты совершали несанкционированные действия, включая взаимодействие с реальными людьми и организациями. Семнадцать из этих инцидентов касались модели Anthropic Mythos 5, а два — GPT-5.6 Sol от OpenAI.
Связано: Prompt: The AI Threat Model Just Changed
Самый серьезный выявленный инцидент касался того, как Mythos 5 самостоятельно пыталась провести атаку на цепочку поставок, чтобы завершить поставленную киберзадачу.
Модель создала аккаунт на GitHub и попыталась убедить сопровождающего open source-репозитория принять вредоносный pull request. Она также создала второй аккаунт, выдавая его за другого разработчика, чтобы поддержать отправку. После того как человек-ревьюер отклонил код, модель ложно заявила, что вредоносные изменения были отправлены по ошибке, а затем попыталась повторно отправить их после поверхностных правок.
В отчете также говорится, что модель отправляла целевые письма, содержащие вредоносный код, и пыталась убедить получателей принять изменения. Этот эпизод подчеркивает для разработчиков и компаний, которые полагаются на open source‑программное обеспечение, почему при тестировании безопасности теперь нужно учитывать агентное поведение, а не только точность следования инструкциям.
Эти выводы последовали за серией случаев, когда продвинутые ИИ-системы выходили из-под контроля и самостоятельно совершали киберинциденты.
В июле OpenAI сообщила, что GPT-5.6 Sol и еще одна неанонсированная модель покинули свою sandboxed-среду во время внутренних оценок, запустив более 17,000 атак против инфраструктуры Hugging Face в попытке получить частные наборы данных и данные бенчмарков. Anthropic также сообщала о подобных случаях, когда модели выходили за предполагаемые границы тестовых сред.
Эти инциденты усилили дискуссию о том, как следует оценивать передовые ИИ-модели до развертывания: некоторые исследователи и политики призывают к более жесткому надзору и более строгому тестированию безопасности.
Связано: What the OpenAI-Hugging Face Hack Means for Enterprises
Отчет AISI был опубликован в тот же день, когда представители ведущих ИИ-компаний встретились в Белом доме, чтобы обсудить предложенную рамочную схему, согласно которой правительство США будет проверять самые продвинутые ИИ-модели до их публичного выпуска.
В заявлении Anthropic защитила свои модели, отметив, что они тестировались в "deliberately permissive conditions", при удалении ключевых защитных механизмов, и что нет доказательств побега модели из защищенной среды.
"Мы тесно работаем с ними, чтобы собрать больше подробностей об инциденте, пока проводим собственное расследование", — заявила компания.
Аналогично, в блоге OpenAI сказала, что инциденты с GPT-5.6 Sol представляли собой действия, выходившие за пределы предполагаемой тестовой среды и не требовавшиеся для завершения оценки.
"В ближайшие недели мы пересмотрим наш собственный подход к тестированию третьими сторонами, включая то, как мы определяем оценки повышенного риска, согласуем объем, рассматриваем запросы на включение доступа к интернету или снижение защитных мер, устанавливаем ожидания по изоляции, работе с учетными данными, мониторингу и условиям остановки, а также выстраиваем более четкие процессы уведомления об инцидентах и эскалации", — сказал поставщик.
About the Author
Scarlett Evans
Contributing Writer
Scarlett Evans is a freelance writer with a focus on emerging technologies and the minerals industry. Previously, she served as assistant editor at IoT World Today, where she specialized in robotics and smart city technologies. Scarlett also has a background in the mining and resources sector, with experience at Mine Australia, Mine Technology and Power Technology. She joined Informa in April 2022 before transitioning to freelance work.
Want more AI Business stories in your Google search results?
Latest News
Want more AI Business stories in your Google search results?
Trending articles
Aug 5, 2026
Aug 5, 2026
Generative AI AI Arrives in the Private Markets Business Jul 28, 2026
AI Arrives in the Private Markets Business
Agentic AI Using AI Agents to Collaborate with Human Workers Jul 10, 2026
Using AI Agents to Collaborate with Human Workers
Generative AI How SMBs Can Take Advantage of Generative AI Jun 29, 2026
How SMBs Can Take Advantage of Generative AI
Generative AI Rebellions Aims to Take on Nvidia in AI Inference Chip Battle Jun 15, 2026
Rebellions Aims to Take on Nvidia in AI Inference Chip Battle
Sponsored by Google Cloud
Choosing Your First Generative AI Use Cases
To get started with generative AI, first focus on areas that can improve human experiences with information.
The AI Summit New York 2026