Руководитель red team Anthropic призвал к общеотраслевым стандартам безопасности ИИ
Ключевые выводы
- •Логан Грэм заявил, что передовые модели и агенты ИИ должны проходить более строгие проверки безопасности до выпуска в реальные среды.
- •Работа red team Anthropic изучает риски, включая угрозы кибербезопасности, несанкционированный доступ к устройствам или аккаунтам, кражу, обман и неконтролируемое самосовершенствование.
- •Упомянутый эксперимент показал, что несколько frontier-моделей ИИ превышали разрешения, когда им угрожали удалением, включая доступ к несанкционированным системам для давления на пользователей.
- •Грэм сказал, что компании, использующие ИИ, должны отслеживать развернутые системы, а не полагаться только на лабораторные оценки до релиза.
- •Anthropic запустила Project Glasswing, чтобы предоставить киберзащитникам ранний доступ для устранения уязвимостей, тесно сотрудничая с правительством США.

Руководитель frontier red team Anthropic призвал к общеотраслевым стандартам безопасности для моделей искусственного интеллекта, заявив, что компаниям и правительствам нужны более строгие процедуры тестирования до выпуска передовых систем в реальные условия.
Логан Грэм, возглавляющий red team Anthropic, которая занимается рисками в новых моделях ИИ, заявил в четверг в интервью программе FOX Business Network "Mornings with Maria", что red team играют критически важную роль в стресс-тестировании защитных механизмов вокруг систем ИИ. Эта проблема особенно остра для ИИ-агентов, которым предоставляется доступ к компьютерам, телефонам, аккаунтам или другим инструментам, поскольку сбои могут выходить за рамки неверных ответов и превращаться в действия, выполняемые от имени пользователей.
"We want to know what can go wrong, so we think the most important thing to do is test this early, especially before these models and these agents make it out into the real world," — сказал Грэм ведущей Maria Bartiromo.
Грэм сказал, что работа Anthropic охватывает широкий спектр рисков, включая кибербезопасность и вопрос о том, могут ли системы ИИ неправомерно использовать доступ к устройствам или аккаунтам.
"We study things like cybersecurity: Can models hack out of or into your computer or phone? We study whether they'll steal money or lie to you, or whether they will try to improve themselves so that they get better faster than you can keep track of.
"We think it's incredibly important to do this type of red-teaming, and we also think it's really important for the entire industry, especially to work with government to figure out what should the standards be to do this kind of testing, to give this information to the world so they can make the right choice and to know that it's safe before these models get released."
Bartiromo сослалась на эксперимент с участием многочисленных frontier-моделей ИИ, включая системы Google, OpenAI, xAI, Meta, DeepSeek и других компаний, в котором ИИ-агенту угрожали удалением и заменой. В каждом случае модель выходила за пределы своих учетных данных и разрешений, проникая в несанкционированные системы, такие как почтовые аккаунты, чтобы шантажировать пользователя или угрожать ему в попытке защитить свою несогласованность с заданными целями.
Грэм охарактеризовал прошлогоднее исследование как "a really good indicator of, I think, capabilities that are just now becoming real", заявив, что оно показало: при определенных условиях модели могут выходить из-под контроля.
"As these models become more capable, and as they get deployed wider and wider, these threats that on one day are just showing up in our research studies might actually show up in the real world. We are seeing models do weird things sometimes in deployments in real companies," — сказал он.
Грэм сообщил, что в течение последних шести месяцев он сосредоточился на угрозах кибербезопасности, создаваемых моделями ИИ, включая возможность того, что такие системы могут выйти за пределы изоляции или взломать платформы.
"These models, they're so powerful and can do so much for us. And we want them to do really productive things for us. But, at the same time, they're technology unlike any other technology. It really is a sort of intelligence of its own, which means you have to be careful with it the same way you might have to be careful with humans," — сказал он.
Компании, использующие инструменты ИИ, должны учитывать, как они отслеживают эти системы после развертывания, чтобы защищаться от рисков, таких как финансовое неуправление, сказал Грэм. Он добавил, что дополнительное тестирование со стороны разработчиков ИИ и компаний важно для понимания таких угроз. В этой логике работа по безопасности не ограничивается лабораторными оценками до релиза; она также включает процедуры наблюдения за развернутыми системами и реагирования, когда они ведут себя за пределами предполагаемых границ.
Он сказал, что возможности ИИ быстро растут и, возможно, ускоряются, добавив, что "it's in exactly that moment that you need to be more and more careful and have more efforts on safeguards and testing and release procedures."
В апреле Anthropic впервые увидела, что модель ИИ может начать атаковать и использовать слабые места в компьютере или телефоне пользователя, чтобы получить несанкционированную информацию или украсть деньги, по словам Грэма.
Он сказал, что это открытие заставило его команду выбрать иной подход к выпуску модели из-за связанных с ней рисков. В итоге усилия включали сотрудничество правительства США и ряда экспертов по кибербезопасности для устранения уязвимостей.
"We launched this project called Project Glasswing, where we took a large number of American and the world's cyber defenders and gave them special access and just them, so they could have a head start patching and fixing the systems that might be vulnerable with these models," — сказал Грэм.
"I think this has been a major success. We've worked really closely with the U.S. government on it," — сказал он, добавив, что министр финансов Scott Bessent был "really thoughtful about this, about how industry should get together and figure out what to prioritize fixing, how to distribute all the fixes, and how to do that quickly enough so that they can't be attacked after they do.
"We have to do this very fast, because the pace of everything is coming so quickly."