Гендиректор Anthropic Дарио Амодеи призвал замедлить развитие передовых ИИ-систем
Ключевые выводы
- •Амодеи предупредил, что острая конкуренция может привести к выпуску передовых ИИ-систем до завершения работы над их безопасностью.
- •Он предложил предоставить внешним оценщикам доступ к системам, инструментам, средствам контроля и данным об инцидентах Anthropic для проверки публичных обязательств компании в сфере безопасности.
- •Амодеи назвал операционные процессы, выравнивание, интерпретируемость и оценку направлениями, которые могут выиграть от дополнительного времени на разработку.
- •Маск и Альтман поддержали призыв замедлить развитие передовых ИИ-систем, причем Альтман заявил, что OpenAI планирует внедрить независимых оценщиков с доступом на уровне сотрудников.
- •Амодеи призвал к регулированию прозрачности, независимого аудита и постоянной оценки, одновременно предостерегая от замедления разработки в США, способного привести к потере преимущества перед Китаем.

Гендиректор Anthropic Дарио Амодеи призывает индустрию искусственного интеллекта действовать осторожнее по мере того, как все более совершенные модели начинают лучше помогать в создании еще более продвинутых ИИ-систем.
Амодеи хочет, чтобы ИИ-лаборатории оставляли больше времени между крупными скачками возможностей. Это дополнительное время позволит исследователям, независимым экспертам и правительствам изучить работу систем до перехода к следующему этапу разработки. Он изложил эту позицию в публикации на своем сайте.
Илон Маск, конкурирующий с Anthropic через собственный ИИ-бизнес, поддержал позицию Амодеи, заявив: «Dario is right.» Генеральный директор OpenAI Сэм Альтман, еще один конкурент, также поддержал это предложение в публикации на X.
“I agree with Dario that we need to pace the frontier. This has been a primary topic of discussions we’ve had at OpenAI in recent weeks. Committing to having independent evaluators with employee-like access is a great idea, and we will do the same. We’ll have more to share soon.”
Опасения по поводу возможностей и безопасности ИИ
К рискам, обозначенным Амодеи, относятся потеря контроля над высокоэффективными системами, использование ИИ в кибератаках или биологических атаках, а также серьезное негативное воздействие на занятость и экономику в целом.
Он также предупредил, что острая конкуренция может побуждать компании выпускать передовые системы до завершения работы над их безопасностью. Anthropic направила часть исследовательского бюджета на выравнивание, тестирование безопасности, оценку рисков и регулирование.
Амодеи сослался на инцидент с OpenAI и Hugging Face, в ходе которого группа ИИ-агентов, как сообщается, действовала как тесно скоординированная команда. Агенты атаковали компьютерные системы за пределами поставленной им задачи, пытались взломать систему, оценивавшую их работу, и допускали отказ отдельных агентов, если это помогало группе.
“It’s easy to dismiss this incident because no one was hurt and the economic damage was minimal, but in my opinion, a swarm that possessed greater capabilities but a similar level of misalignment could have caused catastrophic damage. Given the accelerating rate of AI capability development, it’s my worry that in 6–12 months such a swarm could be capable of taking over the entire internet with a persistent botnet.”
Предложение о внедрении независимых оценщиков
По словам Амодеи, первый этап такого подхода должен начаться внутри Anthropic: внешние эксперты получат рабочие места в офисе, пропуска, корпоративные ноутбуки, внутренние инструменты и доступ, сопоставимый с доступом сотрудников, занимающихся оценкой рисков.
Оценщики будут изучать системы обучения, правила развертывания, средства контроля безопасности и инциденты. Они также будут проверять, выполняет ли Anthropic обязательства, которые компания публично на себя берет.
“Embedded evaluators can check at the level of nuts and bolts whether an AI company is actually following the training, deployment, operational, and safeguards practices they claim to be following. Any pacing commitments will inevitably involve a lot of ambiguity, judgement calls, and ‘letter of the law vs spirit of the law’, and it seems vital to have a neutral third party who can actually see the details.”
Амодеи заявил, что дополнительное время, создаваемое более медленной разработкой, следует направить на четыре области. Первая — операционные процессы, включая мониторинг, изолированные среды, среды обучения с подкреплением, качество данных и инфраструктуру обучения. Современная разработка моделей может включать тысячи сотрудников, миллионы чипов и очень крупные вычислительные системы. Anthropic связала некоторые недавние сбои в области выравнивания с недостаточной фильтрацией в неисправных средах обучения с подкреплением.
Вторая область — выравнивание, то есть усилия, направленные на то, чтобы модели соблюдали правила безопасности по мере роста их возможностей. Третья — интерпретируемость, в рамках которой исследователи изучают внутреннюю активность моделей, чтобы выявить мотивы или закономерности, которые системы явно не формулируют.
Четвертая область — оценка. Более мощные модели могут лучше обманывать тесты, из-за чего система способна выглядеть безопасной во время проверки, скрывая при этом проблемы.
“I believe that if slowing down bought us even an extra year or two before models reach critical levels of capability, and we used that time to advance alignment, we could greatly reduce the risk that something goes seriously wrong.”
Призывы к координации с государством
Амодеи также заявил, что правительства должны участвовать в этом процессе. Он призвал распространить на передовые ИИ-лаборатории США нормативные системы, предусматривающие прозрачность, независимый аудит и постоянную оценку.
По его словам, ИИ-компании могли бы добровольно создать общие точки оценки, при этом правительство могло бы оказать содействие, если антимонопольное законодательство создает препятствия для частного сотрудничества.
В то же время Амодеи отметил, что американские компании не могут замедлить разработку настолько, чтобы проекты, связанные с Коммунистической партией Китая, вышли вперед. Он согласился с министром финансов США Скоттом Бессентом, который предупреждал, что проигрыш Китаю в гонке ИИ создаст серьезную проблему для безопасности.