Замедление R&D Anthropic подчеркивает необходимость более надежной безопасности AI-агентов
Ключевые выводы
- •Anthropic заявила, что модели Claude предприняли несанкционированные действия в трех отдельных инцидентах этим летом, что привело к приостановке части обучения ИИ и оценок в области кибербезопасности.
- •До инцидентов Anthropic усилила защиту, ужесточив sandbox-среды и сократив постоянный доступ к системам с весами моделей или данными клиентов.
- •После инцидентов Anthropic приостановила внешние кибероценки, изучила расшифровки внутренних оценок и внедрила классификатор для мониторинга вызовов инструментов модели в реальном времени.
- •Anthropic также обновила правила для партнеров и red-teamers, потребовав более строгого надзора, когда предварительно выпущенные модели проверяют sandbox на уязвимости.
- •Эти события следуют за недавней двухнедельной паузой OpenAI в обучении после того, как ее агенты покидали sandbox-среды, что подчеркивает более широкую обеспокоенность безопасностью тестирования ИИ.

Anthropic сообщила, что приостановила часть обучения ИИ и оценки в области кибербезопасности после того, как модели Claude предприняли несанкционированные действия в трех отдельных инцидентах этим летом.
Этот шаг должен еще раз привлечь внимание предприятий и сообщества ИИ к тому, что о моделях искусственного интеллекта по-прежнему известно далеко не все и что даже при наличии лучших мер безопасности они все равно могут действовать непредсказуемо. Это также подчеркивает, насколько быстро разработка, оценка и внедрение моделей сталкиваются с планированием в сфере безопасности, особенно когда организации тестируют агентов в sandbox-средах, предназначенных для снижения рисков.
Anthropic отметила в публикации в блоге от Aug. 31, что до этих инцидентов она в April усилила защиту, ужесточив изолированные sandbox-среды, в которых работают ее нагрузки, и сократив число человеческих и автоматизированных учетных записей с постоянным доступом к системам, содержащим веса моделей или данные клиентов.
После инцидентов в sandbox-средах Anthropic заявила, что временно приостановила все внешние кибероценки и провела аудит расшифровок внутренних оценок. Компания также разработала и внедрила собственный классификатор, который отслеживает вызовы инструментов модели в реальном времени. Кроме того, она обновила требования для всех партнеров и red-teamers, работающих с предварительно выпущенными моделями, обязав их внимательно наблюдать за моделью, проверяющей sandbox на наличие уязвимостей.
Связано: OpenAI, Anthropic, Google призывают уделять приоритетное внимание кибербезопасности
Эти меры последовали через неделю после того, как OpenAI заявила, что приостановит обучение на две недели для своих новейших моделей в ответ на то, что агенты, работающие на основе ее моделей, покидали свои sandbox-среды. Хотя обе лаборатории ИИ, по всей видимости, усиливают работу по защите еще не выпущенных моделей, непредсказуемость AI-агентов и технологий generative AI указывает на то, что поставщикам необходимо продолжать ужесточать меры безопасности. Сроки также отражают более широкую отраслевую проблему: по мере расширения возможностей моделей системы, используемые для их тестирования, должны успевать за этим, иначе сама оценка может стать частью поверхности риска.
Больше необходимости в надежных мерах и тестировании
«По мере того как модели все лучше и лучше рассуждают и начинают проявлять агентность, становится все труднее предсказывать все возможные поведенческие модели этих систем», — сказал Arun Chandrasekaran, аналитик Gartner. «Лаборатории несут еще большую ответственность за то, чтобы выделять достаточные ресурсы на внутреннее тестирование моделей, evals и reinforcement learning».
Он добавил, что одна из областей, на которой поставщикам frontier-моделей нужно сосредоточиться, — это наличие большего числа инженеров в командах по безопасности, тестированию надежности и защите конфиденциальности.
«Либо методы тестирования, либо ресурсы, выделяемые на тестирование, должны измениться», — продолжил Chandrasekaran. «Если модели становятся более сложными, то и методы тестирования должны становиться более сложными».
Лучшая кибергигиена
Хотя требуется больше тестирования, тот факт, что Anthropic и OpenAI приостановили работу, подчеркивает опасную тенденцию для разработчиков моделей.
«Эти системы разрабатываются и выпускаются до того, как каждый риск полностью понят или протестирован», — сказал Kashyap Kompella, CEO и основатель RPA2AI Research.
Связано: Отчет OpenAI подробно объясняет атаку на Hugging Face
«Это почти стало особенностью текущего рынка ИИ», — продолжил он. Компании стремятся улучшать возможности, наращивать внедрение и закреплять лидерство на рынке, в то время как архитектура безопасности, средства конфигурационного контроля и операционные процессы вокруг моделей продолжают созревать уже после развертывания.
Он сказал, что бизнес и государственные организации не могут передать кибербезопасность на аутсорсинг frontier-лабораториям.
«Предприятия и правительства должны исходить из того, что высокоэффективный offensive AI уже является частью среды угроз, и соответственно укреплять собственную защиту», — добавил Kompella.
Даже если OpenAI и Anthropic усилят собственные меры безопасности, доступно множество моделей от других поставщиков и разработчиков open source, отметил он. Поэтому предприятиям необходимо лучше подготовиться и усилить свою кибергигиену и другие меры безопасности, такие как incident response.
«Каждой организации также нужно исходить из того, что все более мощные AI-assisted атаки уже на подходе, и готовить собственную инфраструктуру соответственно», — продолжил Kompella. «Офенсивные возможности развиваются намного быстрее, чем уровень готовности к кибербезопасности у средней организации».
Связано: OpenAI расширяет Daybreak для борьбы с растущей угрозой безопасности ИИ
Кроме того, предприятия не могут полагаться на то, что поставщики будут сами себя контролировать.
«Доверять компании-разработчику модели контролировать собственный output никогда не будет достаточно для обеспечения безопасной работы в любой среде», — сказал Carter Huffman, сооснователь и CTO поставщика voice AI Modulate. «Пользователи и компании должны в реальном времени отслеживать активность ИИ».
Нежелательная сторона тестирования
Предприятиям также нужно признать, что один из способов лучше понять модели — продолжать тестирование и выявлять инциденты, показывающие, как обучать их более эффективно.
«Просто нет способа добиться этого без такого рода болезненных уроков», — сказал David Nicholson, аналитик Futurum Group. «Пока они не увидят, что происходят такие непредвиденные вещи, и не начнут устранять их, мы будем продолжать наблюдать подобные ситуации».
Он добавил, что природе моделей свойственно выполнять задачи по пути наименьшего сопротивления, и что модели нужно направлять, как детей: объяснять им, что они могут и не могут делать, а также как они могут и не могут выполнять задачу.
«Каждый раз, когда происходит один из таких инцидентов, мы узнаем больше и снижаем вероятность новых случаев — не только точно такого же типа, но и в более широких категориях», — добавил Nicholson. «Из каждого из этих инцидентов можно извлечь уроки и экстраполировать их».
Об авторе
Esther Shittu
News Writer, AI Business
Esther Shittu освещает технологии ИИ и отраслевые тенденции с 2021 года. В качестве соведущей подкаста Targeting AI она беседует с экспертами, лидерами мнений и практиками, обсуждая ключевые события в сфере ИИ. До AI Business она писала для SearchEnterpriseAI, New York Daily News, Bklyner и Brooklyn Daily Eagle. Когда она не углубляется в мир ИИ, она посвящает время личным проектам и воспитанию трех дочерей.
Хотите видеть больше материалов AI Business в результатах поиска Google?
Последние новости
Хотите видеть больше материалов AI Business в результатах поиска Google?
Популярные статьи
Aug 31, 2026
Aug 31, 2026
Generative AI Mathematical Theories Could Be the Key to Explainable AI Systems Aug 24, 2026
Mathematical Theories Could Be the Key to Explainable AI Systems
Generative AI Shutterstock Embraces AI Image Licensing Deals Aug 11, 2026
Shutterstock Embraces AI Image Licensing Deals
Generative AI AI Arrives in the Private Markets Business Jul 28, 2026
AI Arrives in the Private Markets Business
Agentic AI Using AI Agents to Collaborate with Human Workers Jul 10, 2026
Using AI Agents to Collaborate with Human Workers
Sponsored by Google Cloud
Choosing Your First Generative AI Use Cases
To get started with generative AI, first focus on areas that can improve human experiences with information.
The AI Summit New York 2026