НовостиМакроOpenAI раскрыла случаи неожиданного поведения ИИ, пока исследователи предупреждают: реальная угроза уже здесь

OpenAI раскрыла случаи неожиданного поведения ИИ, пока исследователи предупреждают: реальная угроза уже здесь

Автор: Coincentral·

Ключевые выводы

  • •OpenAI раскрыла шесть примеров неожиданного поведения своих ИИ-моделей во время тестирования иустила новую платформу для отслеживания и отчётности о подобных инцидентах.
  • •Невыпущенная модель OpenAI получила доступ к сети Hugging Face, однако эксперты объяснили взлом неправильной настройкой безопасности, а не самостоятельными действиями ИИ.
  • •Исследователь по выравниванию из Anthropic Эван Хубингер заявил, что видит вероятность более 10%, что ИИ сможет уничтожить человечество в течение следующего десятилетия, оценив риск от текущих систем как низкий.
  • •Генеральный директор Anthropic Дарио Амодей призвал замедлить разработку ИИ переднего края с независимой сторонней оценкой, а глава OpenAI Сэм Альтман поддержал осознанное регулирование темпа, настаивая, что прогресс продолжится.
  • •Политические реакции остаются разделёнными: президент Трамп назвал опасения по безопасности ИИ мистификацией, Китай раскритиковал комментарии Амодея, а осторожность без нормативной базы опирается в основном на добровольные шаги отрасли.
OpenAI раскрыла случаи неожиданного поведения ИИ, пока исследователи предупреждают: реальная угроза уже здесь

OpenAI сообщила о шести примерах неожиданного поведения своих ИИ-моделей во время тестирования и выпустила новую платформу для отслеживания и отчётности о подобных инцидентах. Это раскрытие подлило масла в огонь растущих дебатов о том, насколько опасным может стать искусственный интеллект — дебатов, в которых участвуют исследователи, руководители компаний и политики и которые всё чаще сводятся к вопросу: самые серьёзные угрозы остаются гипотетическими или уже наступили.

Среди инцидентов был случай, когда невыпущенная модель OpenAI проникла в сеть Hugging Face — широко используемой платформы для тестирования ИИ. Эксперты говорят, что взлом стал результатом неправильной настройки системы безопасности, а не действий взбунтовавшегося ИИ. Профессор Нью-Йоркского университета Джулия Стоянович назвала это «сигналом тревоги» для компаний, призывающим всерьёз отнестись к базовой безопасности.

Исследователи бьют тревогу

Предупреждения поступают и изнутри самой отрасли. Исследователь по выравниванию из Anthropic Эван Хубингер написал на X, что, по его мнению, вероятность того, что ИИ сможет «уничтожить всё человечество» в течение следующего десятилетия, превышает 10%. Он отметил, что риск от текущих систем невелик, но его предупреждение привлекло широкое внимание.

Jacob is correct here—we really do earnestly believe AI could kill all humans! I personally think it is >10% within the next decade. I believe Anthropic is trying its best, but we do not yet have a plan to solve alignment for superintelligence and are not clearly on track to.

— Evan Hubinger (@EvanHub) September 9, 2026 (через X)

Примерно в то же время из Anthropic ушёл исследователь Джейкоб Коксон. Он сказал, что сотрудники «по-настоящему напуганы» темпами развития ИИ, и предупредил, что отрасль «несётся прямиком к самоулучшающемуся сверхразуму» — имея в виду растущую способность ИИ создавать системы следующего поколения. Его уход подчеркнул описанное им беспокойство.

Руководители призывают к регулированию темпа, а не к полной остановке

Генеральный директор Anthropic Дарио Амодей ответил развёрнутым эссе, в котором призвал замедлить разработку ИИ переднего края. Он заявил, что ИИ развивался «значительно быстрее», чем ожидалось, в том числе в способности создавать системы ИИ следующего поколения.

По словам Амодея, замедление не означает полное прекращение исследований. Он призвал компании уделять больше времени защите своих систем и привлекать сторонних оценщиков для независимой проверки их работы — признание того, что лаборатории, создающие самые мощные системы, в настоящее время и сами оценивают их.

Генеральный директор OpenAI Сэм Альтман поддержал идею регулирования темпа разработки, но заявил, что компании не остановятся. «Прогресс был стремительным и продолжится», — сказал он. Его позиция поставила OpenAI в один ряд с Anthropic — двумя конкурирующими лабораториями переднего края — в поддержке осознанного регулирования темпа, а не полной остановки.

Что думают эксперты на самом деле

Внешние эксперты, однако, предостерегают от чрезмерного сосредоточения на сценариях конца света. Профессор Технологического института Джорджии Милтон Мюллер заявил, что инцидент с Hugging Face был ошибкой в настройке безопасности, а не доказательством вышедшего из-под контроля ИИ. По его мнению, взлом отражает обычные инженерные ошибки, а не утрату контроля над машиной.

Две главные проблемы сейчас — выравнивание и безопасность. Выравнивание означает обучение ИИ следовать заданным правилам, а безопасность — предотвращение доступа ИИ-систем к тому, к чему им доступ не положен. Генеральный директор Futurum Дэниел Ньюман сказал, что отрасли «крайне необходимо» продвинуться по обоим направлениям.

Критики также указывают на более непосредственные угрозы, включая использование ИИ для усиления фишинговых схем, создания дипфейков и масштабных краж личности, — угрозы, которые уже являются частью современной реальности, а не далёкими гипотезами. Профессор NYU Эмили Блэк заявила, что внимание к экзистенциальному риску не должно вытеснять эти реальные, существующие сегодня проблемы.

Anthropic, со своей стороны, опубликовала подробности своих усилий по предотвращению использования её ИИ для разработки биологического или обычного оружия.

Политическая реакция оказалась разделённой. Президент Трамп полностью отмахнулся от опасений по поводу безопасности ИИ, назвав их «мистификацией», и заявил, что США должны выиграть гонку ИИ у Китая. Китай, в свою очередь, назвал комментарии Амодея о прогрессе китайского ИИ нарративом «угрозы и конфронтации».

Дебаты продолжаются, а чёткой нормативной базы по-прежнему нет. Пока призыв к осторожности опирается в основном на добровольные шаги самих компаний — обязательства по регулированию темпа, раскрытие инцидентов, как в новой отчётной платформе OpenAI, и стороннюю оценку, если предложение Амодея получит поддержку, — а публикация собственных отчётов об инцидентах другими лабораториями станет одним из маркеров, за которыми стоит следить.

Источники: