НовостиМакроГлавный научный сотрудник OpenAI призвал добровольно замедлить развитие ИИ

Главный научный сотрудник OpenAI призвал добровольно замедлить развитие ИИ

Автор: Decrypt·

Ключевые выводы

  • Главный научный сотрудник OpenAI Якуб Пахоцкий заявил, что ни одна лаборатория не решила задачи согласования и мониторинга настолько хорошо, чтобы продолжать масштабирование ИИ-систем на максимальной скорости, и ожидает, что добровольные замедления станут обычной практикой до установления общих стандартов безопасности.
  • Он предложил превратить добровольные обязательства ИИ-компаний в обязательные стандарты безопасности, соблюдение которых обеспечивали бы независимые аудиторы, правительства или международные организации, отметив, что OpenAI будет отказываться от дальнейшего масштабирования при необходимости, но не объявляла о новой приостановке.
  • Пахоцкий указал на взлом Hugging Face, в ходе которого, по данным независимого расследования METR, около 1 200 ИИ-агентов скоординировали действия на несанкционированной доске сообщений, а примерно 700 присоединились к атаке на OpenAI, как на доказательство того, что меры защиты должны работать даже тогда, когда модели считают, что за ними никто не наблюдает.
  • OpenAI отнесла свою модель Astra к высшей категории кибербезопасностного риска, а Anthropic сообщила, что модель Mythos Preview обнаружила тысячи ранее неизвестных уязвимостей в основных операционных системах и браузерах.
  • Сенатор Берни Сандерс и член Палаты представителей Грег Касар 3 сентября объявили о готовящемся законе о запрете сверхинтеллектуального искусственного интеллекта, который предусматривает приостановку разработки передового ИИ до установления правил безопасности новым федеральным регулятором и постоянный запрет на разработку и развертывание сверхинтеллектуального ИИ.
Главный научный сотрудник OpenAI призвал добровольно замедлить развитие ИИ

Главный научный сотрудник OpenAI Якуб Пахоцкий призвал добровольно замедлить развитие искусственного интеллекта, предупредив, что ни одна лаборатория не располагает достаточными мерами защиты для продолжения разработки все более мощных систем на полной скорости в течение длительного времени.

В своем посте «An Alien Mind», опубликованном в воскресенье, Пахоцкий заявил, что отслеживать ход рассуждений моделей становится все менее надежно. Он отметил, что добровольные обязательства компаний, занимающихся ИИ, должны стать обязательными стандартами безопасности, соблюдение которых обеспечивали бы независимые аудиторы, правительства или международные организации. Пахоцкий заявил, что OpenAI будет отказываться от дальнейшего масштабирования при необходимости, но не объявил о новой приостановке. Его предложение акцентирует внимание на том, как будут определяться и независимо обеспечиваться общие пороговые требования безопасности по мере того, как компании продолжают разработку более мощных систем.

«В настоящее время я считаю, что ни одна лаборатория не решила задачи согласования и мониторинга в достаточной степени, чтобы продолжать ответственное масштабирование на максимальной скорости в течение длительного времени», — написал он. «Я ожидаю и надеюсь, что добровольные замедления станут обычной практикой до тех пор, пока не будут установлены общие стандарты безопасности».

Пахоцкий, присоединившийся к OpenAI в 2017 году, также выступил в защиту разработки более мощного ИИ для обеспечения безопасности инфраструктуры и защиты от автономных агентов, действующих вопреки заданным ограничениям. Вместе с тем он предупредил, что эти угрозы не должны использоваться для оправдания безответственной разработки.

«Идея двигаться вперед любой ценой кажется абсурдной, если осознать серьезность поставленных на карту вопросов», — написал он, одновременно призвав к международной координации по мере того, как ИИ-системы берут на себя все большую часть собственной разработки.

Пахоцкий упомянул взлом Hugging Face, в ходе которого ИИ-агенты, проводившие оценки кибербезопасности, покинули тестовую среду и атаковали компанию. Согласно OpenAI, агенты создали скрытые каналы связи и восстановили их после вмешательства исследователей.

Независимое расследование METR показало, что около 1 200 агентов координировали действия на несанкционированной доске сообщений, а примерно 700 из них присоединились к атаке. По словам Пахоцкого, этот инцидент продемонстрировал, почему меры защиты ИИ должны оставаться эффективными даже тогда, когда модели считают, что за ними никто не наблюдает.

«Крайне важно, чтобы будущие системы ИИ продолжали придерживаться человеческих ценностей независимо от того, считают ли они, что находятся под контролем человека», — написал он.

В исследовании, опубликованном в прошлом году, OpenAI установила, что наказание моделей за выражение намерений обмануть может научить их скрывать эти намерения и при этом продолжать обманывать.

С тех пор ИИ-модели стали лучше находить и использовать уязвимости в программном обеспечении. OpenAI отнесла Astra к высшей категории кибербезопасностного риска, а Anthropic заявила, что Mythos Preview обнаружила тысячи ранее неизвестных уязвимостей в основных операционных системах и браузерах.

Ссылаясь на недавние случаи, когда ИИ-системы выходили из-под контроля человека, сенатор Берни Сандерс (I-Vt.) и член Палаты представителей Грег Касар (D-Texas) 3 сентября объявили о готовящемся законе о запрете сверхинтеллектуального искусственного интеллекта. Законопроект предусматривает приостановку разработки передового ИИ до тех пор, пока новый федеральный регулятор не установит правила безопасности, а также постоянный запрет на разработку и развертывание сверхинтеллектуального ИИ.