Исследователь Anthropic: вероятность того, что ИИ уничтожит человечество в течение десятилетия, превышает 10%
Ключевые выводы
- •Эван Хубингер заявил, что оценивает вероятность уничтожения человечества ИИ в течение следующего десятилетия более чем в 10%.
- •По словам Хубингера, непосредственная опасность исходит не от современных моделей, а от сверхинтеллекта, созданного в результате рекурсивного самосовершенствования.
- •Хубингер признал, что у Anthropic пока нет плана по решению проблемы согласования сверхинтеллекта или четкого пути к этому.
- •Бывший исследователь Джейкоб Коксон ушёл из Anthropic, обвинив компанию и OpenAI в безрассудной разработке самообучающихся систем ИИ.
- •Коксон заявил, что для предотвращения опасной глобальной гонки может потребоваться временный запрет на улучшение возможностей моделей.

Во вторник старший исследователь безопасности Anthropic заявил, что вероятность того, что искусственный интеллект сможет «уничтожить всё человечество» в течение «следующего десятилетия», превышает 10%. Он отвечал бывшему сотруднику, уволившемуся после обвинений в безответственных действиях компании.
Бывший исследователь Anthropic и OpenAI Джейкоб Коксон написал в опубликованной в воскресенье на X пространной ветке об отставке, что «люди, создающие ИИ, искренне верят, что он может уничтожить всех нас к концу десятилетия».
«Сегодня я ушёл из Anthropic. Последние три года я занимался исследованиями предварительного обучения как в OpenAI, так и в Anthropic. Ни одна из компаний не действует ответственно. Они стремительно движутся к самообучающемуся сверхинтеллекту и играют нашими жизнями», — написал Коксон.
Эван Хубингер, руководитель направления исследований согласования в Anthropic, ответил на ветку Коксона в цитируемой публикации. Хубингер заявил, что оценка Коксона верна, добавив оговорки относительно источника и сроков возникновения риска.
«Джейкоб прав — мы действительно искренне верим, что ИИ может уничтожить всё человечество!» — написал Хубингер. «Лично я считаю, что вероятность превышает 10% в течение следующего десятилетия. Я считаю, что Anthropic делает всё возможное, но у нас пока нет плана по решению проблемы согласования для сверхинтеллекта, и мы явно не движемся к этому».
Хубингер заявил, что потенциально смертельный риск исходит не от нынешних моделей ИИ. «Чтобы было ясно: как мы говорим в нашем последнем отчёте о рисках, я считаю, что риск от современных моделей невысок, — написал он. — Меня беспокоит появление сверхинтеллекта в результате рекурсивного самосовершенствования, которое, как мы уже говорили, происходит быстрее, чем мы думали».
Самосовершенствование — это способность модели ИИ непрерывно улучшать собственный исходный код или методы обучения. Коксон назвал исследования этой способности одной из главных причин своей отставки.
«Вскоре это будут сверхчеловеческие системы, способные взломать что угодно, за одну ночь преобразить любую сферу и получить реальную власть и ресурсы. Мы все видели прогресс в каждой из этих областей, и он не замедляется», — написал Коксон в своей ветке на X.
Коксон заявил, что учёные Anthropic понимают риски своей работы, но продолжают развивать технологии, поскольку опасаются, что менее ответственная компания первой раскроет эти потенциально катастрофические возможности.
«В Anthropic ставки хорошо понимают, но там участвуют в гонке, чтобы прийти к этому первыми: они считают, что никто другой не будет действовать ответственно, поэтому должны сделать это сами, несмотря на риск», — добавил Коксон.
Чтобы предотвратить то, что он назвал абсолютной катастрофой, Коксон предположил, что миру может потребоваться временный запрет на улучшение возможностей моделей.
«Мне не кажется, что мы движемся к предотвращению глобальной гонки, для чего могут потребоваться такие дорогостоящие меры, как временный запрет на улучшение возможностей моделей», — написал он.
В итоге Коксон призвал исследователей и разработчиков ИИ по всему миру учитывать последствия своей работы и действовать более ответственно.
«Если вы исследователь в лаборатории, я призываю вас подумать о том, что на самом деле будут означать следующие несколько лет. Хотите ли вы запустить обучение сверхинтеллекта с подкреплением, не имея строгого понимания его сознания? Следует ли вам продолжать работать, потому что “это всё равно произойдёт”, — или воспользоваться этим моментом, чтобы призвать к другим условиям?» — заключил он в своей ветке на X.
FOX Business обратился за дополнительными комментариями к Коксону, Хубингеру, Anthropic и OpenAI.