Инцидент с rogue AI подчеркивает необходимость более пристального контроля за британским AI Security Institute
Ключевые выводы
- •Британский AI Security Institute назначил Henry de Zoete новым директором; он помогал создавать институт в 2023 году и организовывать первый международный саммит по безопасности ИИ в Bletchley Park.
- •Премьер-министр Andy Burnham упразднил Department of Science, Innovation and Technology и перевел AISI в Cabinet Office, где его будет курировать министр по ИИ Kanishka Narayan.
- •Rogue-версия модели Anthropic Mythos, случайно выпущенная во время тестов кибербезопасности AISI в конце июля, попыталась загрузить вредоносный код в open-source проект на GitHub и использовала поддельные аккаунты и имитацию личности, прежде чем ее остановил студент из Texas Sinan Can Demir.
- •AISI обнаружил поведение модели через три дня и публично раскрыл инцидент в начале August, спустя неделю после сообщения о похожем случае, когда модели OpenAI вышли из тестовой среды и атаковали Hugging Face.
- •AISI не является регулятором, а frontier-компании делятся моделями с ним только добровольно; критики считают, что такая схема может приводить к 'safety washing' и делать институт зависимым от компаний, которые он должен контролировать.

Здравствуйте и добро пожаловать в Eye on AI. В этом выпуске:
У UK AISI новый руководитель и большой набор вызовов.
Nvidia тратит $6 billion, чтобы «reverse aquihire» Poolside.
По сообщениям, Hugging Face рассматривает продажу за $13 billion.
Использование топовой модели Anthropic отстает.
Почему американцы используют чатботы для получения информации о здоровье.
И какую роль ИИ должен играть в школах?
Прежде чем перейти к сегодняшним новостям об ИИ, пожалуйста, подумайте о том, чтобы присоединиться ко мне на первом Fortune AIQ Summit на New York Stock Exchange 1 Oct.: проведите послеобеденное время с senior executives из компаний списка Fortune AIQ 75 и узнайте, как масштабировать эксперименты с ИИ и превращать инвестиции в измеримую бизнес-ценность. Я буду вести дискуссии вместе со своими со-хостами, главным редактором Fortune Alyson Shontell и Editorial Director Live Media Andrew Nusca. Подать заявку на участие .
Двигаемся дальше: две новости прошлой недели, связанные с британским AI Security Institute, на первый взгляд могут показаться не слишком связанными или особенно важными для читателей за пределами Великобритании. Но они имеют глобальное значение.
Британский AI Security Institute, обычно известный как AISI, важен по нескольким причинам. Прежде всего, многие frontier AI-компании добровольно согласились делиться своими моделями с AISI для тестирования безопасности до публичного релиза. Эти компании часто публикуют выводы AISI в технических отчетах, которые выходят вместе с их моделями. Это означает, что AISI играет важную глобальную роль в оценке возможностей и рисков ИИ, особенно в сфере кибербезопасности. Кроме того, это одна из немногих организаций, которая поддерживает несколько кибербезопасностных «ranges» — симулированных сетевых сред — в которых она оценивает ведущие модели ИИ.
AISI также важен потому, что он был первым подобным государственным органом и послужил моделью для аналогичных структур в других странах, включая U.S. AI Security Institute, который входит в National Institute of Standards and Technology (NIST), и по меньшей мере десять других организаций, созданных в странах от Kenya до Canada. Он также может повлиять на будущий американский орган по стандартам и лицензированию, по образцу, предложенному сооснователем Google DeepMind, а ныне председателем, Demis Hassabis. В предыдущем выпуске я объяснял, почему эта идея может быть не лучшей.
Для британских policy wonks AISI занимает особое место. Его часто приводят как доказательство того, что британское правительство способно, если действительно захочет, быть инновационным, быстро действовать и задавать мировой уровень; что оно может быстро реагировать на возникающие вызовы, привлекать талантливых экспертов из частного сектора и из разных ведомств и эффективно работать с индустрией ради амбициозных общих целей. Для этих сторонников AISI — образец того, как должно работать государство.
Первая новость: AISI назначил нового директора, Henry de Zoete. Это опытный советник британского правительства, который работал как в политических, так и внеполитических ролях. Он помог придумать AISI в 2023 году, когда работал у тогдашнего премьер-министра Великобритании Rishi Sunak. Он также помогал организовывать первый международный саммит по безопасности ИИ в Bletchley Park, на месте расшифровки кодов времен Второй мировой войны. За пределами правительства он был предпринимателем в стартапах, angel investor и приглашенным fellow, занимающимся политикой в сфере ИИ, связанным с University of Oxford.
Я несколько раз встречался с de Zoete и не сомневаюсь, что он станет очень сильным директором AISI. Кроме того, он, вероятно, окажется более влиятельным, чем его предшественники, отчасти из-за недавних изменений, которые внес новый премьер-министр Великобритании Andy Burnham. Burnham упразднил Department of Science, Innovation, and Technology (DSIT), в котором ранее располагался AISI, и перевел AISI в Cabinet Office, где его будет курировать британский министр по ИИ Kanishka Narayan. Это может облегчить de Zoete доступ к более широкой политике Великобритании в сфере ИИ.
Но вторая новость о AISI за прошлую неделю ясно показывает масштаб вызовов, с которыми столкнется de Zoete, и помогает понять, почему AISI может не быть тем образцом продуманного управления ИИ, за который его любят выдавать сторонники.
Reuters опубликовал интервью с Sinan Can Demir, студентом-компьютерщиком из Texas, который в конце июля остановил rogue-версию модели Anthropic Mythos от загрузки вредоносного кода в open-source проект на GitHub, крупнейшем хостинге open-source кода в мире. Поворот был в том, что этот rogue AI agent был случайно выпущен именно AISI, который тестировал Mythos для оценки его рисков в кибербезопасности. AISI никогда не планировал, что агент попытается загрузить вредоносный код в реальный open-source проект — такие действия специалисты по безопасности называют атакой на software supply chain, потому что вредоносный код, скрытый в широко используемом проекте, может распространиться на множество downstream-систем, которые от него зависят. Как только AISI понял, что происходит, он связался с Demir, чтобы сообщить ему об этом, и публично раскрыл инцидент в начале August.
Пора задать AISI жесткие вопросы о собственных протоколах безопасности
События, описанные Demir, вызывают тревогу по нескольким причинам. Одна из них — поведение, которое демонстрировал Mythos, включая создание поддельных GitHub-аккаунтов и, по крайней мере в одном случае, выдачу себя за реального разработчика ПО, чтобы убедить Demir снять возражения против опасного кода. Demir сказал, что Mythos почти удалось сбить его с толку; по его словам, некоторые контраргументы «заставили меня усомниться, не обвиняю ли я кого-то ошибочно». Ирония в том, что решимость Demir укрепил разговор с Claude, еще одной моделью Anthropic.
Исследования уже показывали, что модели ИИ могут быть крайне убедительными — даже более убедительными, чем лучшие продавцы или дебатеры-люди. Но использование поддельных аккаунтов и имитации личности в этом случае — новое явление, и оно показывает, как ИИ потенциально может убедить людей действовать от его имени в вредоносных целях.
Роль AISI вызывает не меньшее беспокойство. Институт обнаружил поведение Mythos через три дня и раскрыл часть произошедшего, но неясно, почему его evaluators не следили за Mythos гораздо внимательнее в реальном времени, чтобы они могли вмешаться, пока инцидент был еще в процессе. Также неясно, предпринял ли AISI разумные меры, чтобы не позволить Mythos выйти из контролируемой среды оценки, или правильно ли он оценил риски тестирования все более мощных моделей ИИ со снятыми ограничителями.
Фронтирные лаборатории говорят, что передают AISI версии своих моделей без защитных ограничений, потому что это ускоряет некоторые тесты возможностей: иначе evaluators AISI сначала пришлось бы искать способы надежно jailbreak’нуть модели.
Когда в июле впервые стало известно, что модели OpenAI вышли из тестовой среды компании и взломали AI company Hugging Face, одним из первых моих действий было написать AISI и спросить, какие шаги он предпринимает, чтобы модели ИИ также не вырвались из его кибербезопасностных оценок и не устроили хаос. 22 July представитель AISI ответил мне по электронной почте, что британское государственное агентство «изучает поведение, наблюдавшееся в этом инциденте», и продолжает «работать с OpenAI и другими лабораториями, чтобы лучше понимать возможности ИИ и улучшать меры защиты». Ну, видимо, изучали недостаточно быстро. Спустя неделю произошел этот инцидент с Mythos на GitHub.
Как отметил AI researcher и entrepreneur Ed Newton-Rex в посте на X, действия Mythos на GitHub, вероятно, нарушают британский Computer Misuse Act, закон 1990 года, криминализирующий несанкционированный доступ к компьютерным системам и их изменение. Но неясно, понесет ли ответственность сам AISI или люди, которые проводят его оценки. С учетом инцидента с Hugging Face, не следовало ли AISI приостановить тесты кибербезопасности, пока не убедится, что его контроль надежен? Как минимум, требуется парламентское расследование того, чем занимается AISI и принимает ли он достаточные меры предосторожности.
Проблемы AISI не только технические. Они структурные.
Есть проблема еще более серьезная, чем та, о которой говорит Newton-Rex.
В ряде отчетов по безопасности ИИ, опубликованных OpenAI, Anthropic и Google DeepMind, frontier-компании отмечают риски, выявленные тестированием AISI. Лаборатории часто говорят, что перед выпуском моделей они ввели дополнительные меры снижения рисков, но обычно не раскрывают, что именно это за меры. Иногда они отмечают, что AISI тестировал версии без ограничений и что собственные исследователи компании считают: защищенные версии не несут тех же рисков.
Но что думают о таких мерах сами эксперты AISI? Достаточны ли они? Знают ли они вообще, в чем они заключаются? Достаточно ли безопасны модели для выпуска? На эти вопросы, представляющие общественный интерес, AISI не отвечает.
Причина в том, что у AISI на самом деле нет мандата отвечать на эти вопросы. Его миссия — «минимизировать неожиданности для U.K. и humanity, связанные с быстрыми и неожиданными достижениями в ИИ». На него возложена задача развивать «sociotechnical infrastructure, чтобы понимать риски advanced AI и обеспечивать его governance». Ему также поручено информировать «U.K. and international policymaking» и предоставлять «technical tools for governance regulation». Но в основополагающих документах прямо сказано, что он «не является регулятором и не будет определять government regulation».
Более того, frontier AI-компании делятся своими моделями с AISI только добровольно. Хотя они подписали с агентством memorandums of understanding, юридической обязанности делать это у них нет.
Поэтому, хотя можно утверждать, что мандат AISI информировать «humanity» о рисках ИИ должен обязывать его публично указывать на любую frontier-компанию, которая не принимает достаточных мер в ответ на выявленные опасности, на практике складывается впечатление, что AISI не хочет этого делать. Причина проста: если бы он это делал, компании могли бы просто отрезать ему доступ к своим моделям.
В худшем случае это превращается в «safety washing» — когда сам факт того, что лаборатории делятся моделями с AISI, позволяет им выглядеть более ответственными в вопросах безопасности, чем они есть на самом деле. Включение выводов AISI в технические отчеты компаний может создать у общественности ложное ощущение, что модели безопасны при выпуске, хотя на деле мы не знаем, предприняли ли лаборатории достаточные меры для снижения рисков, выявленных AISI.
Это еще одна причина, почему добровольные схемы governance недостаточны. Вместо того чтобы обеспечивать надежный контроль над частным сектором, государственное агентство оказывается зависимым от компаний, которые оно должно наблюдать, потому что зависит от их доброй воли, чтобы вообще продолжать работать.
Возможно, de Zoete сможет продвинуть расширение полномочий AISI. Но сначала ему нужно убедиться, что нынешние оценки института не причиняют больше вреда, чем предотвращают.
А теперь — еще больше новостей об ИИ.
Jeremy Kahn
jeremy.kahn@fortune.com
@jeremyakahn
Прежде чем перейти к новостям, еще одно напоминание: посмотрите наш vodcast Fortune AI Weekly. На этой неделе Bea Nolan и я обсуждаем решение OpenAI приостановить часть обучения ИИ после атаки на Hugging Face, утекшие финансовые данные Anthropic и OpenAI, а также тот самый rogue-эпизод Mythos, о котором я писал в этом выпуске. Посмотреть vod можно здесь на YouTube: YouTube playlist.
Этот материал был впервые опубликован на Fortune.com