НовостиМакроOpenAI позволит сторонним организациям проверять ИИ-модели на безопасность в ходе разработки

OpenAI позволит сторонним организациям проверять ИИ-модели на безопасность в ходе разработки

Автор: CryptoBriefing·

Ключевые выводы

  • •22 сентября OpenAI объявила, что независимые оценщики будут проверять её ИИ-модели на более ранних этапах разработки, смещая контроль безопасности с предзапускового этапа на более ранние стадии.
  • •Расширенная программа охватывает четыре направления: случаи безопасности, устойчивость защитных механизмов к состязательным угрозам, оценку катастрофических рисков в рамках Preparedness Framework и инциденты рассогласования.
  • •Поскольку случаи безопасности и Preparedness Framework создаются внутри компании, их открытие внешним рецензентам добавляет внешний контроль над собственными предзапусковыми оценками рисков OpenAI.
  • •OpenAI опубликовала семь руководящих принципов, охватывающих научную строгость, независимость оценщиков, протоколы безопасности и ответственные методы публикации результатов.
  • •Официальные партнеры не объявлены: ведутся переговоры с METR и Redwood Research, а условия доступа еще согласуются после обязательства Сэма Альтмана от 12 сентября.
OpenAI позволит сторонним организациям проверять ИИ-модели на безопасность в ходе разработки

OpenAI позволит независимым группам изучать свои ИИ-модели на более ранних этапах разработки, объявила компания 22 сентября. Это изменение призвано выявлять проблемы безопасности до развертывания, а не после того, как модели в основном завершены.

В рамках расширенной программы оценки независимые рецензенты сосредоточатся на четырех приоритетных направлениях. Во-первых, они проанализируют «случаи безопасности» (safety cases) OpenAI — собственные аргументы компании о том, почему конкретная модель безопасна для развертывания. Во-вторых, оценщики проверят устойчивость ключевых защитных механизмов к состязательным угрозам. В-третьих, оценки будут напрямую связаны с Preparedness Framework — внутренней системой, которую OpenAI использует для оценки катастрофических рисков перед запуском. В-четвертых, оценщики будут расследовать инциденты рассогласования — категория, актуальность которой возросла после инцидента с участием Hugging Face, показавшего, как быстро подобные сбои могут обостряться.

Поскольку случаи безопасности и Preparedness Framework создаются внутри компании, их открытие для внешних рецензентов добавляет внешний контроль над тем, как сама OpenAI оценивает риски перед запуском.

OpenAI также опубликовала семь руководящих принципов, определяющих порядок проведения этих оценок. Принципы подчеркивают научную строгость, независимость оценщиков, протоколы безопасности и ответственные методы публикации результатов. Компания вела переговоры с организациями, включая METR и Redwood Research, которые ранее уже сотрудничали с OpenAI по вопросам безопасности. Новые партнеры официально не объявлены, а конкретные условия доступа остаются предметом переговоров; от того, как они будут согласованы, зависит, какой доступ фактически получат оценщики.

Эта инициатива развивает обязательство, взятое генеральным директором Сэмом Альтманом 12 сентября, когда он указ, что оценщики будут глубже интегрированы в операционную структуру OpenAI.

Как менялся подход OpenAI к безопасности

Протоколы безопасности OpenAI значительно расширились со времен GPT-4, когда компания впервые начала приглашать внешних редтимеров для проверки моделей перед выпуском. Те ранние усилия имели более узкий охват и, как правило, были сосредоточены на финальных этапах перед запуском. Новая структура существенно смещает это взаимодействие на более ранние этапы разработки, давая оценщикам возможность выявлять риски, пока еще есть время на их устранение.

Кадровые и конкурентные соображения

Сообщество исследователей безопасности ИИ относительно невелико, а такие организации, как METR и Redwood Research, входят в число наиболее авторитетных голосов в этой области. Углубляя отношения с этими группами, OpenAI получает как практическую экспертизу, так и репутационный капитал. Для самих оценщиков это соглашение предлагает не менее ценный доступ к передовым системам, которые в противном случае остались бы закрытыми.

Доверие к программе будет частично зависеть от того, что произойдет, когда независимая оценка выявит выводы, противоречащие коммерческим интересам OpenAI. Семь принципов прямо требуют ответственных методов публикации, но напряженность между прозрачностью и конкурентным преимуществом сохраняется. Если OpenAI убедительно разрешит это противоречие, программа может стать шаблоном для отраслевых стандартов безопасности. Ближайшие индикаторы, за которыми стоит следить, вполне конкретны: какие организации будут официально названы партнерами, какие условия доступа в итоге будут согласованы и как будут раскрываться первые результаты.