SynthID от Google DeepMind адаптирован для маркировки водяными знаками ИИ-разработанных белков в рамках концепции Мэрилендского университета
Ключевые выводы
- •Исследователи Мэрилендского университета адаптировали технологию SynthID от Google DeepMind для встраивания невидимых водяных знаков на основе закрытого ключа в последовательности белков, созданные моделями ИИ-дизайна, включая ProteinMPNN.
- •Валидационные тесты показали, что маркировка не изменила показатели качества фолдинга pLDDT — помеченные белки остались структурно надежными.
- •В отличие от методов подтверждения происхождения на основе метаданных, статистический водяной знак встроен в саму последовательность и переживает копирование-вставку, конвертацию форматов и распространение между системами.
- •Технология может дополнить существующий скрининг биобезопасности Международного консорциума синтеза генов, базы данных известных угроз которого могут не содержать действительно новых последовательностей, созданных ИИ.
- •Работа является лишь доказательством концепции — коммерческого продукта не существует, а переносимость метода на другие модели дизайна белков и реальные процессы проверки синтеза остается нерешенным вопросом.

Технология водяных знаков SynthID от Google DeepMind, изначально созданная для идентификации сгенерированных ИИ текстов, изображений, аудио и видео, распространилась на новую область: биологию. Исследователи Мэрилендского университета адаптировали систему для встраивания невидимых водяных знаков непосредственно в синтезированные ИИ последовательности белков, создав потенциальный механизм отслеживания для синтетической биологии, который не повреждает сами белки.
Маркировка на уровне аминокислот
Метод основан на SynthID-Text, который работает за счет незаметного изменения распределения вероятностей токенов в процессе генерации — в данном случае аминокислот, а не слов. Используя несмещенный подход выборки Гумбеля, исследователи встроили водяной знак, производный от закрытого ключа, в распределение вероятностей аминокислот моделей дизайна белков, включая ProteinMPNN.
ProteinMPNN, представленный в 2022 году, — одна из наиболее известных моделей ИИ для создания новых последовательностей белков. Она принимает желаемую трехмерную структуру белка и работает в обратном направлении, генерируя аминокислотные последовательности, которые, как ожидается, сложатся в эту форму. Область, к которой она относится, быстро вышла в мейнстрим: Нобелевская премия по химии 2024 года отметила вычислительный дизайн белков (награда присуждена Дэвиду Бейкеру), а также предсказание структуры белков с помощью ИИ, разделившееся между Демисом Хассабисом и Джоном Джампером из Google DeepMind за AlphaFold2. Слой водяных знаков встраивается в этот процесс, влияя на выбор конкретных аминокислот, не меняя общие статистические свойства результата.
Валидационные тесты показали, что значения pLDDT — стандартного показателя предсказанного качества фолдинга белков — не изменились после нанесения водяных знаков. Структурно белки с водяными знаками выглядели так же надежно, как и без них.
Аргумент в пользу биобезопасности
По мере того как инструменты ИИ-дизайна белков становятся мощнее и доступнее, возможность генерации новых биологических последовательностей вызывает обоснованные опасения по безопасности. Традиционные методы подтверждения происхождения, такие как логи метаданных,репленные к файлам, можно удалить так же легко, как данные EXIF из фотографии, — они не обеспечивают надежной цепочки custody.
Встроенный статистический водяной знак работает иначе. Он находится внутри самой последовательности и переживает операции копирования-вставки, конвертацию форматов файлов и распространение между системами. Любой, у кого есть доступ к соответствующему закрытому ключу, впоследствии может обнаружить водяной знак, что позволяет организациям определить, была ли конкретная последовательность белка создана определенной моделью ИИ.
Эта возможность напрямую интегрируется с существующей инфраструктурой биобезопасности. Международный консорциум синтеза генов (IGSC) уже поддерживает системы проверки заказов на синтез ДНК по базам данных известных опасных последовательностей. Поскольку такая проверка опирается на сопоставление заказов с каталогами известных угроз, действительно новая последовательность, созданная ИИ, может не иметь аналогов в этих референсных базах — оставляя документационный пробел, который подтверждение происхождения, встроенное в последовательность, могло бы помочь заполнить. Помеченные водяными знаками последовательности белков можно отслеживать через эти же каналы, добавляя слой проверки происхождения, специфичной для ИИ, в процесс скрининга.
Текущее положение дел
Коммерческого продукта под названием «SynthID Bio» для покупки или развертывания не существует; исследование остается строго в рамках доказательства концепции. Базовая технология SynthID от Google DeepMind реальна и активно используется для маркировки сгенерированных ИИ текстов, изображений, аудио и видео. Применение к белкам расширяет эти принципы, но пока продемонстрировано только в исследовательских условиях и еще не превращено в продукт. Вопросы о том, переносится ли метод на другие модели дизайна белков и найдет ли он применение в реальных процессах проверки синтеза, остаются открытыми для этой области.
Исследование также подчеркивает структурное преимущество статистических водяных знаков перед альтернативными подходами. Поскольку водяной знак встраивается в сам процесс генерации, а не добавляется постфактум, он создает форму подтверждения происхождения, неразрывно связанную с моделью ИИ. Последовательность белка невозможно пометить этим методом после факта — это должно происходить в момент генерации, а значит, метод естественно отслеживает точку происхождения, а не какой-либо последующий этап обработки.