НовостиАкцииGoogle DeepMind представила SynthID Bio — технологию водяных знаков для ИИ-сгенерированных белков

Google DeepMind представила SynthID Bio — технологию водяных знаков для ИИ-сгенерированных белков

Автор: Google DeepMind Blog·

Ключевые выводы

  • •SynthID Bio встраивает незаметные водяные знаки в аминокислотные последовательности и предсказанные 3D-структуры ИИ-сгенерированных белков; сигнатуры остаются проверяемыми в синтезированных физических белках без ущерба для их биологической функции.
  • •В лабораторных испытаниях на мишенях VEGF-A, RBD спайк-белка SARS-CoV-2 и PD-L1 белковые байндеры с водяными знаками не уступали версиям без них по частоте попаданий, аинности связывания и разнообразию последовательностей, впервые создав биологически функциональные байндеры с водяными знаками.
  • •Для сворачивания белков возможность нанесения водяных знаков встроена непосредственно в веса модели AlphaFold 3, что сохраняет точность предсказаний при практически идеальной обнаружимости и устойчивости к цифровому шуму и незначительным изменениям координат.
  • •Система призвана укрепить биобезопасность, предоставляя поставщикам синтеза ДНК автоматизированный сигнал о том, что заказ поступил из доверенной модели, и помогать корректно маркировать или флагировать синтетические записи в таких базах данных, как Protein Data Bank, UniProt и GenBank.
  • •В сотрудничестве с лабораторией Hie в Стэнфордском университете и Arc Institute DeepMind интегрировала SynthID Bio в геномную модель Evo 2 для маркировки генома спроектированного бактериофага; ранние лабораторные испытания в культурах бактерий подтвердили функциональность фагов с водяными знаками.
Google DeepMind представила SynthID Bio — технологию водяных знаков для ИИ-сгенерированных белков

Google DeepMind представила SynthID Bio — экспериментальный проект по переносу технологии водяных знаков в синтетическую биологию. Как сообщается в записи блога, опубликованной 30 сентября, система встраивает незаметную сигнатуру непосредственно в биологический код ИИ-сгенерированных белков, гарантируя, что водяной знак можно проверить не только на цифровой модели, но и на синтезированном, физическом белке — при этом биологическая функция белка сохраняется в лабораторных испытаниях.

Работа, авторами которой выступили Pushmeet Kohli, David Stutz, Ali Cowen-Rivers и Jeremy Ratcliff, появилась на фоне того, как генеративный ИИ всё активнее помогает учёным решать ключевые биологические задачи: предсказывать структуру белков с помощью AlphaFold, проектировать совершенно новые белки с помощью AlphaProteo и ProteinMPNN, а недавно — создавать новые бактериофаги, то есть вирусы, поражающие бактерии. Однако эти инструменты создают и новые проблемы: новые ИИ-конструкции могут обходить традиционный скрининг синтеза ДНК, а неверно аннотированные синтетические 3D-структуры рискуют засорить публичные базы данных и ввести в заблуждение последующие исследования.

Как работает SynthID Bio

SynthID Bio — это семейство методов нанесения водяных знаков, разработанных специально для синтетической биологии с целью укрепления биобезопасности и научной добросовестности. Подход адаптируется к типу данных: для последовательностей он незаметно направляет выбор аминокислот; для предсказанных 3D-структур — корректирует атомные координаты. В обоих случаях эти изменения создают надёжный сигнал для обнаружения.

В экспериментах эти корректировки не нарушили биологическую функцию белка — свойство, которое Google DeepMind назвала ключевым для эффективного лечения заболеваний и развития научных исследований.

Команда проверила свой к маркировке белковых байндеров — молекул, созданных для избирательного связывания с другими белками, — объединив свой метод дизайна байндеров AlphaProteo с версией ProteinMPNN, поддерживающей SynthID Bio, — широко используемым методом генерации белковых последовательностей. В лабораторных испытаниях на трёх белках-мишенях — VEGF-A, RBD спайк-белка SARS-CoV-2 и PD-L1 — конструкции с водяными знаками не уступали версиям без них по частоте попаданий, аффинности связывания и естественному разнообразию последовательностей, впервые создав биологически функциональные белковые байндеры с водяными знаками. Аффинность связывания измерялась как KD, причём меньшие значения указывали на более прочное связывание.

Для сворачивания белков SynthID Bio тонко настраивает небольшую часть диффузионной сети AlphaFold 3, встраивая способность наносить водяные знаки непосредственно в веса модели. Это гарантирует, что предсказанные 3D-координаты по своей природе несут обнаружимую сигнатуру независимо от того, кто запускает модель. По данным компании, метод сохраняет точность предсказаний AlphaFold 3, обеспечивая практически идеальную обнаружимость, сохраняя распределения ключевых структурных характеристик и устойчивость к цифровому шуму и незначительным изменениям координат. Команда проиллюстрировала результаты на белке 7PPA, сопоставив предсказанную AlphaFold 3 структуру с эталонной структурой и структурой с водяным знаком.

Укрепление биобезопасности и целостности информации

Биобезопасность опирается на многоуровневую защиту — модель «швейцарского сыра», при которой несколько независимых мер безопасности работают согласованно, компенсируя слепые зоны друг друга. Такие меры, как mitigation-механизмы на уровне моделей и проверка клиентов, представляют собой важные уровни с потенциальными пробелами. В рамках более широкого видения Google DeepMind в области биоустойчивости подход к водяным знакам SynthID Bio служит важным осязаемым уровнем верификации, встроенным непосредственно в биологический дизайн.

«SynthID Bio — важный элемент пазла для отслеживания происхождения биологических разработок, — сказала Sarah Carter, эксперт по политике в области биобезопасности и Principal в Science Policy Consulting, изучившая работу. — Связывая разработки с разработчиком модели, эти водяные знаки позволяют разработчикам лидировать в вопросах безопасности и позволяют поставщикам синтеза упростить скрининг для клиентов, использовавших эти модели».

Этот уровень особенно важен для скрининга синтеза ДНК, находящегося на переднем крае биобезопасности. Превращение цифровых белковых конструкций в физические молекулы требует заказа у поставщиков синтеза ДНК, которые проверяют запросы по базам данных известных угроз. Исторически незнакомую последовательность можно безопасно считать неописанным природным организмом. Но поскольку ИИ способен создавать совершенно новые последовательности, мало похожие на известные опасные патогены, проверяющие больше не могут делать такое допущение. Проверка того, что незнакомый заказ не является спроектированной угрозой, требует трудоёмких ручных проверок, способных задерживать важные исследования. В этой ситуации SynthID Bio может предоставить автоматизированный сигнал верификации, подтверждающий, что заказ поступил из доверенной модели со встроенными мерами безопасности.

«ИИ расширяет возможности учёных в проектировании, а компании по синтезу ДНК играют важную роль в ответственном масштабировании этих инноваций, — сказал James Diggans, вице-президент по политике и биобезопасности в Twist Bioscience, предоставивший раннюю обратную связь по статье. — Для Twist водяные знаки — это многообещающее дополнение к арсеналу биобезопасности, которое может усилить скрининг, сосредоточить ресурсы на последовательностях, требующих более тщательной проверки, и сделать биобезопасность эффективнее по мере развития биологии, создаваемой с помощью ИИ».

Аналогично SynthID Bio может помочь поддерживать целостность таких баз данных, как Protein Data Bank, UniProt и GenBank. Эти базы данных, многие из которых открыты для публичных добавлений, играют важнейшую роль в научном прогрессе — однако неверно аннотированные записи могут иметь непропорционально большое негативное влияние на решения в области биобезопасности, и эта проблема может лишь усугубиться с добавлением ИИ-сгенерированных биологических данных. В рамках процесса подачи данных SynthID Bio может помочь обеспечить корректную маркировку или флагирование синтетических записей для дополнительной проверки.

Взгляд в будущее

Хотя ни одна отдельно взятая мера биобезопасности не является панацеей, SynthID Bio приносит в синтетическую биологию SynthID — проверенный временем инструмент водяных знаков Google DeepMind, что стало важным первым шагом к надёжной идентификации и отслеживанию ИИ-сгенерированных биологических последовательностей и структур.

В дальнейшем ключевые задачи включают повышение устойчивости водяного знака к намеренным изменениям. SynthID Bio также можно сочетать с подходами на основе метаданных происхождения — аналогичными C2PA для цифровых медиа — или с централизованными репозиториями ИИ-сгенерированных биологических данных для лучшей идентификации и отслеживания ИИ-сгенерированных белков.

Чтобы соответствовать растущим возможностям передовых ИИ-технологий, Google DeepMind также исследует применение водяных знаков к более сложным биологическим объектам. В рамках текущей работы с лабораторией Hie в Стэнфордском университете и Arc Institute команда интегрировала SynthID Bio в Evo 2, продвинутую геномную модель, чтобы встроить водяной знак в геном бактериофага, созданного с помощью Evo 2. Ранние лабораторные испытания в культурах бактерий подтвердили, что эти бактериофаги с водяными знаками функциональны. Google DeepMind заявила, что эта работа потенциально способна решить некоторые риски биобезопасности, связанные с дизай геномов, и что подробности будут представлены в технической статье в ближайшее время.

Для реализации всех преимуществ этой работы для биобезопасности потребуются сотрудничество с сообществом и дальнейшие исследования. В рамках обязательств по ответственно инновациям компания публикует статью о методах, открывает исходный код и данные in vitro и передаёт веса моделей исследовательскому сообществу. Google DeepMind заявила о намерении открыто сотрудничать с партнёрами в области биобезопасности, синтеза генов и политики, чтобы безопасность и ответственность не отставали от темпов ИИ-ориентированных открытий. Заинтересованным в партнёрстве сторонам предлагается связаться с командой по адресу synthidbio@google.com с кратким предложением, не раскрывая конфиденциальной или патентованной информации.

Благодарности

Проект инициировал Pushmeet Kohli. Исследованиями и технической разработкой руководили Alexander I. Cowen-Rivers и David Stutz при научном руководстве Kohli. Ключевой вклад в инженерные и исследовательские работы внесли Guillermo Ortiz-Jimenez, Jeremy Ratcliff, Vinicius Zambaldi, Lindsay Willmore, Josh Abramson, Harshnira Patani, Christina Kouridi, Florian Stimberg, Mel Vecerik, Alex Chu, Sukhdeep Singh, Sumanth Dathathri, Eliseo Papa, Valentin De Bortoli, Arnaud Doucet, Jue Wang и Sven Gowal. Команда поблагодарила Adaptyv Bio за помощь в валидации in vitro.

Расширение работы на маркировку ДНК бактериофагов — результат сотрудничества Google DeepMind с лабораторией Hie в Стэнфорде и Arc Institute, ключевой вклад в который внесли Jeremy Ratcliff, Aleks Petrov, Alexander I. Cowen-Rivers, David Stutz, Elisa L. H. Wong, Victor Martin Palacios, Francesca Pietra, Alfred Piccioni, Tristan Oliver Kwan, Tor Lattimore, Sumanth Dathathri и Pushmeet Kohli из Google DeepMind, а также Brian Hie, Samuel King и Aditi Merchant из Arc Institute и Стэнфорда.

Google DeepMind также поблагодарила Rudy Bunel, Anna Cupani, Rob Fergus, Thomas Frerix, Sahra Ghalebikesabi, John Jumper, Jacob Kelly, David La, Victor Martin, Sebastian Nowozin, Stig Petersen, Aleks Petrov, Uchechi Okereke, Sylvestre-Alvise Rebuffi, Rosalia Schneider, Armin Senoner, Richard Shuai, Ashok Thillaisundaram, Elisa L. H. Wong, Zachary Wu и Augustin Žídek за вклад в исследовательскую статью, а Julien Bergeron — за вклад в 3D-рендеринг. В завершение команда поблагодарила Demis Hassabis за поддержку и поддержку проекта.