SynthID od Google DeepMind zaadaptowane do znakowania wodnego białek projektowanych przez AI w badaniu proof of concept Uniwersytetu Marylandu
Najważniejsze informacje
- •Naukowcy z Uniwersytetu Marylandu zaadaptowali technologię SynthID firmy Google DeepMind, aby osadzać niewidzialne znaki wodne oparte na kluczu prywatnym w sekwencjach białek generowanych przez modele projektowania AI, w tym ProteinMPNN.
- •Testy walidacyjne wykazały, że znakowanie wodne nie zmieniło wyników pLDDT jakości fałdowania, co oznacza, że oznaczone białka pozostały strukturalnie prawidłowe.
- •W przeciwieństwie do metod pochodzenia opartych na metadanych, statystyczny znak wodny jest osadzony w samej sekwencji i przetrwa kopiowanie, konwersje formatów plików oraz dystrybucję między systemami.
- •Technika mogłaby uzupełniać istniejący skryning biobezpieczeństwa prowadzony przez International Gene Synthesis Consortium, którego bazy znanych zagrożeń mogą nie obejmować naprawdę nowych sekwencji generowanych przez AI.
- •To wyłącznie proof of concept — nie istnieje żaden produkt komercyjny, a kwestia, czy metoda przeniesie się na inne modele projektowania białek i rzeczywiste procesy skryningu syntezy, pozostaje nierozstrzygnięta.

Technologia znakowania wodnego SynthID firmy Google DeepMind, pierwotnie opracowana do identyfikowania tekstu, obrazów, dźwięku i wideo generowanych przez AI, została rozszerzona na nową dziedzinę: biologię. Naukowcy z Uniwersytetu Marylandu zaadaptowali ten system, aby osadzać niewidzialne znaki wodne bezpośrednio w sekwencjach białek projektowanych przez AI, tworząc potencjalny mechanizm śledzenia dla biologii syntetycznej, który nie narusza struktury białek.
Znakowanie wodne na poziomie aminokwasów
Metoda opiera się na SynthID-Text, który działa poprzez subtelne dostosowywanie rozkładu prawdopodobieństwa tokenów podczas generowania — w tym przypadku aminokwasów, a nie słów. Wykorzystując podejście oparte na nieobciążonym próbkowaniu Gumbela, badacze osadzili znak wodny pochodzący od klucza prywatnego w rozkładzie prawdopodobieństwa aminokwasów modeli projektowania białek, w tym ProteinMPNN.
ProteinMPNN, wydany w 2022 roku, należy do bardziej znanych modeli AI do projektowania nowych sekwencji białek. Przyjmuje pożądaną trójwymiarową struktur białka i działa wstecz, generując sekwencje aminokwasów, które powinny przyjąć tę formę. Dziedzina, do której należy ten model, szybko trafiła do głównego nurtu: Nagroda Nobla w dziedzinie chemii za rok 2024 uhonorowała obliczeniowe projektowanie białek (David Baker) oraz predykcję struktur białek opartą na AI, którą współ dzielili Demis Hassabis i John Jumper z Google DeepMind za AlphaFold2. Warstwa znakowania wodnego nakłada się na ten proces, wpływając na to, które konkretne aminokwasy zostaną wybrane, bez zmiany ogólnych właściwości statystycznych wyniku.
Testy walidacyjne wykazały, że wyniki pLDDT — standardowa miara przewidywanej jakości fałdowania białek — pozostały bez zmian po naniesieniu znaku wodnego. Strukturalnie białka z znakiem wodnym wyglądały równie dobrze jak bez niego.
Argument za biobezpieczeństwem
W miarę jak narzędzia AI do projektowania białek stają się potężniejsze i bardziej dostępne, możliwość generowania nowych sekwencji biologicznych budzi uzasadnione obawy o bezpieczeństwo. Konwencjonalne metody ustalania pochodzenia, takie jak logi metadanych dołączone do plików, można usunąć równie łatwo jak dane EXIF ze zdjęcia — nie oferują trwałego łańcucha kontroli.
Osadzony statystyczny znak wodny działa inaczej. Znajduje się w samej sekwencji i przetrwa operacje kopiowania i wklejania, konwersje formatów plików oraz dystrybucję między systemami. Każdy, kto ma dostęp do odpowiedniego klucza prywatnego, może później wykryć znak wodny, co pozwala organizacjom określić, czy dana sekwencja białka została wygenerowana przez konkretny model AI.
Ta możliwość wpisuje się bezpośrednio w istniejącą infrastrukturę biobezpieczeństwa. International Gene Synthesis Consortium (IGSC) już prowadzi ramy skryningu zamówień na syntezę DNA pod kątem baz znanych niebezpiecznych sekwencji. Ponieważ skryning ten opiera się na porównywaniu zamówień z katalogami znanych zagrożeń, naprawdę nowa sekwencja wygenerowana przez AI może nie przypominać niczego w tych bazach referencyjnych — pozostawiając lukę w dokumentacji, którą mogłoby wypełnić pochodzenie osadzone w sekwencji. Oznaczone znakiem wodnym sekwenc białek mogłyby być śledzone poprzez te same kanały, dodając warstwę pochodzenia specyficzną dla AI do procesu skryningu.
Stan na dziś
Nie istnieje komercyjny produkt o nazwie „SynthID Bio” dostępny do zakupu lub wdrożenia; badania znajdują się wyraźnie na etapie proof of concept. Podstawowa technologia SynthID od Google DeepMind jest rzeczywista i aktywnie wdrożona do znakowania tekstu, obrazów, dźwięku i wideo generowanych przez AI. Zastosowanie białkowe rozszerza te zasady, ale jak dotąd zostało wykazane tylko w warunkach badawczych i nie zostało jeszcze skomercjalizowane. Czy metoda przeniesie się na inne modele projektowania białek i znajdzie zastosowanie w rzeczywistych procesach skryningu syntezy — to otwarte pytania dla tej dziedziny.
Badanie podkreśla również strukturalną przewagę statystycznego znakowania wodnego nad alternatywnymi podejściami. Ponieważ znak wodny jest osadzony w samym procesie generowania, a nie dodawany później, tworzy formę pochodzenia nierozerwalnie związaną z modelem AI. Tą metodą nie można oznaczyć sekwencji białka po fakcie — musi to nastąpić w momencie generowania, co oznacza, że naturalnie śledzi punkt pochodzenia, a nie jakiś kolejny etap przetwarzania.