AktualnościAkcjeGoogle DeepMind zaprezentował SynthID Bio – znaki wodne dla białek generowanych przez AI

Google DeepMind zaprezentował SynthID Bio – znaki wodne dla białek generowanych przez AI

Autor: Google DeepMind Blog·

Najważniejsze informacje

  • •SynthID Bio osadza niewidoczne znaki wodne w sekwencjach aminokwasowych i przewidywanych strukturach 3D białek generowanych przez AI, a podpisy pozostają weryfikowalne w zsyntetyzowanych, fizycznych białkach bez naruszania ich funkcji biologicznej.
  • •W testach laboratoryjnych z użyciem VEGF-A, RBD białka kolca SARS-CoV-2 i PD-L1 znakowane bindery białkowe dorównały wersjom bez znaku wodnego pod względem skuteczności trafień, powinowactwa wiązania i różnorodności sekwencji, tworząc pierwsze biologicznie funkcjonalne znakowane bindery.
  • •W przypadku zwijania białek zdolność znakowania jest wbudowana bezpośrednio w wagi modelu AlphaFold 3, zachowując dokładność predykcji przy niemal ideal wykrywalności i odporności na szum cyfrowy lub drobne zmiany współrzędnych.
  • •System ma wzmacniać bezpieczeństwo biologiczne, dostarczając dostawcom syntezy DNA automatyczny sygnał potwierdzający pochodzenie zamówienia z zaufanego modelu, oraz pomagać prawidłowo opisywać lub oznaczać wpisy syntetyczne w bazach danych takich jak Protein Data Bank, UniProt i GenBank.
  • •We współpracy z laboratorium Hie na Stanford University i Arc Institute DeepMind zintegrował SynthID Bio z modelem genomowym Evo 2, aby oznaczyć zaprojektowany genom bakteriofaga, a wczesne testy laboratoryjne w hodowlach bakterii potwierdziły, że znakowane fagi są funkcjonalne.
Google DeepMind zaprezentował SynthID Bio – znaki wodne dla białek generowanych przez AI

Google DeepMind zaprezentował SynthID Bio – projekt koncepcyjny mający przenieść technologię znaków wodnych do biologii syntetycznej. Zapowiedziano go w poście na blogu opublikowanym 30 września. System osadza niewidoczny podpis bezpośrednio w kodzie biologicznym białek generowanych przez AI, zapewniając, że znak wodny jest weryfikowalny nie tylko w modelu cyfrowym, ale także w zsyntetyzowanym, fizycznym białku – przy zachowaniu jego funkcji biologicznej w testach laboratoryjnych.

Praca, której autorami są Pushmeet Kohli, David Stutz, Ali Cowen-Rivers i Jeremy Ratcliff, pojawia się w momencie, gdy generatywna AI coraz mocniej pomaga naukowcom rozwiązywać kluczowe wyzwania biologiczne: przewidywanie struktury białek za pomocą AlphaFold, projektowanie zupełnie nowych białek za pomocą AlphaProteo i ProteinMPNN, a ostatnio także tworzenie nowych bakteriofagów – wirusów infekujących bakterie. Narzędzia te stawiają jednak nowe wyzwania. Nowe projekty AI mogą omijać tradycyjny screening syntezy DNA, a błędnie opisane syntetyczne struktury 3D grożą zanieczyszczeniem publicznych baz danych i wprowadzaniem dalszych badań włąd.

Jak działa SynthID Bio

SynthID Bio to rodzina metod znakowania wodnego opracowanych specjalnie dla biologii syntetycznej w celu wzmocnienia bezpieczeństwa biologicznego i integralności nauki. Podejście dostosowuje się do rodzaju danych: w przypadku sekwencji subtelnie kieruje doborem aminokwasów, a w przypadku przewidywanych struktur 3D koryguje współrzędne atomów. W obu przypadkach modyfikacje tworzą niezawodny sygnał wykrywalny podczas detekcji.

W eksperymentach modyfikacje te nie naruszały funkcji biologicznej białka – cechy, którą Google DeepMind opisał jako niezbędną do skutecznego leczenia chorób i postępu badań naukowych.

Zespół zweryfikował swoje podejście do znakowania binderów białkowych – cząsteczek zaprojektowanych tak, by selektywnie wiązały się z innymi białkami – łącząc swoją metodę projektowania binderów AlphaProteo z wersją ProteinMPNN (powszechnie stosowanej metody generowania sekwencji białkowych) obsługiwaną przez SynthID Bio. W testach laboratoryjnych obejmujących trzy białka docelowe – VEGF-A, RBD białka kolca SARS-CoV-2 oraz PD-L1 – znakowane projekty dorównały wersjom bez znaku wodnego pod względem skuteczności trafień, powinowactwa wiązania i naturalnej różnorodności sekwencji, tworząc po raz pierwszy znakowane i biologicznie funkcjonalne bindery białkowe. Powinowactwo wiązania mierzono jako KD, przy czym niższe wartości oznaczają silniejsze bindery.

W przypadku zwijania białek SynthID Bio dostraja niewielką część sieci dyfuzyjnej AlphaFold 3, wbudowując zdolność znakowania bezpośrednio w wagi modelu. Dzięki temu przewidywane współrzędne 3D z natury niosą wykrywalny podpis, niezależnie od tego, kto uruchamia model. Według firmy technika ta zachowuje dokładność predykcji AlphaFold 3, oferując niemal idealną wykrywalność, utrzymując kluczowe rozkłady cech strukturalnych oraz odporność na szum cyfrowy i drobne zmiany współrzędnych. Zespół zilustrował wyniki na białku 7PPA, prezentując strukturę przewidzianą przez AlphaFold 3 obok struktury referencyjnej i struktury znowanej.

Wzmocnienie bezpieczeństwa biologicznego i integralności informacji

Bezpieczeństwo biologiczne opiera się na obronie warstwowej – modelu „szwajcarskiego sera”, w którym wiele niezależnych zabezpieczeń działa w tandemie, pokrywając swoje wzajemne luki. Zabezpieczenia takie jak mitygacje na poziomie modelu i weryfikacja klientów stanowią odrębne, krytyczne warstwy o potencjalnych brakach. W ramach szerszej wizji odporności biologicznej Google DeepMind podejście znakowania SynthID Bio stanowi ważną, namacalną warstwę weryfikacyjną osadzoną bezpośrednio w samym projekcie biologicznym.

„SynthID Bio to ważny element układanki w śledzeniu pochodzenia projektów biologicznych” – powiedziała Sarah Carter, ekspertka ds. polityki bezpieczeństwa biologicznego i Principal w Science Policy Consulting, która recenzowała pracę. „Powiązując projekty z deweloperem modelu, te znaki wodne umożliwiają twórcom przewodzenie w kwestiach bezpieczeństwa, a dostawcom syntezy pozwalają usprawnić screening dla klientów, którzy korzystali z tych modeli.”

Ta warstwa jest szczególnie istotna dla screeningu syntezy DNA, który znajduje się na pierwszej linii bezpieczeństwa biologicznego. Przekształcenie cyfrowych projektów białek w fizyczne cząsteczki wymaga złożenia zamówienia u dostawców syntezy DNA, którzy weryfikują zamówienia w bazach danych znanych zagrożeń. Historycznie nieznana sekwencja mogła być bezpiecznie uznana za niezidentyfikowany naturalny organizm. Ponieważ jednak AI może tworzyć zupełnie nowe sekwencje niewiele przypominające znane zagrożenia, osoby przeprowadzające screening nie mogą już przyjmować takiego założenia. Weryfikacja, czy nieznane zamówienie nie jest inżynieryjnym zagrożeniem, wymaga wyczerpujących ręcznych przeglądów, które mogą hamować ważne badania. SynthID Bio może w tym kontekście dostarczyć automatyczny sygnał weryfikacyjny, potwierdzający, że zamówienie pochodzi z zaufanego modelu z wbudowanymi zabezpieczeniami.

„AI poszerza zakres tego, co naukowcy mogą zaprojektować, a firmy zajmujące się syntezą DNA odgrywają ważną rolę w odpowiedzialnym skalowaniu tej innowacji” – powiedział James Diggans, wiceprezes ds. polityki i bezpieczeństwa biznego w Twist Bioscience, który na wczesnym etapie dzielił się uwagami do pracy. „Dla Twist znakowanie wodne to obiecujący nowy element narzędzi bezpieczeństwa biologicznego, który może wzmocnić screening, skoncentrować zasoby na sekwencjach wymagających bliższej analizy i uczynić bezpieczeństwo biologiczne bardziej wydajnym, w miarę jak rozwija się biologia projektowana z pomocą AI.”

Podobnie SynthID Bio mógłby pomóc w utrzymaniu integralności baz danych takich jak Protein Data Bank, UniProt i GenBank. Te bazy danych, z których wiele przyjmuje zgłoszenia od publiczności, odgrywają kluczową rolę w postępie nauki – ale błędnie opisane wpisy mogą mieć nadmiernie negatywny wpływ na decyzje w zakresie bezpieczeństwa biologicznego, a wyzwanie to może jedynie rosnąć wraz z dopływem danych biologicznych generowanych przez AI. W ramach procesu zgłaszania SynthID Bio mógłby pomóc zapewnić, że wpisy syntetyczne są odpowiednio opisane lub oznaczone do dalszego przeglądu.

Perspektywy na przyszłość

Choć żadna pojedyncza interwencja w zakresie bezpieczeństwa biologicznego nie jest panaceum, SynthID Bio przenosi SynthID – sprawdzony i przetestowanyDenver wynalazek Google DeepMind do znakowania wodnego – do biologii syntetycznej, stanowiąc ważny pierwszy krok w kierunku niezawodnej identyfikacji i śledzenia biologicznych sekwencji i struktur generowanych przez AI.

Kluczowe wyzwania na przyszłość obejmują zwiększenie odporności znaku wodnego na celowe manipulacje. SynthID Bio można także łączyć z podejściami opartymi na metadanych pochodzenia – podobnymi do C2PA dla mediów cyfrowych – lub z centralnymi repozytoriami biologicznych danych generowanych przez AI, aby lepiej identyfikować i śledzić białka wygenerowane przez AI.

W odpowiedzi na rosnące możliwości technologii AI granicy, Google DeepMind bada także, jak stosować znakowanie wodne do bardziej złożonych obiektów biologicznych. W trwającej współpracy z laboratorium Hie na Stanford University i Arc Institute zespół zintegrował SynthID Bio z Evo 2 – zaawansowanym modelem genomowym – aby oznaczyć genom bakteriofaga zaprojektowanego z użyciem Evo 2. Wczesne testy laboratoryjne w hodowlach bakterii potwierdziły, że te znakowane bakteriofagi są funkcjonalne. Google DeepMind stwierdził, że ta praca ma potencjał, aby zaadresować część zagrożeń bezpieczeństwa biologicznego związanych z projektowaniem genomów, a dalsze szczegóły zostaną wkrótce opublikowane w manuskrypcie technicznym.

Pełne wykorzystanie korzyści z tej pracy w zakresie bezpieczeństwa biologicznego będzie wymagało współpracy społeczności i dalszych badań. W ramach zobowiązania do odpowiedzialnej innowacji firma publikuje swój artykuł metodologiczny, udostępnia kod i dane in vitro jako open source oraz przekazuje w modeli społeczności badawczej. Google DeepMind oświadczył, że chce otwarcie współpracować z partnerami z obszarów bezpieczeństwa biologicznego, syntezy genów i polityki, aby bezpieczeństwo i odpowiedzialność nadążały za odkryciami napędzanymi przez AI. Zainteresowani współpracą nad tym tematem proszeni są o kontakt z zespołem pod adresem synthidbio@google.com wraz z ogólnym zarysem propozycji, bez ujawniania informacji poufnych lub zastrzeżonych.

Podziękowania

Projekt zainicjował Pushmeet Kohli. Badania i rozwój technologiczny prowadzili Alexander I. Cowen-Rivers i David Stutz, a opiekunem był Pushmeet Kohli. Kluczowe wkłady inżynieryjne i badawcze wniesli Guillermo Ortiz-Jimenez, Jeremy Ratcliff, Vinicius Zambaldi, Lindsay Willmore, Josh Abramson, Harshnira Patani, Christina Kouridi, Florian Stimberg, Mel Vecerik, Alex Chu, Sukhdeep Singh, Sumanth Dathathri, Eliseo Papa, Valentin De Bortoli, Arnaud Doucet, Jue Wang i Sven Gowal. Zespół podziękował Adaptyv Bio za pomoc w walidacji in vitro.

Rozszerzenie pracy o znakowanie DNA bakteriofagów to współpraca między Google DeepMind a laboratorium Hie na Stanford i Arc Institute, z kluczowymi wkładami Jeremy'ego Ratcliffa, Aleksa Petrova, Alexandra I. Cowen-Riversa, Davida Stutza, Elisy L. H. Wong, Victora Martina Palacios, Franceski Pietry, Alfreda Piccioniego, Tristana Olivera Kwana, Tor Lattimore, Sumantha Dathathri i Pushmeeta Kohliego z Google DeepMind oraz Briana Hie, Samuela Kinga i Aditi Merchant z Arc Institute i Stanford.

Google DeepMind podziękował także Rudy'emu Bunelowi, Annie Cupani, Robowi Fergusowi, Thomasowi Frerixowi, Sahri Ghalebikesabi, Johnowi Jumperowi, Jacobowi Kelly'emu, Davidowi La, Victorowi Martinowi, Sebastianowi Nowozinowi, Stigowi Petersenowi, Aleksowi Petrovowi, Uchechi Okereke, Sylvestre-Alvise Rebuffi, Rosalii Schneider, Arminowi Senonerowi, Richardowi Shuai, Ashokowi Thillaisundaramowi, Elisie L. H. Wong, Zachary'emu Wu i Augustinowi Žídek za wkład w artykuł badawczy, oraz Julienowi Bergeronowi za wkład w renderowanie 3D. Na koniec zespół podziękował Demisowi Hassabisowi za jego zachętę i wsparcie projektu.