Google DeepMind presenta SynthID Bio per applicare watermark alle proteine generate dall'AI
Punti chiave
- •SynthID Bio incorpora watermark impercettibili nelle sequenze amminoacidiche e nelle strutture 3D previste delle proteine generate dall'AI, e le firme restano verificabili nelle proteine fisiche sintetizzate senza comprometterne la funzione biologica.
- •Nei test in laboratorio umido su VEGF-A, sulla RBD della proteina spike di SARS-CoV-2 e su PD-L1, i binder proteici con watermark hanno eguagliato le versioni non marcate in hit rate, affinità di legame e diversità di sequenza, producendo i primi binder con watermark biologicamente funzionali.
- •Per il folding proteico, la capacità di watermarking è integrata direttamente nei pesi del modello di AlphaFold 3, mantenendo l'accuratezza predittiva con rilevabilità quasi perfetta e resistenza al rumore digitale o a piccole variazioni di coordinate.
- •Il sistema è progettato per rafforzare la biosicurezza fornendo ai fornitori di sintesi del DNA un segnale automatizzato che un ordine proviene da un modello affidabile, e per aiutare a etichettare correttamente o segnalare le voci sintetiche in database come Protein Data Bank, UniProt e GenBank.
- •In collaborazione con il laboratorio di Hie presso la Stanford University e l'Arc Institute, DeepMind ha integrato SynthID Bio nel modello genomico Evo 2 per applicare un watermark a un genoma di batteriofago progettato, e i primi test di laboratorio in colture batteriche hanno confermato che i fagi con watermark sono funzionali.

Google DeepMind ha presentato SynthID Bio, un'iniziativa proof-of-concept per portare la tecnologia di watermarking nella biologia sintetica. Annunciato in un post sul blog pubblicato il 30 settembre, il sistema incorpora una firma impercettibile direttamente nel codice biologico delle proteine generate dall'AI, garantendo che il watermark sia verificabile non solo sul modello digitale ma anche sulla proteina fisica sintetizzata — preservandone al contempo la funzione biologica nei test di laboratorio.
Il lavoro, firmato da Pushmeet Kohli, David Stutz, Ali Cowen-Rivers e Jeremy Ratcliff, arriva mentre l'AI generativa aiuta sempre più gli scienziati ad affrontare sfide biologiche critiche: prevedere la struttura delle proteine con AlphaFold, progettare proteine completamente nuove con AlphaProteo e ProteinMPNN e, più di recente, sviluppare nuovi batteriofagi — virus che infettano i batteri. Tuttavia, questi strumenti presentano anche nuove sfide: i progetti AI innovativi possono aggirare lo screening tradizionale della sintesi del DNA, mentre le strutture 3D sintetiche etichettate in modo errato rischiano di inquinare i database pubblici e di fuorviare la ricerca a valle.
Come funziona SynthID Bio
SynthID Bio è una famiglia di metodi di watermarking sviluppati specificamente per la biologia sintetica al fine di rafforzare la biosicurezza e l'integrità scientifica. L'approccio si adatta al tipo di dati coinvolti per le sequenze, guida in modo sottile la scelta degli amminoacidi; per le strutture 3D previste, regola le coordinate atomiche. In entrambi i casi, le modifiche creano un segnale affidabile per il rilevamento.
Negli esperimenti, queste modifiche non hanno compromesso la funzione biologica della proteina — una proprietà che Google DeepMind ha descritto come essenziale per trattare efficacemente le malattie e far avanzare la ricerca scientifica.
Il team ha verificato il proprio approccio al watermarking dei binder proteici — molecole progettate per legarsi selettivamente ad altre proteine — combinando il proprio metodo di progettazione di binder AlphaProteo con una versione di ProteinMPNN abilitata a SynthID Bio, un metodo di generazione di sequenze proteiche ampiamente utilizzato. Nei test in laboratorio umido su tre proteine target — VEGF-A, la RBD della proteina spike di SARS-CoV-2 e PD-L1 — i progetti con watermark hanno eguagliato il hit rate, l'affinità di legame e la diversità naturale delle sequenze delle versioni non marcate, creando con successo i primi binder proteici con watermark e biologicamente funzionali. L'affinità di legame è stata misurata come KD, con valori più bassi che indicano binder più forti.
Per il folding proteico, SynthID Bio effettua un fine-tuning di una piccola parte della rete di diffusione di AlphaFold 3, integrando la capacità di watermarking direttamente nei pesi del modello. Ciò garantisce che le coordinate 3D previste portino intrinsecamente una firma rilevabile, indipendentemente da chi esegue il modello. Secondo l'azienda, la tecnica preserva l'accuratezza predittiva di AlphaFold 3 offrendo una rilevabilità quasi perfetta, mantenendo le distribuzioni delle caratteristiche strutturali chiave e resistendo al rumore digitale o a piccole variazioni di coordinate. Il team ha illustrato i risultati sulla proteina 7PPA, presentando la struttura prevista da AlphaFold 3 accanto alla struttura di riferimento e alla struttura con watermark.
Rafforzare la biosicurezza e l'integrità delle informazioni
La biosicurezza si basa su difese a strati — un modello a "formaggio svizzero" in cui molteplici misure di sicurezza indipendenti operano di concerto per coprire i reciproci punti ciechi. Salvaguardie come le mitigazioni a livello di modello e la verifica dei clienti rappresentano ciascuna strati critici con potenziali lacune. Come parte della più ampia visione di Google DeepMind per la bior resilienza, l'approccio di watermarking di SynthID Bio costituisce un importante e tangibile strato di verifica incorporato nel progetto biologico stesso.
"SynthID Bio è un tassello importante per tracciare la provenienza dei progetti biologici", ha dichiarato Sarah Carter, esperta di politiche di biosicurezza e Principal di Science Policy Consulting, che ha revisionato il lavoro. "Collegando i progetti allo svuppatore del modello, questi watermark permettono agli sviluppatori di assumere un ruolo di guida sulla sicurezza e consentono ai fornitori di sintesi di snellire lo screening per i clienti che hanno utilizzato tali modelli."
Questo strato è particolarmente vitale per lo screening della sintesi del DNA, che si trova in prima linea nella biosicurezza. Convertire progetti proteici digitali in molecole fisiche richiede di effettuare un ordine presso fornitori di sintesi del DNA, che vagliano le richieste confrontandole con database di minacce note. Storicamente, una sequenza sconosciuta poteva essere ragionevolmente considerata un organismo naturale non ancora scoperto. Ma poiché l'AI può creare sequenze completamente nuove con scarso assomiglio alle minacce note, chi effettua lo screening non può più fare tale assunzione. Verificare che un ordine sconosciuto non sia una minaccia ingegnerizzata richiede revisioni manuali approfondite che possono rallentare ricerche fondamentali. In questo contesto, SynthID Bio può fornire un segnale di verifica automatizzato, dimostrando che un ordine proviene da un modello affidabile con salvaguardie integrate.
"L'AI sta ampliando ciò che gli scienziati possono progettare, e le aziende di sintesi del DNA hanno un ruolo importante nell'aiutare questa innovazione a crescere in modo responsabile", ha dichiarato James Diggans, Vice President, Policy and Biosecurity di Twist Bioscience, che ha fornito feedback preliminari sull'articolo. "Per Twist, il watermarking rappresenta una promettente aggiunta alla cassetta degli attrezzi della biosicurezza che potrebbe rafforzare lo screening, concentrare le risorse sulle sequenze che meritano un esame più attento e rendere la biosicurezza più efficiente man mano che la biologia progettata con l'AI continua ad avanzare."
Analogamente, SynthID Bio potrebbe contribuire a mantenere l'integrità di database come Protein Data Bank, UniProt e GenBank. Questi database, molti dei quali aperti a contributi pubblici, svolgono un ruolo vitale nell'avanzamento scientifico — ma le voci etichettate in modo errato possono avere un impatto negativo sproporzionato sulle decisioni di biosicurezza, una sfida che potrebbe accrescersi con l'aggiunta di dati biologici generati dall'AI. Come parte del processo di invio, SynthID Bio potrebbe aiutare a garantire che le voci sintetiche siano etichettate correttamente o segnalate per un'ulteriore revisione.
Prospettive future
Sebbene nessun intervento di biosicurezza sia da solo una panacea, SynthID Bio porta SynthID — lo strumento di watermarkingaudato di Google DeepMind — nella biologia sintetica, segnando un primo passo importante verso l'identificazione e il tracciamento affidabili di sequenze e strutture biologiche generate dall'AI.
Andando avanti, le sfide chiave includono rendere il watermark più robusto contro manomissioni intenzionali. SynthID Bio può inoltre essere abbinato ad approcci di metadati di provenienza — simili a C2PA per i media digitali — o a repository centrali di dati biologici generati dall'AI per identificare e tracciare meglio le proteine generate dall'AI.
Per stare al passo con le crescenti capacità dell'AI di frontiera, Google DeepMind sta anche studiando come applicare il watermarking a oggetti biologici più complessi. In lavori in corso con il laboratorio di Hie presso la Stanford University e l'Arc Institute, il team ha integrato SynthID Bio in Evo 2, un modello genomico avanzato, per applicare un watermark al genoma di un batteriofago progettato con Evo 2. I primi test di laboratorio in colture batteriche hanno confermato che questi batteriofagi con watermark sono funzionali. Google DeepMind ha dichiarato che questo lavoro ha il potenziale per affrontare alcuni dei rischi di biosicurezza associati alla progettazione dei genomi e che ulteriori dettagli saranno presto condivisi in un manoscritto tecnico.
Realizzare i pieni benefici di biosicurezza di questo lavoro richiederà collaborazione con la comunità e ulteriori ricerche. Come parte del suo impegno per l'innovazione responsabile, l'azienda pubblica il proprio articolo sui metodi, rende open source il codice e i dati in vitro e rilascia i pesi alla comunità di ricerca. Google DeepMind ha dichiarato di puntare a collaborare apertamente con partner nel campo della biosicurezza, della sintesi genica e delle politiche per garantire che sicurezza e responsabilità tengano il passo con la scoperta guidata dall'AI. Le parti interessate a collaborare su questo tema sono invitate a contattare il team all'indirizzo synthidbio@google.com con una proposta di alto livello, evitando di divulgare informazioni riservate o proprietarie.
Ringraziamenti
Il progetto è stato avviato da Pushmeet Kohli. La ricerca e lo sviluppo tecnico sono stati guidati da Alexander I. Cowen-Rivers e David Stutz, con Kohli come consulente. Contributi chiave di ingegneria e ricerca sono stati forniti da Guillermo Ortiz-Jimenez, Jeremy Ratcliff, Vinicius Zambaldi, Lindsay Willmore, Josh Abramson, Harshnira Patani, Christina Kouridi, Florian Stimberg, Mel Vecerik, Alex Chu, Sukhdeep Singh, Sumanth Dathathri, Eliseo Papa, Valentin De Bortoli, Arnaud Doucet, Jue Wang e Sven Gowal. Il team ha ringraziato Adaptyv Bio per l'assistenza nella validazione in vitro.
L'estensione del lavoro al watermarking del DNA dei batteriofagi è una collaborazione tra Google DeepMind e il laboratorio di Hie presso Stanford e l'Arc Institute, con contributi chiave di Jeremy Ratcliff, Aleks Petrov, Alexander I. Cowen-Rivers, David Stutz, Elisa L. H. Wong, Victor Martin Palacios, Francesca Pietra, Alfred Piccioni, Tristan Oliver Kwan, Tor Lattimore, Sumanth Dathathri e Pushmeet Kohli di Google DeepMind, e di Brian Hie, Samuel King e Aditi Merchant dell'Arc Institute e di Stanford.
Google DeepMind ha inoltre ringraziato Rudy Bunel, Anna Cupani, Rob Fergus, Thomas Frerix, Sahra Ghalebikesabi, John Jumper, Jacob Kelly, David La, Victor Martin, Sebastian Nowozin, Stig Petersen, Aleks Petrov, Uchechi Okereke, Sylvestre-Alvise Rebuffi, Rosalia Schneider, Armin Senoner, Richard Shuai, Ashok Thillaisundaram, Elisa L. H. Wong, Zachary Wu e Augustin Žídek per i contributi all'articolo di ricerca, e Julien Bergeron per i contributi rendering 3D. Il team ha concluso ringraziando Demis Hassabis per il suo incoraggiamento e sostegno al progetto.