NotizieMacroIl SynthID di Google DeepMind adattato per il watermarking di proteine progettate con l'AI in un proof of concept dell'Università del Maryland

Il SynthID di Google DeepMind adattato per il watermarking di proteine progettate con l'AI in un proof of concept dell'Università del Maryland

Autore: CryptoBriefing·

Punti chiave

  • •I ricercatori dell'Università del Maryland hanno adattato la tecnologia SynthID di Google DeepMind per incorporare filigrane invisibili basate su chiavi private nelle sequenze proteiche generate da modelli di progettazione AI, tra cui ProteinMPNN.
  • •I test di validazione hanno mostrato che il watermarking non ha alterato i punteggi pLDDT di qualità del ripiegamento, indicando che le proteine marcate sono rimaste strutturalmente solide.
  • •A differenza dei metodi di provenienza basati su metadati, la filigrana statistica è incorporata nella sequenza stessa e sopravvive a operazioni di copia-incolla, conversioni di formato e distribuzione tra sistemi.
  • •La tecnica potrebbe integrare gli screening di biosicurezza esistenti dell'International Gene Synthesis Consortium, i cui database di rischi noti potrebbero non corrispondere a sequenze genuinamente nuove generate dall'AI.
  • •Il lavoro è solo un proof of concept—non esiste alcun prodotto commerciale, e se il metodo si trasferisca ad altri modelli di progettazione proteica e a flussi di lavoro reali di screening della sintesi resta da definire.
Il SynthID di Google DeepMind adattato per il watermarking di proteine progettate con l'AI in un proof of concept dell'Università del Maryland

La tecnologia di watermarking SynthID di Google DeepMind, originariamente sviluppata per identificare testi, immagini, audio e video generati dall'AI, è stata estesa a un nuovo dominio: la biologia. I ricercatori dell'Università del Maryland hanno adattato il sistema per incorporare filigrane invisibili direttamente nelle sequenze proteiche progettate con l'AI, stabilendo un potenziale meccanismo di tracciamento per la biologia sintetica che lascia intatte le proteine.

Watermarking a livello di amminoacidi

Il metodo si basa su SynthID-Text, che opera regolando sottilmente la distribuzione di probabilità dei token durante la generazione—in questo caso, amminoacidi anziché parole. Utilizzando un approccio di campionamento Gumbel unbiased, i ricercatori hanno incorporato una filigrana derivata da una chiave privata nella distribuzione di probabilità degli amminoacidi di modelli di progettazione proteica, tra cui ProteinMPNN.

ProteinMPNN, rilasciato nel 2022, è tra i modelli AI più noti per la progettazione di nuove sequenze proteiche. Prende una struttura proteica tridimensionale desiderata e lavora a ritroso per produrre sequenze di amminoacidi che si prevede si ripieghino in quella forma. Il campo a cui appartiene si è rapidamente affermato nel mainstream: il Premio Nobel per la Chimica 2024 ha riconosciuto la progettazione computazionale di proteine, assegnato a David Baker, insieme alla previsione della struttura proteica basata sull'AI, condiviso da Demis Hassabis e John Jumper di Google DeepMind per AlphaFold2. Il livello di watermarking si inserisce in questo flusso di lavoro, influenzando quali specifici amminoacidi vengono selezionati senza alterare le proprietà statistiche complessive dell'output.

I test di validazione hanno mostrato che i punteggi pLDDT—una metrica standard per la qualità prevista del ripiegamento proteico—sono rimasti invariati dopo il watermarking. Strutturalmente, le proteine apparivano altrettanto solide con la filigrana che senza.

Il caso della biosicurezza

Man mano che gli strumenti di proazione proteica basati sull'AI diventano più potenti e accessibili, la capacità di generare nuove sequenze biologiche solleva legittime preoccupazioni per la sicurezza. I metodi di provenienza tradizionali, come i log di metadati allegati ai file, possono essere rimossi con la stessa facilità con cui si eliminano i dati EXIF da una fotografia, senza offrire alcuna catena di custodia durevole.

Una filigrana statistica incorporata funziona in modo diverso. Risiede nella sequenza stessa, sopravvivendo alle operazioni di copia-incolla, alle conversioni di formato di file e alla distribuzione tra sistemi. Chiunque abbia accesso alla corrispondente chiave privata può successivamente rilevare la filigrana, consentendo alle organizzazioni di determinare se una data sequenza proteica è stata prodotta da un modello AI specifico.

Questa capacità si integra inoltre direttamente nell'infrastruttura esistente di biosicurezza. L'International Gene Synthesis Consortium (IGSC) mantiene già framework per lo screening degli ordini di sintesi del DNA rispetto a database di sequenze pericolose note. Poiché tale screening si basa sull'abbinamento degli ordini con cataloghi di rischi noti, una sequenza genuinamente nuova generata dall'AI potrebbe non assomigliare a nulla in quei database di riferimento—lasciando una lacuna documentale che una provenienza incorporata nella sequenza potrebbe contribuire a colmare. Le sequenze proteiche con filigrana potrebbero essere tracciate attraverso questi stessi canali, aggiungendo un livello di provenienza specifico per l'AI al processo di screening.

Lo stato attuale

Non esiste alcun prodotto commerciale chiamato "SynthID Bio" disponibile per l'acquisto o il rilascio; la ricerca si colloca pienamente nel territorio del proof of concept. La tecnologia SynthID sottostante di Google DeepMind è reale e attivamente utilizzata per il watermarking di testi, immagini, audio e video generati dall'AI. L'applicazione proteica estende tali principi, ma finora è stata dimostrata solo in un contesto di ricerca e non è ancora stata trasformata in un prodotto. Se il metodo si trasferisca ad altri modelli di progettazione proteica e trovi adozione in flussi di lavoro reali di screening della sintesi restano domande aperte per il settore.

Lo studio evidenzia inoltre un vantaggio strutturale del watermarking statistico rispetto ad approcci alternativi. Poiché la filigrana è incorporata nel processo di generazione stesso anziché aggiunta successivamente, crea una forma di provenienza intrinsecamente legata al modello AI. Una sequenza proteica non può essere filigranata dopo il fatto con questo metodo—deve avvenire al momento della generazione, il che significa traccia naturalmente il punto di origine anziché qualche fase di elaborazione a valle.