Google DeepMind stellt SynthID Bio vor: Wasserzeichen für KI-generierte Proteine
Wichtige Erkenntnisse
- •SynthID Bio bettet nicht wahrnehmbare Wasserzeichen in die Aminosäuresequenzen und vorhergesagten 3D-Strukturen KI-generierter Proteine ein; die Signaturen bleiben in den synthetisierten physischen Proteinen überprüfbar, ohne deren biologische Funktion zu beeinträchtigen.
- •In Nasslabor-Tests gegen VEGF-A, die RBD des SARS-CoV-2-Spike-Proteins und PD-L1 erreichten markierte Proteinbinder die Werte unmarkierter Versionen bei Trefferquote, Bindungsaffinität und Sequenzdiversität – die ersten biologisch funktionsfähigen, wasserzeichenbehafteten Binder.
- •Für die Proteinfaltung ist die Wasserzeichenfähigkeit direkt in die Modellgewichte von AlphaFold 3 eingebaut, was die Vorhersagegenauigkeit bewahrt und nahezu perfekte Erkennbarkeit sowie Widerstandsfähigkeit gegen digitales Rauschen und geringfügige Koordinatenänderungen bietet.
- •Das System soll die Biosicherheit stärken, indem es DNA-Syntheseanbietern ein automatisiertes Signal liefert, dass eine Bestellung aus einem vertrauenswürdigen Modell stammt, und dazu beitragen, synthetische Einträge in Datenbanken wie der Protein Data Bank, UniProt und GenBank korrekt zu labeln oder zu markieren.
- •In Zusammenarbeit mit dem Hie-Lab der Stanford University und dem Arc Institute integrierte DeepMind SynthID Bio in das genomische Modell Evo 2, um ein entworfenes Bakteriophagen-Genom zu markieren; erste Labortests in Bakterienkulturen bestätigten die Funktionsfähigkeit der markierten Phagen.

Google DeepMind hat SynthID Bio vorgestellt, ein Proof-of-Concept-Vorhaben, das Wasserzeichentechnologie in die synthetische Biologie bringt. In einem am 30. September veröffentlichten Blogbeitrag wurde das System angekündigt, das eine nicht wahrnehmbare Signatur direkt in den biologischen Code KI-generierter Proteine einbettet. Dadurch ist das Wasserzeichen nicht nur im digitalen Modell, sondern auch im synthetisierten, physischen Protein selbst überprüfbar – und dies, ohne die biologische Funktion im Labortest zu beeinträchtigen.
Die Arbeit von Pushmeet Kohli, David Stutz, Ali Cowen-Rivers und Jeremy Ratcliff erscheint in einer Zeit, in der generative KI Wissenschaftlern zunehmend bei zentralen biologischen Herausforderungen hilft: bei der Vorhersage von Proteinstrukturen mit AlphaFold, beim Entwurf völlig neuer Proteine mit AlphaProteo und ProteinMPNN und zuletzt bei der Entwicklung neuer Bakteriophagen – Viren, die Bakterien infizieren. Doch diese Werkzeuge bringen auch neue Herausforderungen mit sich. Neue KI-Entwürfe können herkömmliche DNA-Synthese-Prüfungen umgehen, während falsch gelabelte synthetische 3D-Strukturen öffentliche Datenbanken verunreinigen nachfolgende Forschung in die Irre führen können.
So funktioniert SynthID Bio
SynthID Bio ist eine Familie von Wasserzeichenmethoden, die speziell für die synthetische Biologie entwickelt wurde, um Biosicherheit und wissenschaftliche Integrität zu stärken. Der Ansatz passt sich an den Datentyp an: Bei Sequenzen lenkt er die Auswahl der Aminosäuren dezent; bei vorhergesagten 3D-Strukturen werden die Atomkoordinaten angepasst. In beiden Fällen entsteht ein zuverlässiges Signal für die Erkennung.
In Experimenten beeinträchtigten diese Anpassungen die biologische Funktion der Proteine nicht – eine Eigenschaft, die Google DeepMind als essenziell für die wirksame Behandlung von Krankheiten und den Fortschritt der wissenschaftlichen Forschung bezeichnete.
Das Team verifizierte seinen Ansatz zur Wasserzeichnung von Proteinbindern – Molekülen, die gezielt an andere Proteine andocken sollen –, indem es seine Binder-Design-Methode AlphaProteo mit einer SynthID-Bio-fähigen Version von ProteinMPNN, einer gängigen Methode zur Proteinsequenzgenerierung, kombinierte. In Nasslabor-Tests mit drei Zielproteinen – VEGF-A, der RBD des SARS-CoV-2-Spike-Proteins und PD-L1 – erreichten die markierten Designs die Trefferquote, Bindungsaffinität und natürliche Sequenzdiversität der unmarkierten Versionen und schufen damit die ersten je entwickelten wasserzeichenbehafteten und biologisch funktionsfähigen Proteinbinder. Die Bindungsaffinität wurde als KD gemessen, wobei niedrigere Werte stärkere Binder anzeigen.
Für die Proteinfaltung optimiert SynthID Bio einen kleinen Teil des Diffusionsnetzwerks von AlphaFold 3 und baut die Wasserzeichenfähigkeit direkt in die Modellgewichte ein. So tragen die vorhergesagten 3D-Koordinaten inhärent eine erkennbare Signatur, unabhängig davon, wer das Modell ausführt. Laut dem Unternehmen bewahrt die Technik die Vorhersagegenauigkeit von AlphaFold 3 und bietet dabei nahezu perfekte Erkennbarkeit, hält die Verteilungen wichtiger Strukturmerkmale aufrecht und ist widerstandsfähig gegen digitales Rauschen oder geringfügige Koordinatenänderungen. Das Team veranschaulichte die Ergebnisse am Protein 7PPA und stellte die von AlphaFold 3 vorhergeste Struktur neben die Ground-Truth-Struktur und die markierte Struktur.
Stärkung von Biosicherheit und Informationsintegrität
Biosicherheit beruht auf mehrschichtigen Verteidigungen – einem „Schweizer-Käse“-Modell, bei dem mehrere unabhängige Sicherheitsmaßnahmen Hand in Hand arbeiten, um die blinden Flecken der jeweils anderen abzudecken. Schutzmaßnahmen wie Modellmitigationen und Kundenprüfungen stellen jeweils kritische Schichten mit potenziellen Lücken dar. Als Teil von Google DeepMinds umfassenderer Vision für Bioresilienz dient SynthID Bios Wasserzeichenansatz als wichtige, greifbare Verifikationsschicht, die direkt im biologischen Design verankert ist.
„SynthID Bio ist ein wichtiges Puzzleteil, um die Herkunft biologischer Designs nachzuverfolgen“, sagte Sarah Carter, eine Expertin für Biosicherheitspolitik und Principal bei Science Policy Consulting, die die Arbeit geprüft hat. „Indem sie Designs mit dem Modellentwickler verknüpfen, befähigen diese Wasserzeichen Entwickler, bei der Sicherheit führend zu sein, und ermöglichen es Syntheseanbietern, die Prüfung für Kunden zu optimieren, die diese Modelle verwendet haben.“
Diese Schicht ist besonders wichtig für die DNA-Syntheseprüfung, die an vorderster Front der Biosicherheit steht. Die Umwandlung digitaler Proteinentwürfe in physische Moleküle erfordert eine Bestellung bei DNA-Syntheseanbietern, die Anfragen anhand von Datenbanken bekannter Bedrohungen prüfen. Früher konnte eine unbekannte Sequenz sicher als unentdeckter natürlicher Organismus angenommen werden. Da KI jedoch völlig neue Sequenzen mit kaum Ähnlichkeit zu bekannten Gefahren erzeugen kann, können Prüfer diese Annahme nicht mehr treffen. Zu verifizieren, dass eine unbekannte Bestellung keine technisch hergestellte Bedrohung ist, erfordert erschöpfende manuelle Prüfungen, die wichtige Forschung aufhalten können. SynthID Bio kann hier ein automatisiertes Verifikationssignal liefern und nachweisen, dass eine Bestellung aus einem vertrauenswürdigen Modell mit eingebauten Schutzmaßnahmen stammt.
„KI erweitert, was Wissenschaftler entwerfen können, und DNA-Syntheseunternehmen tragen eine wichtige Verantwortung dabei, dieser Innovation ein verantwortungsvolles Wachstum zu ermöglichen“, sagte James Diggans, Vice President, Policy and Biosecurity bei Twist Bioscience, der früh Feedback zum Paper gab. „Für Twist ist Wasserzeichnung ein vielversprechender Neuzugang im Biosicherheits-Werkzeugkasten, der die Prüfung stärken, Ressourcen auf Sequenzen konzentrieren könnte, die einer genaueren Prüfung bedürfen, und die Biosicherheit effizienter machen, währendI-designte Biologie weiter voranschreitet.“
Ebenso könnte SynthID Bio helfen, die Integrität von Datenbanken wie der Protein Data Bank, UniProt und GenBank zu erhalten. Diese Datenbanken, von denen viele öffentliche Einreichungen zulassen, spielen eine entscheidende Rolle für wissenschaftliche Fortschritte – doch falsch gelabelte Einträge können erhebliche negative Auswirkungen auf Entscheidungen zur Biosicherheit haben, eine Herausforderung, die mit dem Zuwachs KI-generierter biologischer Daten noch zunehmen dürfte. Im Rahmen des Einreichungsprozesses könnte SynthID Bio dazu beitragen, dass synthetische Einträge korrekt gelabelt oder zur weiteren Prüfung markiert werden.
Ausblick
Wenngleich keine einzelne Biosicherheitsmaßnahme ein Allheilmittel ist, bringt SynthID Bio SynthID – das erprobte Wasserzeichenwerkzeug von Google DeepMind – in die synthetische Biologie und markiert damit einen wichtigen ersten Schritt zuverlässiger Identifizierung und Nachverfolgung KI-generierter biologischer Sequenzen und Strukturen.
Zu den künftigen zentralen Herausforderungen zählt, das Wasserzeichen robuster gegen absichtliche Manipulationen zu machen. SynthID Bio kann auch mit Herkunfts-Metadatenansätzen – ähnlich wie C2PA für digitale Medien – oder zentralen Repositorien für KI-generierte biologische Daten kombiniert werden, um KI-generierte Proteine besser zu identifizieren und nachzuverfolgen.
Um mit den wachsenden Fähigkeiten der Frontier-KI-Technologie Schritt zu halten, erforscht Google DeepMind auch, wie Wasserzeichen auf komplexere biologische Objekte angewendet werden können. In laufender Zusammenarbeit mit dem Hie-Lab der Stanford University und dem Arc Institute integrierte das Team SynthID Bio in Evo 2, ein fortschrittliches genomisches Modell, um das Genom eines mit Evo 2 entworfenen Bakteriophagen zu markieren. Erste Labortests in Bakterienkulturen haben bestätigt, dass diese markierten Bakteriophagen funktionsfähig sind. Google DeepMind erklärte, die Arbeit habe das Potenzial, einige der mit dem Genomdesign verbundenen Biosicherheitsrisiken zu adressieren, und weitere Details würden in Kürze in einem technischen Manuskript mitgeteilt.
Um den vollen biosicherheitsrelevanten Nutzen dieser Arbeit zu realisieren, sind Kollaboration der Community und weitere Forschung erforderlich. Im Rahmen seines Engagements für verantwortungsvolle Innovation veröffentlicht das Unternehmen sein Methodenpapier, macht den Code und die In-vitro-Daten als Open Source verfügbar und stellt die Gewichte der Forschungsgemeinschaft zur Verfügung. Google DeepMind erklärte, es wolle offen mit Partnern aus den Bereichen Biosicherheit, Gensynthese und Politik zusammenarbeiten, damit Sicherheit und Verantwortung mit der KI-getriebenen Entdeckung Schritt halten. Interessierte Partner werden gebeten, sich mit einem konzeptionellen Vorschlag an synthidbio@google.com zu wenden und keine vertraulichen oder proprietären Informationen preiszugeben.
##anksagungen
Das Projekt wurde von Pushmeet Kohli initiiert. Die Forschung und technische Entwicklung wurden von Alexander I. Cowen-Rivers und David Stutz geleitet, mit Kohli als Berater. Wesentliche Beiträge zu Engineering und Forschung kamen von Guillermo Ortiz-Jimenez, Jeremy Ratcliff, Vinicius Zambaldi, Lindsay Willmore, Josh Abramson, Harshnira Patani, Christina Kouridi, Florian Stimberg, Mel Vecerik, Alex Chu, Sukhdeep Singh, Sumanth Dathathri, Eliseo Papa, Valentin De Bortoli, Arnaud Doucet, Jue Wang und Sven Gowal. Das Team dankte Adaptyv Bio für Unterstützung bei der In-vitro-Validierung.
Die Erweiterung der Arbeit auf die Wasserzeichnung von Bakteriophagen-DNA ist eine Kollaboration zwischen Google DeepMind und dem Hie-Lab in Stanford sowie dem Arc Institute, mit wesentlichen Beiträgen von Jeremy Ratcliff, Aleks Petrov, Alexander I. Cowen-Rivers, David Stutz, Elisa L. H. Wong, Victor Martin Palacios, Francesca Pietra, Alfred Piccioni, Tristan Oliver Kwan, Tor Lattimore, Sumanth Dathathri und Pushmeet Kohli von Google DeepMind sowie Brian Hie, Samuel King und Aditi Merchant vom Arc Institute und Stanford.
Google DeepMind dankte außerdem Rudy Bunel, Anna Cupani, Rob Fergus, Thomas Frerix, Sahra Ghalebikesabi, John Jumper, Jacob Kelly, David La, Victor Martin, Sebastian Nowozin, Stig Petersen, Aleks Petrov, Uchechi Okereke, Sylvestre-Alvise Rebuffi, Rosalia Schneider, Armin Senoner, Richard Shuai, Ashok Thillaisundaram, Elisa L. H. Wong, Zachary Wu und Augustin Žídek für Beiträge zum Forschungsartikel sowie Julien Bergeron für Beiträge zum 3D-Rendering. Abschließend dankte das Team Demis Hassabis für seine Unterstützung und Ermutigung des Projekts.