Google DeepMinds SynthID für KI-designte Proteine adaptiert: Wasserzeichen im Proof of Concept der University of Maryland
Wichtige Erkenntnisse
- •Forschende der University of Maryland haben die SynthID-Technologie von Google DeepMind angepasst, um unsichtbare, auf privaten Schlüsseln basierende Wasserzeichen in von KI-Design-Modellen wie ProteinMPNN erzeugte Proteinsequenzen einzubetten.
- •Validierungstests zeigten, dass das Wasserzeichen die pLDDT-Werte zur Faltungsqualität unverändert ließ—die markierten Proteine blieben strukturell stabil.
- •Anders als metadatenbasierte Provenienzmethoden ist das statistische Wasserzeichen in der Sequenz selbst enthalten und übersteht Kopiervorgänge, Formatkonvertierungen und die Verteilung über verschiedene Systeme.
- •Das Verfahren könnte das bestehende Biosecurity-Screening des International Gene Synthesis Consortium ergänzen, dessen Datenbanken bekannter Gefahren tatsächlich neuartige KI-generierte Sequenzen möglicherweise nicht abdecken.
- •Die Arbeit ist ausschließlich ein Proof of Concept—ein kommerzielles Produkt existiert nicht, und ob die Methode auf andere Proteindesign-Modelle und reale Synthese-Screening-Workflows übertragbar ist, bleibt offen.

Die SynthID-Wasserzeichentechnologie von Google DeepMind, ursprünglich zur Kennzeichnung KI-generierter Texte, Bilder, Audio- und Videoinhalte entwickelt, wurde in einen neuen Bereich ausgeweitet: die Biologie. Forschende der University of Maryland haben das System angepasst, um unsichtbare Wasserzeichen direkt in KI-designte Proteinsequenzen einzubetten und damit einen potenziellen Rückverfolgungsmechanismus für die synthetische Biologie zu schaffen, der die Proteine selbst unberührt lässt.
Wasserzeichen auf Aminosäure-Ebene
Die Methode baut auf SynthID-Text auf, das während der Generierung subtil die Wahrscheinlichkeitsverteilung von Tokens anpasst—in diesem Fall von Aminosäuren statt von Wörtern. Mit einem unverzerrten Gumbel-Sampling-Ansatz betteten die Forschenden ein aus einem privaten Schlüssel abgeleitetes Wasserzeichen in die Aminosäure-Wahrscheinlichkeitsverteilung von Proteindesign-Modellen ein, darunter ProteinMPNN.
ProteinMPNN, das 2022 vorgestellt wurde, gehört zu den bekanntesten KI-Modellen für den Entwurf neuartiger Proteinsequenzen. Es nimmt eine gewünschte dreidimensionale Proteinstruktur entgegen und leitet daraus rückwärts Aminosäuresequenzen ab, von denen erwartet wird, dass sie in diese Form falten. Das zugehörige Forschungsfeld hat sich rasch in den Mainstream bewegt: Der Chemie-Nobelpreis 2024 würdigte das computergestützte Proteindesign, verliehen an David Baker, sowie die KI-gestützte Vorhersage von Proteinstrukturen, die sich Google DeepMinds Demis Hassabis und John Jumper für AlphaFold2 teilten. Die Wasserzeichen-Ebene setzt auf diesem Arbeitsablauf auf und beeinflusst, welche konkreten Aminosäuren ausgewählt werden, ohne die statistischen Gesamteigenschaften des Ergebnisses zu verändern.
Validierungstests zeigten, dass die pLDDT-Werte—ein Standardmaß für die vorhergesagte Faltungsqualität von Proteinen—nach dem Wasserzeichen unverändert blieben. Strukturell erschienen die Proteine mit dem Wasserzeichen ebenso stabil ohne.
Das Argument für Biosecurity
Da Werkzeuge für KI-Proteindesign immer leistungsfähiger und zugänglicher werden, wirft die Fähigkeit, neuartige biologische Sequenzen zu erzeugen, berechtigte Sicherheitsbedenken auf. Herkömmliche Provenienzmethoden, etwa Metadaten-Protokolle, die an Dateien angehängt sind, lassen sich so leicht entfernen wie EXIF-Daten aus einem Foto und bieten keine dauerhafte Beweiskette.
Ein eingebettetes statistisches Wasserzeichen funktioniert anders. Es befindet sich innerhalb der Sequenz selbst und übersteht Kopiervorgänge, Formatkonvertierungen und die Verteilung über verschiedene Systeme hinweg. Jeder mit Zugriff auf den entsprechenden privaten Schlüssel kann das Wasserzeichen später nachweisen, wodurch Organisationen bestimmen können, ob eine bestimmte Proteinsequenz von einem bestimmten KI-Modell erzeugt wurde.
Diese Fähigkeit lässt sich zudem direkt in bestehende Biosecurity-Infrastruktur integrieren. Das International Gene Synthesis Consortium (IGSC) unterhält bereits Frameworks zur Prüfung von DNA-Syntheseaufträgen gegen Datenbanken bekannter gefährlicher Sequenzen. Da dieses Screening auf dem Abgleich von Aufträgen mit Katalogen bekannter Gefahren beruht, ähnelt eine tatsächlich neuartige, KI-generierte Sequenz möglicherweise keinem Eintrag in diesen Referenzdatenbanken—was eine Dokumentationslücke hinterlässt, die in Sequenzen eingebettete Provenienz schließen könnte. Mit Wasserzeichen versehene Proteinsequenzen könnten über dieselben Kanäle nachverfolgt werden und so eine KI-spezifische Provenienzebene in den Screening-Prozess einfügen.
Der aktuelle Stand
Ein kommerzielles Produkt namens „SynthID Bio“ ist weder zum Kauf noch zum Einsatz verfügbar; die Forschung befindet sich eindeutig im Proof-of-Concept-Stadium. Die zugrunde liegende SynthID-Technologie von Google DeepMind ist real und wird aktiv zur Wasserzeichen-Kennzeichnung KI-generierter Texte, Bilder, Audio- und Videoinhalte eingesetzt. Die Protein-Anwendung führt diese Prinzipien weiter, wurde bislang jedoch nur in einem Forschungskontext demonstriert und noch nicht als Produkt umgesetzt. Ob die Methode auf andere Proteindesign-Modelle übertragbar ist und in realen Synthese-Screening-Workflows Anklang findet, bleiben offene Fragen des Fachgebiets.
Die Studie hebt zudem einen strukturellen Vorteil statistischer Wasserzeichen gegenüber alternativen Ansätzen hervor. Da das Wasserzeichen in den Generierungsprozess selbst eingebettet und nicht nachträglich angefügt wird, entsteht eine Form der Provenienz, die untrennbar mit dem KI-Modell verknüpft ist. Eine Proteinsequenz lässt sich dieser Methode nicht nachträglich mit einem Wasserzeichen versehen—es muss zum Zeitpunkt der Generierung geschehen, was bedeutet, dass sie den Ursprungspunkt und nicht einen nachgelagerten Verarbeitungsschritt nachverfolgt.