NieuwsMacroGoogle DeepMinds SynthID aangepast om door AI ontworpen eiwitten te watermarken in proof of concept van University of Maryland

Google DeepMinds SynthID aangepast om door AI ontworpen eiwitten te watermarken in proof of concept van University of Maryland

Auteur: CryptoBriefing·

Belangrijkste punten

  • •Onderzoekers van de University of Maryland hebben de SynthID-technologie van Google DeepMind aangepast om onzichtbare, op privésleutels gebaseerde watermerken in te bouwen in eiwitsequenties die door AI-ontwerpmodellen, waaronder ProteinMPNN, zijn gegenereerd.
  • •Validatietesten toonden aan dat watermarking de pLDDT-scores voor vouwkwaliteit ongewijzigd liet, wat betekent dat de gewatermerkte eiwitten structureel solide bleven.
  • •In tegenstelling tot herkomstmethoden op basis van metadata is het statistische watermerk in de sequentie zelf ingebed en overleeft het kopieer-plakbewerkingen, conversies van bestandsformaten en distributie over systemen heen.
  • •De techniek zou bestaande bioveiligheidsscreening van het International Gene Synthesis Consortium kunnen aanvullen, waarvan de databases met bekende gevaren mogelijk geen match opleveren voor werkelijk nieuwe door AI gegenereerde sequenties.
  • •Het werk is uitsluitend een proof of concept—er bestaat geen commercieel product, en of de methode overdraagbaar is naar andere eiwitontwerpmodellen en echte synthesesscreeningworkflows blijft onopgelost.
Google DeepMinds SynthID aangepast om door AI ontworpen eiwitten te watermarken in proof of concept van University of Maryland

De SynthID-watermarkingtechnologie van Google DeepMind, oorspronkelijk ontwikkeld om door AI gegenereerde tekst, afbeeldingen, audio en video te identificeren, is uitgebreid naar een nieuw domein: de biologie. Onderzoekers van de University of Maryland hebben het systeem aangepast om onzichtbare watermerken direct in door AI ontworpen eiwitsequenties in te bouwen, waarmee een potentieel volgmechanisme voor de synthetische biologie ontstaat dat de eiwitten zelf intact laat.

Watermerken op aminozuurniveau

De methode bouwt voort op SynthID-Text, dat werkt door tijdens de generatie de waarschijnlijkheidsverdeling van tokens subtiel aan te passen—in dit geval aminozuren in plaats van woorden. Met een zogenaamde onbevooroordeelde Gumbel-samplingaanpak brachten de onderzoekers een watermerk, afgeleid van een privésleutel, aan op de aminozuurwaarschijnlijkheidsverdeling van eiwitontwerpmodellen, waaronder ProteinMPNN.

ProteinMPNN, uitgebracht in 2022, behoort tot de bekendere AI-modellen voor het ontwerpen van nieuwe eiwitsequenties. Het model neemt een gewenste driedimensionale eiwitstructuur als uitgangspunt en werkt achterwaarts om aminozuursequenties te genereren die naar verwachting in die vorm vouwen. Het vakgebied heeft zich snel naar de mainstream bewogen: de Nobelprijs voor Scheikunde 2024 erkende computationeel eiwitontwerp, toegekend aan David Baker, evenals door AI gedreven voorspelling van eiwitstructuren, gedeeld door Demis Hassabis en John Jumper van Google DeepMind voorFold2. De watermarkinglaag ligt bovenop deze workflow en beïnvloedt welke specifieke aminozuren worden geselecteerd, zonder de algehele statistische eigenschappen van de uitvoer te veranderen.

Validatietesten toonden aan dat pLDDT-scores—een standaardmaatstaf voor de voorspelde kwaliteit van eiwitvouwing—ongewijzigd bleven na het aanbrengen van het watermerk. Structureel zagen de eiwitten er met het watermerk even solide uit als zonder.

Het bioveiligheidsargument

Naarmate AI-tools voor eiwitontwerp krachtiger en toegankelijker worden, roept het vermogen om nieuwe biologische sequenties te genereren terechte veiligheidszorgen op. Gangbare herkomstmethoden, zoals aan bestanden gekoppelde metadatalogs, kunnen even eenvoudig worden verwijderd als EXIF-gegevens uit een foto en bieden geen duurzame bewijsketen.

Een ingebed statistisch watermerk werkt anders. Het bevindt zich in de sequentie zelf en overleeft kopieer-plakbewerkingen, conversies van bestandsformaten en distributie over systemen heen. Iedereen met toegang tot de bijbehorende privésleutel kan het watermerk later detecteren, waardoor organisaties kunnen vaststellen of een bepaalde eiwitsequentie door een specifiek AI-model is gegenereerd.

De mogelijkheid sluit ook direct aan op bestaande bioveiligheidsinfrastructuur. Het International Gene Synthesis Consortium (IGSC) onderhoudt al kaders voor het screenen van DNA-syntheseopdrachten tegen databases met bekende gevaarlijke sequenties. Omdat die screening afhankelijk is van het afstemmen van opdrachten op catalogi van bekende gevaren, lijkt een werkelijk nieuwe door AI gegenereerde sequentie mogelijk op niets in die referentiedatabases—waardoor een documentatiekloof ontstaat die in de sequentie ingebedde herkomstinformatie zou kunnen helpen dichten. Gewatermerkte eiwitsequenties zouden via dezelfde kanalen kunnen worden gevolgd, waardoor een laag met AI-specifieke herkomst aan het screeningsproces wordt toegevoegd.

Waar dit nu staat

Er is geen commercieel product genaamd "SynthID Bio" beschikbaar voor aankoop of inzet; het onderzoek bevindt zich duidelijk in de proof-of-conceptfase. De onderliggende SynthID-technologie van Google DeepMind is echt en wordt actief ingezet voor het watermarken van door AI gegenereerde tekst, afbeeldingen, audio en video. De eiwittoepassing breidt die principes uit, maar is tot op heden alleen in een onderzoeksomgeving gedemonstreerd en nog niet geproductiseerd. Of de methode overdraagbaar is naar andere eiwitontwerpmodellen en wordt opgepakt in echte synthesesscreeningworkflows, blijven open vragen voor het vakgebied.

De studie belicht ook een structureel voordeel van statistische watermarking boven alternatieveaderingen. Omdat het watermerk in het generatieproces zelf is ingebed in plaats van achteraf toegevoegd, ontstaat een vorm van herkomst die inherent verbonden is met het AI-model. Een eiwitsequentie kan met deze methode niet achteraf worden gewatermerkt—het moet gebeuren op het moment van generatie, wat betekent dat het van nature het oorsprongspunt volgt in plaats van een of andere downstream verwerkingsstap.