ActualitésMacroLe SynthID de Google DeepMind adapté pour filigraner des protéines conçues par IA dans une preuve de concept de l'Université du Maryland

Le SynthID de Google DeepMind adapté pour filigraner des protéines conçues par IA dans une preuve de concept de l'Université du Maryland

Auteur: CryptoBriefing·

Points clés

  • •Des chercheurs de l'Université du Maryland ont adapté la technologie SynthID de Google DeepMind pour intégrer des filigranes invisibles basés sur une clé privée dans des séquences protéiques générées par des modèles conception par IA, dont ProteinMPNN.
  • •Les tests de validation ont montré que le filigranage n'a pas altéré les scores pLDDT de qualité de repliement, signifiant que les protéines marquées demeuraient structurellement saines.
  • •Contrairement aux méthodes de provenance basées sur les métadonnées, le filigrane statistique est intégré à la séquence elle-même et survit aux opérations de copier-coller, aux conversions de format et à la distribution entre systèmes.
  • •La technique pourrait compléter le criblage de biosécurité existant du Consortium international de synthèse génétique, dont les bases de données de dangers connus peuvent ne pas correspondre à des séquences réellement nouvelles générées par IA.
  • •Le travail n'est qu'une preuve de concept—aucun produit commercial n'existe, et le transfert éventuel de la méthode à d'autres modèles de conception de protéines et à de véritables flux de criblage de synthèse reste non résolu.
Le SynthID de Google DeepMind adapté pour filigraner des protéines conçues par IA dans une preuve de concept de l'Université du Maryland

La technologie de filigrane SynthID de Google DeepMind, développée à l'origine pour identifier les textes, images, contenus audio et vidéo générés par IA, a été étendue à un nouveau domaine : la biologie. Des chercheurs de l'Université du Maryland ont adapté le système pour intégrer des filigranes invisibles directement dans des séquences protéiques conçues par IA, établissant un mécanisme potentiel de traçabilité pour la biologie de synthèse qui laisse les protéines intactes.

Le filigrane au niveau des acides aminés

La méthode s'appuie sur SynthID-Text, qui fonctionne en ajustant subtilement la distribution de probabilité des tokens lors de la génération—in this case, des acides aminés plutôt que des mots. En utilisant une approche d'échantillonnage de Gumbel sans biais, les chercheurs ont intégré un filigrane dérivé d'une clé privée dans la distribution de probabilité des acides aminés de modèles de conception de protéines, dont ProteinMPNN.

ProteinMPNN, publié en 2022, figure parmi les modèles d'IA les plus en vue pour la conception de nouvelles séquences protéiques. Il prend une structure protéique tridimensionnelle souhaitée et procède à rebours pour produire des séquences d'acides aminés censées se replier selon cette forme. Ce domaine s'est rapidement imposé dans le grand public : le prix Nobel de chimie 2024 a récompensé la conception computationnelle de protéines, attribuée à David Baker, ainsi que la prédiction de structures protéiques assistée par IA, partagée par Demis Hassabis et John Jumper de Google DeepMind pour AlphaFold2. La couche de filigrane s'ajoute à ce flux de travail, influençant les acides aminés spécifiques sélectionnés sans modifier les propriétés statistiques globales du résultat.

Les tests de ont montré que les scores pLDDT—une métrique standard de la qualité de repliement prédite des protéines—restaient inchangés après l'ajout du filigrane. Sur le plan structurel, les protéines filigranées semblaient tout aussi solides que celles sans filigrane.

L'argument de la biosécurité

À mesure que les outils de conception de protéines par IA gagnent en puissance et en accessibilité, la capacité à générer de nouvelles séquences biologiques soulève des préoccupations de sécurité légitimes. Les méthodes de provenance classiques, telles que les journaux de métadonnées attachés aux fichiers, peuvent être supprimées aussi facilement que les données EXIF d'une photographie, sans offrir de chaîne de traçabilité durable.

Un filigrane statistique intégré fonctionne différemment. Il réside dans la séquence elle-même et survit aux opérations de copier-coller, aux conversions de format de fichier et à la distribution entre systèmes. Toute personne disposant de la clé privée correspondante peut ensuite détecter le filigrane, permettant aux organisations de déterminer si une séquence protéique donnée a été produite par un modèle d'IA spécifique.

Cette capacité s'intègre directement à l'infrastructure de biosécurité existante. Le Consortium international de synthèse génétique (IGSC) maintient déjà des cadres pour le criblage des commandes de synthèse d'ADN par rapport à des bases de données de séquences dangereuses connues. Comme ce criblage repose sur la comparaison des commandes avec des catalogues de dangers connus, une séquence réellement nouvelle générée par IA peut ne ressembler à rien dans ces bases de référence—laissant un vide documentaire qu'une provenance intégrée à la séquence pourrait contribuer à combler. Les séquences protéiques filigranées pourraient être suivies via ces mêmes canaux, ajoutant une couche de provenance propre à l'IA au processus de criblage.

Où en est cette technologie aujourd'hui

Il n'existe aucun produit commercial appelé « SynthID Bio » disponible à l'achat ou au déploiement ; la recherche se situe pleinement au stade de preuve de concept. La technologie SynthID sous-jacente de Google DeepMind est bien réelle et activement déployée pour le filigranage des textes, images, contenus audio et vidéo générés par IA. L'application aux protéines étend ces principes mais n'a jusqu'ici été démontrée qu'en contexte de recherche et n'a pas encore été transformée en produit. Le transfert éventuel de la méthode à d'autres modèles de conception de protéines et son adoption dans de véritables flux de criblage de synthèse restent des questions ouvertes pour le domaine.

L'étude met également en évidence un avantage structurel du filigrane statistique par rapport aux approches alternatives. Comme le filigrane est intégré au processus de génération lui-même plutôt qu'ajouté a posteriori, il crée une forme de provenance intrinsèquement liée au modèle d'IA. Une séquence protéique ne peut pas être filigranée après coup avec cette méthode—cela doit se produire au moment de la génération, ce qui signifie qu'elle suit naturellement le point d'origine plutôt qu'une étape de traitement en aval.