Google DeepMind dévoile SynthID Bio pour filigraner les protéines générées par IA
Points clés
- •SynthID Bio intègre des filigranes imperceptibles dans les séquences d'acides aminés et les structures 3D prédites des protéines générées par IA, et ces signatures restent vérifiables dans les protéines physiques synthétisées sans compromettre leur fonction biologique.
- •Lors de tests en laboratoire sur VEGF-A, la RBD de la protéine spike du SARS-CoV-2 et PD-L1, les lieurs protéiques filigranés ont égalé les versions non filigranées en taux de réussite, en affinité de liaison et en diversité des séquences, produisant les premiers lieurs filigranés biologiquement fonctionnels.
- •Pour le repliement des protéines, la capacité de filigranage est intégrée directement dans les poids du modèle AlphaFold 3, maintenant la précision des prédictions tout en offrant une détectabilité quasi parfaite et une résistance au bruit numérique ou aux modifications mineures des coordonnées.
- •Le système est conçu pour renforcer la biosécurité en fournissant aux fournisseurs de synthèse d'ADN un signal automé indiquant qu'une commande provient d'un modèle fiable, et pour aider à étiqueter ou signaler correctement les entrées synthétiques dans des bases de données telles que la Protein Data Bank, UniProt et GenBank.
- •En collaboration avec le laboratoire de Hie à l'Université Stanford et l'Arc Institute, DeepMind a intégré SynthID Bio dans le modèle génomique Evo 2 afin de filigraner un génome de bactériophage conçu, et les premiers tests en laboratoire sur des cultures bactériennes ont confirmé que ces phages filigranés sont fonctionnels.

Google DeepMind a présenté SynthID Bio, une démarche de preuve de concept visant à apporter la technologie de filigranage à la biologie de synthèse. Annoncée dans un article de blog publié le 30 septembre, cette solution intègre une signature imperceptible directement dans le code biologique des protéines générées par IA, garantissant que le filigrane est vérifiable non seulement sur le modèle numérique, mais aussi sur la protéine physique synthétisée elle-même — le tout en préservant sa fonction biologique lors des tests en laboratoire.
Ces travaux, signés par Pushmeet Kohli, David Stutz, Ali Cowen-Rivers et Jeremy Ratcliff, arrivent alors que l'IA générative aide de plus en plus les scientifiques à relever des défis biologiques majeurs : prédire la structure des protéines avec AlphaFold, concevoir des protéines entièrement nouvelles avec AlphaProteo et ProteinMPNN et, plus récemment, développer de nouveaux bactériophages — des virus qui infectent les bactéries. Mais ces outils posent également de nouveaux défis. Les conceptions inédites issues de l'IA peuvent contourner le criblage traditionnel de synthèse d'ADN, tandis que les structures 3D synthétiques mal étiquetées risquent de polluer les bases de données publiques et d'induire en erreur les recherches en aval.
Fonctionnement de SynthID Bio
SynthID Bio est une famille de méthodes de filigranage développées spécifiquement pour la biologie de synthèse afin de renforcer la biosécurité et l'intégrité scientifique. L'approche s'adapte au type de données concerné : pour les séquences, elle guide subtilement le choix des acides aminés ; pour les structures 3D prédites, elle ajuste les coordonnées atomiques. Dans les deux cas, ces modifications créent un signal fiable permettant la détection.
Lors des expériences ces ajustements n'ont pas compromis la fonction biologique des protéines — une propriété que Google DeepMind a décrite comme essentielle pour traiter efficacement les maladies et faire progresser la recherche scientifique.
L'équipe a validé son approche de filigranage des lieurs protéiques — des molécules conçues pour se fixer sélectivement sur d'autres protéines — en combinant sa méthode de conception de lieurs AlphaProteo avec une version de ProteinMPNN compatible avec SynthID Bio, une méthode couramment utilisée de génération de séquences protéiques. Lors de tests en laboratoire sur trois protéines cibles — VEGF-A, la RBD de la protéine spike du SARS-CoV-2 et PD-L1 —, les conceptions filigranées ont égalé les versions non filigranées en termes de taux de réussite, d'affinité de liaison et de diversité naturelle des séquences, créant ainsi les tout premiers lieurs protéiques filigranés et biologiquement fonctionnels. L'affinité de liaison a été mesurée en KD, les valeurs les plus faibles indiquant les lieurs les plus puissants.
Pour le repliement des protéines, SynthID Bio affine une petite partie du réseau de diffusion d'AlphaFold 3, en intégrant directement la capacité de filigranage dans les poids du modèle. Cela garantit que les coordonnées 3D prédites portent intrinsèquement une signature détectable, quel que soit l'utilisateur du modèle. Selon l'entreprise, la technique préserve la précision de prédiction d'AlphaFold 3 tout en offrant une détectabilité quasi parfaite, en maintenant les distributions des caractéristiques structurelles clés et en résistant au bruit numérique ou aux modifications mineures des coordonnées. L'équipe a illustré les résultats sur la protéine 7PPA, en présentant la structure prédite par AlphaFold 3 aux côtés de la structure de référence et de la structure filigranée.
Renforcer la biosécurité et l'intégrité de l'information
La biosécurité repose sur des défenses en couches — un modèle de « gruyère » dans lequel plusieurs mesures de sécurité indépendantes agissent conjointement pour couvrir les angles morts les unes des autres. Des dispositifs tels que les mesures d'atténuation au niveau des modèles et la vérification des clients représentent chacun des couches critiques présentant d'éventuelles lacunes. Dans le cadre de la vision plus large de Google DeepMind en matière de résilience biologique, l'approche de filigranage de SynthID Bio constitue une couche de vérification importante et tangible, intégrée directement dans la conception biologique elle-même.
SynthID Bio est une pièce importante du puzzle pour suivre la provenance des conceptions biologiques », a déclaré Sarah Carter, experte en politiques de biosécurité et associée chez Science Policy Consulting, qui a examiné ces travaux. « En reliant les conceptions au développeur du modèle, ces filigranes permettent aux développeurs de jouer un rôle de premier plan en matière de sécurité et permettent aux fournisseurs de synthèse de rationaliser le criblage pour les clients ayant utilisé ces modèles. »
Cette couche est particulièrement vitale pour le criblage de synthèse d'ADN, qui est en première ligne de la biosécurité. La conversion de conceptions protéiques numériques en molécules physiques nécessite de passer commande auprès de fournisseurs de synthèse d'ADN, qui contrôlent les demandes par rapport à des bases de données de menacesues. Historiquement, une séquence inconnue pouvait être présumée, à juste titre, être un organisme naturel non encore découvert. Mais comme l'IA peut créer des séquences entièrement nouvelles avec peu de ressemblance aux dangers connus, les contrôleurs ne peuvent plus faire cette hypothèse. Vérifier qu'une commande inconnue n'est pas une menace d'ingénierie exige des révisions manuelles exhaustives qui peuvent freiner des recherches essentielles. Dans ce contexte, SynthID Bio peut fournir un signal de vérification automatisé, prouvant qu'une commande provient d'un modèle fiable doté de dispositifs de sécurité intégrés.
« L'IA élargit ce que les scientifiques peuvent concevoir, et les entreprises de synthèse d'ADN ont un rôle important à jouer pour aider cette innovation à évoluer de manière responsable », a déclaré James Diggans, vice-président, Politique et Biosécurité chez Twist Bioscience, qui a fourni des retours précoces sur l'article. « Pour Twist, le filigranage constitue un ajout prometteur à la boîte à outils de biosécurité qui pourrait renforcer le criblage, concentrer les ressources sur les séquences justifiant un examen plus approfondi et rendre la biosécurité plus efficace à mesure que la biologie conçue par IA continue de progresser. »
De la même manière, SynthID Bio pourrait contribuer à préserver l'intégrité de bases de données telles que la Protein Data Bank, UniProt et GenBank. Ces bases de données, dont beaucoup sont ouvertes aux soumissions du public, jouent un rôle essentiel dans les avancées scientifiques — mais les entrées mal étiquetées peuvent avoir un impact négatif disproportionné sur les décisions de biosécurité, un défi qui pourrait s'amplifier avec l'ajout de données biologiques générées par IA. Dans le cadre du processus de soumission, SynthID Bio pourrait contribuer à garantir que les entrées synthétiques soient correctement étiquetées ou signalées pour examen plus approfondi.
Perspectives
Bien qu'aucune intervention de biosécurité prise isolément ne soit une solution miracle, SynthID Bio apporte SynthID — l'outil de filigranage éprouvé de Google DeepMind — à la biologie de synthèse, marquant un premier pas important vers l'identification et le suivi fiables des séquences et structures biologiques générées par IA.
À l'avenir, les défis clés incluent le renforcement de la robustesse du filigrane face aux tentatives de falsification délibérée. SynthID Bio peut également être associé à des approches de métadonnées de provenance — similaires à C2PA pour les médias numériques — ou à des référentiels centralisés de données biologiques générées par IA afin de mieux identifier et suivre les protéines générées par IA.
Pour suivre les capacités croissantes des technologies d'IA de pointe, Google DeepMind étudie également comment appliquer le filigranage à des objets biologiques plus complexes. Dans le cadre de travaux en cours avec le laboratoire de Hie à l'Université Stanford et l'Arc Institute, l'équipe intégré SynthID Bio dans Evo 2, un modèle génomique avancé, afin de filigraner le génome d'un bactériophage conçu par Evo 2. Les premiers tests en laboratoire sur des cultures bactériennes ont confirmé que ces bactériophages filigranés sont fonctionnels. Google DeepMind a indiqué que ces travaux ont le potentiel de traiter certains risques de biosécurité associés à la conception de génomes et que davantage de détails seront communiqués prochainement dans un manuscrit technique.
La concrétisation de tous les bénéfices de ces travaux en matière de biosécurité nécessitera une collaboration communautaire et des recherches supplémentaires. Dans le cadre de son engagement en faveur d'une innovation responsable, l'entreprise publie son article de méthodes, publie le code et les données in vitro en open source et met les poids du modèle à disposition de la communauté de recherche. Google DeepMind a déclaré vouloir travailler ouvertement avec des partenaires dans les domaines de la biosécurité, de la synthèse génétique et des politiques publiques afin de garantir que la sécurité et la responsabilité suivent le rythme des découvertes portées par l'IA. Les parties intéressées par un partenariat sur ce sujet sont invitées à contacter l'équipe à synthidbio@google.com avec une proposition générale, en s'abstenant de divulguer toute information confidentielle ou propriétaire.
Remerciements
Le projet a été initié par Pushmeet Kohli. La recherche et le développement technique ont été menés par Alexander I. Cowen-Rivers et David Stutz, avec Kohli comme conseiller. Les contributions clés en ingénierie et en recherche ont été apportées par Guillermo Ortiz-Jimenez, Jeremy Ratcliff, Vinicius Zambaldi, Lindsay Willmore, Josh Abramson, Harshnira Patani, Christina Kouridi, Florian Stimberg, Mel Vecerik, Alex Chu, Sukhdeep Singh, Sumanth Dathathri, Eliseo Papa, Valentin De Bortoli, Arnaud Doucet, Jue Wang et Sven Gowal. L'équipe a remercié Adaptyv Bio pour son aide à la validation in vitro.
L'extension de ces travaux au filigranage de l'ADN des bactériophages est une collaboration entre Google DeepMind et le laboratoire de Hie à Stanford et l'Arc Institute, avec les contributions clés de Jeremy Ratcliff, Aleks Petrov, Alexander I. Cowen-Rivers, David Stutz, Elisa L. H. Wong, Victor Martin Palacios, Francesca Pietra, Alfred Piccioni, Tristan Oliver Kwan, Tor Lattimore, Sumanth Dathathri et Pushmeet Kohli de Google DeepMind, ainsi que de Brian Hie, Samuel King et Aditi Merchant de l'Arc Institute et de Stanford.
Google DeepMind a également remercié Rudy Bunel, Anna Cupani, Rob Fergus, Thomas Frerix, Sahra Ghalebikesabi, John Jumper, Jacob Kelly, David La, Victor Martin, Sebastian Nowozin, Stig Petersen, Aleks Petrov, Uchechi Okereke, Sylvestre-Alvise Rebuffi, Rosalia Schneider, Armin Senoner, Richard Shuai, Ashok Thillaisundaram, Elisa L. H. Wong, Zachary Wu et Augustin Žídek pour leurs contributions à l'article de recherche, et Julien Bergeron pour sa contribution au rendu 3D. L'équipe a enfin remercié Demis Hassabis pour son encouragement et son soutien à ce projet.