AlphaProtein Novo de Google DeepMind conçoit des enzymes pour des réactions que la nature n'a jamais développées
Points clés
- •Google DeepMind, en collaboration avec Caltech et l'Université de Pittsburgh, a présenté AlphaProtein Novo, un pipeline d'apprentissage automatique qui construit des enzymes à partir de principes fondamentaux plutôt que d'optimiser des protéines déjà existantes dans la nature.
- •Sur cinq réactions cibles, les chercheurs ont évalué plus de 5 600 conceptions candidates et enregistré des taux de réussite allant jusqu'à 80 %, ainsi que des efficacités catalytiques à l'état de l'art obtenues sans optimisation expérimentale itérative.
- •GDM_NT_270, la principale nitrene transférase de novo, a offert une sélectivité de 99:1 pour le cycle de pipéridine à six chaînons avec un excès énantiomérique de 94 % et 22 turnovers, inversant la préférence pour la pyrrolidine qu'affichent les enzymes à hème naturelles.
- •AP Novo a généré sept nouvelles familles structurales d'enzymes capables de dégrader le plastifiant DEHP, alors qu'un criblage récent de 65 estérases naturelles n'avait révélé qu'une seule DEHPase active.
- •Exiger que chaque variante reséquencée par LigandMPNN d'un squelette passe des filtres inspirés du mécanisme a multiplié par 30 les taux de réussite des estérases à sérine, et l'ajout d'un ré-échantillonnage par diffusion partielle a porté les taux de réussite rétrospectifs à 80 %.

Google DeepMind a présenté AlphaProtein Novo (AP Novo), un pipeline d'apprentissage automatique pour la conception de novo d'enzymes. Selon une prépublication mise en ligne cette semaine sur bioRxiv, le système démontre pour la première fois que des enzymes conçues par calcul peuvent surpasser l'exploration de séquences naturelles sur des réactions chimiques complexes. Développé conjointement avec Caltech et l'Université de Pittsburgh, AP Novo construit des enzymes à partir de principes fondamentaux plutôt que d'optimiser des protéines existantes, répondant ainsi à un goulot d'étranglement de longue date dans la découverte de biocatalyseurs. La découverte naturelle d'enzymes dépendant de séquences déjà produites par l'évolution, les réactions jamais adoptées par les organismes vivants offrent peu de matière à explorer — c'est précisément la lacune qu'une approche à partir de zéro vise à combler.
Au cœur du pipeline se trouve le scaffolding de motifs. Un modèle de diffusion co-génère des structures protéiques et des séquences d'acides aminés autour d'un motif catalytique — l'agencement des chaînes latérales et des ligands requis pour un mécanisme réactionnel hypothétique. Les conceptions candidates sont ensuite filtrées à l'aide de métriques dérivées des prédictions d'AlphaFold 3, qui évaluent les détails atomiques pertinents sur le plan mécanistique, tels que la géométrie entre une base catalytique et son substrat. Au total, l'équipe a testé plus de 5 600 conceptions sur cinq réactions, rapportant des taux de réussite allant jusqu'à 80 % dans les meilleures facettes de conception et des efficacités catalytiques à l'état de l'art sur des réactions de référence, sans optimisation expérimentale itérative.
Deux applications phares illustrent l'étendue de l'approche. La première cible des nitrene transférases quiétisent des pipéridines, un hétérocycle présent dans de nombreux médicaments approuvés par la FDA. La cyclisation compétitive d'un substrat peut produire soit un cycle de pyrrolidine à cinq chaînons, soit un cycle de pipéridine à six chaînons, et les enzymes à hème naturelles favorisent fortement la première. Le criblage de 188 variantes naturelles et conçues n'a révélé aucune enzyme dépassant un rapport pipéridine/pyrrolidine de 30:70. La conception de novo principale, GDM_NT_270, a atteint une régiosélectivité de 99:1 pour la pipéridine avec un excès énantiomérique de 94 % — une mesure de l'exclusivité avec laquelle une molécule est produite sous une seule forme miroir, une variable de pureté importante dans la synthèse de médicaments — et 22 turnovers, inversant le biais naturel grâce à un contrôle direct de la géométrie du site actif.
La deuxième application ciblait le phtalate de di(2-éthylhexyle) (DEHP), un plastifiant omniprésent et contaminant environnemental perturbateur endocrinien dont les chaînes latérales volumineuses et l'insolubilité dans l'eau neutralisent la plupart des hydrolases naturelles. Un criblage récent de 65 estérases naturelles n'a identifié qu'une seule DEHPase active ; AP Novo, en revanche, a produit sept nouvelles familles structurales capables d'effectuer la réaction, avec un taux de réussite de 11 % pour les scaffolds nouveaux (39 % pour les scaffolds recyclés). Bien que les conceptions restent moins actives que les enzymes naturelles en conditions aqueuses, elles présentent des propriétés rares dans la nature : une enzyme de 191 résidus était 14 fois plus active à 90 °C qu'à température ambiante et restait fonctionnelle dans 75 % d'acétonitrile — des conditions qui dénaturent complètement les estérases naturelles. Une telle robustesse a un poids pratique, car les températures élevées accélèrent les réactions et les solvants organiques aident à dissoudre les substrats insolubles dans l'eau comme le DEHP. Sa petite taille et son expression élevée dans E. coli réduisent encore les coûts de production.
Les ensembles de séquences comme signal clé
L'apport méthodologique principal de l'étude concerne le filtrage. Les chercheurs ont constaté que l'évaluation d'ensembles de séquences dérivées de LigandMPNN sur le même squelette — en exigeant que chaque variante reséquencée passe des filtres inspirés du mécanisme — amplifiait considérablement le pouvoir prédictif, multipliant par 30 les taux de réussite des estérases à sérine. En combinant cela avec un ré-échantillonnage par diffusion partielle du squelette, les taux de réussite rétrospectifs ont atteint 60 % pour les Kemp éliminases et 80 % pour les estérases à sérine. Les auteurs estiment que cela explique pourquoi les pipelines de reconception itérative fonctionnent : ils sélectionnent implicitement des squelettes dont l'espace local séquence-structure soutient largement la géométrie catalytique visée.
Des limites persistent. Les activités catalytiques restent de plusieurs ordres de grandeur inférieures à celles des enzymes naturelles ou optimisées par évolution dirigée, la construction motifs exige une expertise spécifique à chaque réaction, et les modèles ne saisissent pas encore de manière significative la physique de la catalyse. Néanmoins, avec le code et les poids mis à disposition pour un usage non commercial — un accès qui permet à des groupes de recherche externes d'appliquer le pipeline aux réactions cibles de leur choix — AP Novo signale que la conception générative de protéines mûrit pour devenir un complément pratique — et, dans certains cas, une alternative — à l'exploration de la biodiversité naturelle.
Source : Metaverse