Les agents Gemini de Google produisent de nouvelles démonstrations pour cinq problèmes mathématiques non résolus
Points clés
- •AlphaProof Nexus, un framework de DeepMind propulsé par Gemini 3.1 Pro, exécute plusieurs sous-agents démontreurs indépendants qui raisonnent et révisent de manière itérative jusqu'à ce qu'une démonstration passe une vérification automatisée vérifiable par machine.
- •Le framework a résolu 9 des 353 problèmes d'Erdős jusque-là non résolus, dont deux qui résistaient aux mathématiciens depuis 56 ans, et a démontré 44 des 492 conjectures répertoriées dans l'Online Encyclopedia of Integer Sequences.
- •Chaque solution a coûté seulement quelques centaines de dollars en calcul, et les experts du domaine qui ont examiné l'article arXiv de mi-2026 ont confirmé à la fois les démonstrations et la fidèle formalisation des conjectures d'origine.
- •Aletheia, un assistant de recherche semi-autonome construit sur Gemini Deep Think, a évalué environ 700 problèmes d'Erdős ouverts depuis son déploiement en décembre 2025 et produit des solutions pour 13 d'entre eux, dont quatre étaient des résolutions autonomes inédites.
- •Gemini Deep Think a obtenu 35 points sur 42 à l'Olympiade internationale de mathématiques 2025, atteignant le niveau médaille d'or en résolvant cinq des six problèmes dans les limites de temps standard.

Les agents mathématiques propulsés par Gemini de Google ont produit des démonstrations pour cinq problèmes mathématiques jusque-là non résolus, en s'appuyant sur des équipes d'agents IA dont le travail est évalué par des vérificateurs automatisés sans complaisance.
La mise en œuvre la mieux documentée de cette approche est un framework que DeepMind appelle AlphaProof Nexus. Il exécute plusieurs sous-agents démontreurs indépendants dans des boucles de raisonnement à plusieurs tours, propulsés par Gemini 3.1 Pro. Les agents ne produisent pas une seule réponse puis s'arrêtent là ; ils raisonnent, révisent et réessaient sur plusieurs rounds jusqu'à ce qu'une démonstration passe les vérificateurs automatisés ou échoue. Cette conception signifie que l'acceptation repose sur une vérification vérifiable par machine plutôt que sur la confiance d'un modèle dans sa propre production.
Les chiffres derrière les résultats
AlphaProof Nexus a résolu 9 des 353 problèmes d'Erdős jusque-là non résolus — des questions ouvertes posées par Paul Erdős, le prolifique mathématicien hongrois du XXe siècle connu pour avoir attaché des prix en argent à ses problèmes — dont deux résistaient aux mathématiciens depuis 56 ans. Le même framework a démontré 44 des 492 conjectures répertoriées dans l'Online Encyclopedia of Integer Sequences, connue sous le nom d'OEIS, une référence de longue date où les mathématiciens recensent des motifs entiers. Les résultats ont été obtenus pour un coût de calcul de seulement quelques centaines de dollars par problème.
Un article arXiv détaillé décrivant ce travail a été publié vers le milieu de l'année 2026. Des experts du domaine ont examiné les résultats et confirmé à la fois les démonstrations et la fidèle formalisation des conjectures d'origine. La formalisation désigne la traduction d'un problème mathématique rédigé par un humain en un langage précis vérifiable par machine, et une traduction imprécise peut signifier démontrer entièrement la mauvaise affirmation. Cette validation par des experts est importante : elle répond à la question récurrente de savoir si les mathématiques générées par l'IA sont réellement correctes ou simplement convaincantes.
Aletheia et le parcours olympique
Un système distinct, Aletheia, constr sur Gemini Deep Think, fonctionne comme un assistant de recherche semi-autonome. Depuis son déploiement en décembre 2025, Aletheia a évalué environ 700 problèmes d'Erdős ouverts et identifié ou créé des solutions pour 13 d'entre eux, ce qui lui a valu les éloges des évaluateurs experts. Quatre de ces 13 solutions étaient des résolutions autonomes inédites.
Gemini Deep Think affiche également un palmarès en compétition. À l'Olympiade internationale de mathématiques 2025, le concours annuel largement considéré comme la compétition de mathématiques la plus difficile pour les élèves du secondaire, il a obtenu 35 points sur 42, atteignant le niveau médaille d'or, et a résolu 5 des 6 problèmes dans les limites de temps standard auxquelles sont soumis les participants humains.
Pourquoi l'approche agentique attire l'attention
Pushmeet Kohli et d'autres chercheurs de DeepMind ont souligné que l'approche agentique pourrait s'étendre au-delà des mathématiques pures. Ils ont identifié des domaines tels que la combinatoire et l'optique quantique comme cibles potentielles, et la recherche met également en évidence des applications en géométrie algébrique. Le dénominateur commun est qu'il s'agit de domaines où un résultat revendiqué peut être testé selon des critères objectifs — exactement les conditions dans lesquelles cette configuration agent-plus-vérificateur a démontré des résultats mesurables.
Ce que cela signifie pour les mathématiques et l'IA
Ces résultats indiquent que l'association du raisonnement agentique à la vérification automatisée pourrait trouver des applications bien au-delà des problèmes étudiés, même si la recherche note que les systèmes d'IA actuels nécessitent encore une supervision humaine pour l'évaluation de la nouveauté, ce qui signifie que des humains doivent confirmer si un résultat est réellement nouveau. Cette exigence d'un humain dans la boucle délimite ce qu'il convient de surveiller désormais : la performance du framework dans les domaines signalés par DeepMind, et le fait que les évaluateurs experts continuent de certifier sa production, détermineront dans quelle mesure cette dynamique s'étendra à des pratiques de recherche plus larges.