Google's Gemini-agenten leveren nieuwe bewijzen voor vijf onopgeloste wiskundige problemen
Belangrijkste punten
- •AlphaProof Nexus, een DeepMind-framework aangedreven door Gemini 3.1 Pro, draait meerdere onafhankelijke prover-subagenten die iteratief redeneren en herzien tot een bewijs de geautomatiseerde, machinecontroleerbare verificatie doorstaat.
- •Het framework loste 9 van de 353 eerder onopgeloste Erdős-problemen op, waaronder twee die wiskundigen 56 jaar lang voor raadselselden, en bewees 44 van de 492 vermoedens opgenomen in de Online Encyclopedia of Integer Sequences.
- •Elke oplossing kwam tegen rekenkosten van slechts enkele honderden dollars, en domeinexperts die het arXiv-paper uit medio 2026 beoordeelden, bevestigden zowel de bewijzen als de getrouwe formalisering van de oorspronkelijke vermoedens.
- •Aletheia, een semi-autonome onderzoeksassistent gebouwd op Gemini Deep Think, heeft sinds de inzet in december 2025 ongeveer 700 open Erdős-problemen beoordeeld en voor 13 oplossingen geleverd, waarvan vier autonome oplossingen die eerder nog niet bestonden.
- •Gemini Deep Think behaalde 35 van 42 punten op de Internationale Wiskunde Olympiade van 2025 en bereikte de gouden-medaille-norm door vijf van de zes problemen op te lossen binnen de standaardtijdslimieten.

De op Gemini gebaseerde wiskundige agenten van Google hebben bewijzen geleverd voor vijf eerder onopgeloste wiskundige problemen, met teams van AI-agenten waarvan het werk wordt beoordeeld door streng geautomatiseerde verificatoren.
De best gedocumenteerde implementatie van deze aanpak is een framework dat DeepMind AlphaProof Nexus noemt. Het draait meerdere onafhankelijke prover-subagenten in meerstaps-redeneerlussen, aangedreven door Gemini 3.1 Pro. De agenten produceren niet één antwoord en stoppen daarmee; ze redeneren, herzien en proberen het opnieuw over meerdere rondes tot een bewijs de geautomatiseerde verificatoren doorstaat of faalt. Dat ontwerp betekent dat acceptatie afhangt van machinecontroleerbare verificatie in plaats van het vertrouwen van een model in de eigen uitkomst.
De cijfers achter de resultaten
AlphaProof Nexus loste 9 van de 353 eerder onopgeloste Erdős-problemen op — open vragen gesteld door Paul Erdős, de productieve Hongaarse wiskundige uit de twintigste eeuw die bekendstaat om het koppelen van geldprijzen aan zijn problemen — waarvan twee wiskundigen 56 jaar lang voor raadsels stelden. Hetzelfde framework bewees 44 van de 492 vermoedens opgenomen in de Online Encyclopedia of Integer Sequences, bekend als OEIS, een langlopende referentie waarin wiskundigen patronen in gehele getallen catalogiseren. De resultaten werden behaald tegen rekenkosten van slechts enkele honderden dollars per probleem.
Een gedetailleerd arXiv-paper waarin het werk werd beschreven, verscheen rond medio 2026. Domeinexperts beoordeelden de resultaten en bevestigden zowel de bewijzen als de getrouwe formalisering van de oorspronkelijkemoedens. Formalisering betekent het vertalen van een door mensen geschreven wiskundig probleem naar precieze, machinecontroleerbare taal, en een slordige vertaling kan betekenen dat het verkeerde statement wordt bewezen. Die expertgoedkeuring is belangrijk: het adressereert de terugkerende vraag of door AI gegenereerde wiskunde daadwerkelijk correct is of slechts overtuigend.
Aletheia en de olympiade-prestatie
Een afzonderlijk systeem, Aletheia, gebouwd op Gemini Deep Think, fungeert als semi-autonome onderzoeksassistent. Sinds de inzet in december 2025 heeft Aletheia ongeveer 700 open Erdős-problemen beoordeeld en voor 13 daarvan oplossingen geïdentificeerd of gecreëerd, wat lof oogstte van expertrecensenten. Vier van die 13 waren autonome oplossingen die eerder nog niet bestonden.
Gemini Deep Think heeft ook een wedstrijdtrackrecord. Op de Internationale Wiskunde Olympiade van 2025, de jaarlijkse wedstrijd die algemeen wordt beschouwd als de zwaarste wiskundewedstrijd voor pre-universitaire studenten, behaalde het 35 van de 42 punten en bereikte het de gouden-medaille-norm, waarbij het 5 van de 6 problemen oploste binnen de standaardtijdslimieten waarmee menselijke deelnemers ook worden geconfronteerd.
Waarom de agentische aanpak aandacht trekt
Pushmeet Kohli en andere DeepMind-onderzoekers hebben benadrukt dat de agentische aanpak zich kan uitstrekken tot verder dan de zuivere wiskunde. Ze wezen op vakgebieden zoals combinatoriek en kwantumoptica als potentiële doelgebieden, en het onderzoek benadrukt ook toepassingen in algebraïsche meetkunde. De gemeenschappelijke noemer is dat dit domeinen zijn waarin een geclaimd resultaat kan worden getoetst aan objectieve criteria — precies de omstandigheden waaronder deze agent-plus-verificator-opzet meetbare resultaten heeft laten zien.
Wat dit betekent voor wiskunde en AI
De bevindingen wijzen erop dat het combineren van agent-gebaseerd redeneren met geautomatiseerde verificatie toepassingen kan hebben ver buiten de bestudeerde problemen, al merkt het onderzoek op dat huidige AI-systemen nog steeds menselijk toezicht vereisen voor het beoordelen van nieuwheid, wat betekent dat mensen moeten bevestigen of een resultaat daadwerkelijk nieuw is. Die human-in-the-loop-eis geeft richting aan wat hierna te volgen: hoe het framework presteert in de vakgebieden die DeepMind heeft aangewezen, en of expertrecensenten de output blijven certificeren, zal bepalen hoeveel van dit momentum doordringt tot de bredere onderzoekspraktijk.