Googles Gemini-Agenten liefern neue Beweise für fünf ungelöste mathematische Probleme
Wichtige Erkenntnisse
- •AlphaProof Nexus, eine auf Gemini 3.1 Pro basierende DeepMind-Framework, betreibt mehrere unabhängige Beweis-Subagenten, die iterativ argumentieren und überarbeiten, bis ein Beweis die automatisierte, maschinenprüfbare Verifikation besteht.
- •Die Framework löste 9 von 353 zuvor ungelösten Erdős-Problemen, darunter zwei, die Mathematiker 56 Jahre lang widerstanden hatten, und bewies 44 von 492 Vermutungen aus der Online Encyclopedia of Integer Sequences.
- •Jede Lösung entstand bei Rechenkosten von nur wenigen hundert Dollar, und Fachexperten, die die arXiv-Studie von Mitte 2026 prüften, bestätigten sowohl die Beweise als auch die getreue Formalisierung der ursprünglichen Vermutungen.
- •Aletheia, ein auf Gemini Deep Think basierender semi-autonomer Forschungsassistent, hat seit seinem Einsatz im Dezember 2025 rund 700 offene Erdős-Probleme bewertet und für 13 Lösungen erstellt, vier davon waren neuartige autonome Lösungen.
- •Gemini Deep Think erzielte bei der Internationalen Mathematik-Olympiade 2025 35 von 42 Punkten und erreichte Goldmedaille-Niveau, indem es fünf von sechs Problemen innerhalb der Standardzeitlimits löste.

Die von Googles Gemini angetriebenen Mathematik-Agenten haben Beweise für fünf bislang ungelöste mathematische Probleme erbracht – mit Teams von KI-Agenten, deren Arbeit von kompromisslosen automatisierten Prüfsystemen bewertet wird.
Am besten dokumentiert ist dieser Ansatz in einer Framework, die DeepMind AlphaProof Nexus nennt. Sie betreibt mehrere unabhängige Beweis-Subagenten in mehrstufigen Reasoning-Schleifen, angetrieben von Gemini 3.1 Pro. Die Agenten liefern nicht eine einzige Antwort und hören dann auf; sie argumentieren, überarbeiten und versuchen es über mehrere Runden erneut, bis ein Beweis die automatisierten Prüfungen entweder besteht oder scheitert. Dieses Design bedeutet, dass die Annahme von maschinenprüfbarer Verifikation abhängt und nicht vom Vertrauen eines Modells in seine eigene Ausgabe.
Die Zahlen hinter den Ergebnissen
AlphaProof Nexus löste 9 von 353 zuvor ungelösten Erdős-Problemen – offene Fragen, die Paul Erdős, der produktive ungarischeematiker des 20. Jahrhunderts, bekannt dafür, dass er an seine Probleme Geldpreise knüpfte, formuliert hatte –, zwei davon hatten Mathematiker 56 Jahre lang vor Rätsel gestellt. Dieselbe Framework bewies 44 von 492 Vermutungen aus der Online Encyclopedia of Integer Sequences, bekannt als OEIS, einem langjährig geführten Referenzwerk, in dem Mathematiker ganzzahlige Muster katalogisieren. Die Ergebnisse entstanden bei Rechenkosten von nur wenigen hundert Dollar pro Problem.
Eine ausführliche arXiv-Studie zu der Arbeit wurde etwa Mitte 2026 veröffentlicht. Fachexperten prüften die Ergebnisse und bestätigten sowohl die Beweise als auch die getreue Formalisierung der ursprünglichen Vermutungen. Formalisierung bezeichnet die Übersetzung eines von Menschen formulierten mathematischen Problems in eine präzise, maschinenprüfbare Sprache, und eine ungenaue Übersetzung kann bedeuten, dass am Ende die falsche Aussage bewiesen wird. Diese Expertenfreigabe ist wichtig: Sie adressiert die wiederkehrende Frage, ob KI-generierte Mathematik wirklich korrekt oder nur überzeugend ist.
Aletheia und die Olympiade-Bilanz
Ein separates System namens Aletheia, das auf Gemini Deep Think basiert, fungiert als semi-autonomer Forschungsassistent. Seit seinem Einsatz im Dezember 2025 hat Aletheia rund 700 offene Erdős-Probleme bewertet und für 13 davon Lösungen identifiziert oder erstellt, was Anerkennung von Expertenprüfern erhielt. Vier dieser 13 waren neuartige autonome Lösungen.
Gemini Deep Think kann zudem eine Wettkampf-Bilanz vorweisen. Bei der Internationalen Mathematik-Olympiade 2025, dem jährlich stattfindenden Wettbewerb, der allgemein als härtester Mathematikwettbewerb für Schüler vor dem Hochschulstudium gilt, erreichte es 35 von 42 Punkten und damit Goldmedaille-Niveau und löste 5 von 6 Problemen innerhalb der Standardzeitlimits, unter denen auch menschliche Teilnehmende antreten.
Warum der agentenbasierte Ansatz Aufmerksamkeit erfährt
Pushmeet Kohli und andere DeepMind-Forscher haben betont, dass sich der agentenbasierte Ansatz über die reine Mathematik hinaus ausweiten könnte. Als potenzielle Zielfelder nannten sie Bereiche wie Kombinatorik und Quantenoptik; die Studie verist zudem auf Anwendungen in der algebraischen Geometrie. Der gemeinsame Nenner: Es sind Domänen, in denen ein behauptetes Ergebnis an objektiven Kriterien getestet werden kann – genau die Bedingungen, unter denen dieser Agent-plus-Verifizierer-Aufbau messbare Ergebnisse gezeigt hat.
Was das für Mathematik und KI bedeutet
Die Ergebnisse zeigen, dass die Kombination aus agentenbasiertem Reasoning und automatisierter Verifikation über die untersuchten Probleme hinaus Anwendung finden könnte; die Studie weist jedoch darauf hin, dass heutige KI-Systeme weiterhin menschlicher Kontrolle bei der Bewertung der Neuheit bedürfen, das heißt, Menschen müssen bestätigen, ob ein Ergebnis wirklich neu ist. Diese Anforderung an den Menschen in der Schleife umreißt, worauf es künftig ankommt: wie sich die Framework in den von DeepMind genannten Feldern schlägt und ob Expertenprüfer ihre Ergebnisse weiterhin zertifizieren, wird darüber entscheiden, wie viel dieses Schwungs in die breitere Forschungspraxis getragen wird.