Google liefert Gemini 3.7 Flash aus, während OpenAI das 14x schnellere GPT-5.6 Sol Ultrafast vorstellt
Wichtige Erkenntnisse
- •Gemini 3.7 Flash ist allgemein verfügbar und kann in mehr als 160 Ländern genutzt werden.
- •Das Modell akzeptiert bis zu eine Million Eingabe-Tokens und kann Text, Bilder, Video, Audio, PDFs und Tool-Aufrufe verarbeiten.
- •Nach Angaben von Google erledigte Gemini 3.7 Flash seine Test-Programmieraufgabe in 2 Minuten und 13 Sekunden – schneller als das bisherige Flash-Modell.
- •OpenAI hat GPT-5.6 Sol Ultrafast als API-Stufe ausschließlich auf Einladung vorgestellt, die Cerebras-Chips nutzt und bis zu 750 Ausgabe-Tokens pro Sekunde erreicht.
- •Google hat Gemini 3.7 Flash bis zum Jahresende mit 75 Cent pro Million Eingabe-Tokens und 3,75 US-Dollar pro Million Ausgabe-Tokens bepreist, bevor die Sätze am 31. Dezember steigen.

Google hat am Donnerstag Gemini 3.7 Flash gestartet, ein kostengünstiges Modell für Programmierung und Agenten, das ab sofort allgemein verfügbar ist. Am selben Tag stellte OpenAI GPT-5.6 Sol Ultrafast vor, eine von Cerebras-Chips unterstützte Servicestufe, die ihr leistungsstärkstes Modell bis zu 14x schneller ausführt. Das Geschwindigkeitsrennen hat sich von reiner Intelligenz zu Echtzeit-Agenten verlagert – doch heute erreicht nur Googles Modell jeden Entwickler.
Google und OpenAI verbreiteten dieselbe Botschaft: KI ist inzwischen schnell genug, um Nutzer von KI-Agenten zu beeindrucken – beide Unternehmen kündigten ultraschnelle Modelle an. Die beiden Starts sind unterschiedlich aufgebaut, und nur einer davon ist heute tatsächlich in den Händen von Entwicklern. Der Fokus auf Geschwindigkeit hat strukturelle Gründe: Agenten können viele Modellaufrufe hintereinander verketten – planen, Tools aufrufen, Ergebnisse prüfen –, sodass sich die Latenz pro Aufruf über eine gesamte Aufgabe hinweg aufsummiert.
Google hat Gemini 3.7 Flash ausgeliefert, sein neuestes, auf Softwareprogrammierung und autonome Geschäftsprozesse abgestimmtes Modell. OpenAI hat eine begrenzte Vorschau von GPT-5.6 Sol Ultrafast eröffnet, einer neuen Servicestufe, die ihr leistungsstärkstes Modell mit bis zu 750 Ausgabe-Tokens pro Sekunde ausführt.
Today we're introducing Gemini 3.7 Flash, our most intelligent workhorse model yet for coding and agents. This model brings substantial gains across software engineering, web development, and complex knowledge work. Now through the end of the year, Gemini 3.7 Flash is available… pic.twitter.com/RSCBDipjKn
— Google (@Google) August 13, 2026 (X post)
Gemini 3.7 Flash ist ein allgemein verfügbares Modell. Es akzeptiert bis zu eine Million Eingabe-Tokens – rund 750.000 Wörter – und gibt 64.000 zurück; es verarbeitet Text, Bilder, Video, Audio und PDFs und kann Tools aufrufen sowie einen Computer steuern. Google positioniert es als günstiges Gehirn für autonome Systeme, die Aufgaben planen und mehrstufige Arbeiten mit weniger menschlicher Hilfe abschließen.
Das Modell opfert die Qualität nicht zugunsten der Geschwindigkeit. Es ist zugleich leistungsfähiger und effizienter: Es erledigte Googles Test-Programmieraufgabe in 2 Minuten und 13 Sekunden, während das neueste Flash-Modell dafür mehr als 5 Minuten benötigte. Auch der Qualitätsunterschied zwischen beiden ist deutlich spürbar.
OpenAIs Ultrafast ist kein neues Modell. Es ist GPT-5.6 Sol – dasselbe Modell, das OpenAI vor dem Start mithilfe eines KI-Red-Teams gegen Prompt-Injection-Angriffe gehärtet hat – auf einer schnelleren Basis, angetrieben vom Chiphersteller Cerebras. Es ist rund 14-mal schneller als die Standardgeschwindigkeit von GPT-5.6 Sol selbst.
Previewing Ultrafast mode: GPT-5.6 Sol at up to 14x the speed. Launching first in the OpenAI API to a select group of customers with expanded access to more businesses as capacity grows. pic.twitter.com/a5dleofiDJ
— OpenAI (@OpenAI) August 13, 2026 (X post)
Cerebras' Wafer-Scale-Chips (Prozessoren, die nahezu in der Größe eines gesamten Silizium-Wafers gefertigt werden, statt der vielen kleinen Chips, die üblicherweise daraus geschnitten werden) erzeugen bis zu 750 Tokens pro Sekunde – etwa 560 Wörter –, schnell genug, dass ein Sprach-Agent mitten im Gespräch denken kann.
Die Zahlen, die zählen
Googles eigene Benchmark-Übersicht setzt Gemini 3.7 Flash in 11 von 18 getesteten Kategorien vor Claude Sonnet 5, GPT-5.6 Terra und weitere Modelle, darunter ein Spitzenwert von 1.588 Elo im Bereich Webentwicklung der Code Arena und 30,4 % bei AutomationBench für Unternehmensworkflows. All dies basiert auf Googles Methodik, sodass der Vorsprung als Angabe des Unternehmens zu werten ist.
Wie jedes Gemini-Flash-Modell ist es zudem günstig. Mit 75 Cent pro Million Eingabe-Tokens und 3,75 US-Dollar pro Million Ausgabe-Tokens bis zum Jahresende kostet es die Hälfte des ursprünglichen Preises von Gemini 3.6 Flash. Dieser Einführungspreis läuft am 31. Dezember aus und verdoppelt sich dann auf 1,50 und 7,50 US-Dollar – was für ein Google-Modell weiterhin günstig ist.
OpenAI hat für Ultrafast außer Kundenzitaten keine direkten Vergleichswerte veröffentlicht. John Crepezzi, KI-Ingenieur bei Jane Street, sagte in OpenAIs Ankündigung, die Geschwindigkeit von Cerebras „eröffnet neue Möglichkeiten, die Modelle einzusetzen“. Courtland Lykins, Product Lead bei Podium, nannte sie „unschätzbar wertvoll in unserem Voice-Stack“ und sagte, die Geschwindigkeit „verändert das Anruferlebnis vollständig“. Die Stufe ist vorerst nur auf Einladung zugänglich.
Der Vorstoß zu mehr Geschwindigkeit kommt, während die KI-Labore vom Wettstreit darum, wer die klügste KI hat, zu der Frage übergehen, wer schnell genug für Agenten ist. Googles Timing ist auffällig: Das Flaggschiff Gemini 3.5 Pro fehlt weiterhin, ohne dass ein Veröffentlichungstermin genannt wurde – drei Wochen nach 3.6 Flash und wenige Tage nach einer Führungsumstrukturierung bei DeepMind, bei der Demis Hassabis zugunsten seines Stellvertreters Koray Kavukcuoglu verdrängt wurde. OpenAI wiederum mietet die Geschwindigkeit von Cerebras, statt auf die eigene Infrastruktur zu warten.
Gemini 3.7 Flash ist ab sofort in mehr als 160 Ländern live; GPT-5.6 Sol Ultrafast bleibt auf Einladung beschränkt.