NachrichtenAktienxAI startet Grok 4.7 nach wiederholten Verzögerungen – bei Benchmarks hinter Frontier-Konkurrenz

xAI startet Grok 4.7 nach wiederholten Verzögerungen – bei Benchmarks hinter Frontier-Konkurrenz

Autor: Decrypt·

Wichtige Erkenntnisse

  • Grok 4.7 nutzt 2,1 Billionen Parameter, 40 % mehr als die 1,5 Billionen von Grok 4.6, und kostet 2 $ pro Million Eingabe-Token und 6 $ pro Million Ausgabe-Token.
  • xAI ergänzte das Training des Modells mit SpaceX-Daten, darunter Starlink-Satellitentelemetrie, Fertigungsunterlagen und Protokolle technischer Fehler, um das Reasoning über Hardware und physische Systeme zu verbessern.
  • Erste Benchmark-Ergebnisse platzieren Grok 4.7 hinter Claude Fable 5.1 bei GDPval (1695 vs. 1735) und AA-Briefcase (1657 vs. 1678) sowie hinter GPT-6 Astra beim EEBench-Test für Elektrotechnik.
  • Dem Launch gingen seit Ende Juli mindestens fünf korrigierte Veröffentlichungszeitpläne voraus; das Modell ist sofort ohne Warteliste in der Grok-App, in Cursor, in Grok Build und über die xAI-API verfügbar.
  • Musk sagte, Grok 4.7 werde ungefähr auf Augenhöhe mit Anthropics Claude Opus 5.0 liegen, und skizzierte kommende Modelle – Grok 4.8, Grok 4.9 und ein möglicher frontier-führender Grok 5 – ohne Veröffentlichungstermine zu nennen.
xAI startet Grok 4.7 nach wiederholten Verzögerungen – bei Benchmarks hinter Frontier-Konkurrenz

Elon Musks xAI hat am Montagmittag Grok 4.7 veröffentlicht, das leistungsfähigste Modell des Unternehmens bis dato, das das Unternehmen als „eine deutliche Verbesserung gegenüber Grok 4.6 bei gleichem Preis und Tempo“ bezeichnete.

Erste Benchmark-Ergebnisse platzieren das Modell hinter Claude Fable 5.1 bei GDPval und AA-Briefcase sowie hinter GPT-6 Astra bei EEBench, einem Benchmark für Elektrotechnik, auf dem zweiten Platz.

Dem Launch ging eine Reihe vertakter Termine voraus. Musk hatte den Zeitplan seit Ende Juli mindestens fünf Mal korrigiert: zunächst „in vier Wochen“, dann „ein paar Wochen“, dann „3 bis 4 Wochen“, dann „10 Tage“ am 1. September und schließlich „braucht noch ein paar Tage“ am 11. September.

Diesmal gibt es keine Warteliste. Grok 4.7 ist sofort in der Grok-App, in Cursor, in Grok Build und über die xAI-API verfügbar.

Musk kommentierte auf X nach und nannte Grok 4.7 „eine starke Kombination aus Intelligenz, Geschwindigkeit & niedrigen Kosten“.

Grok 4.7 is here. It's a notable improvement over Grok 4.6 at the same price and speed. pic.twitter.com/H3OTBbXyvO

SpaceXAI (@SpaceXAI) September 21, 2026

Laut xAIs offizieller Ankündigung beschäftigt sich das Modell länger mit schwierigen Problemen und überprüft seine eigenen Antworten häufiger als Grok 4.6 – begleitet von dem, was das Unternehmen seine bislang stärksten Sicherheitsmaßnahmen nennt.

Umfang, Preise und SpaceX-Daten

Grok 4.7 verfügt über 2,1 Billionen Parameter, 40 % mehr als die 1,5 Billionen von Grok 4.6, das selbst eine Verfeinerung von Grok 45 war. Die Kosten liegen bei 2 $ pro Million Eingabe-Token und 6 $ pro Million Ausgabe-Token. Parameter sind die internen Stellschrauben, die ein Modell während des Trainings justiert; mehr Parameter bedeuten in der Regel mehr Kapazität, Muster zu lernen, während Tokens die grundlegenden Informationseinheiten sind, die ein KI-Modell verarbeiten oder generieren kann.

xAI hat zudem zusätzliche Trainingsdaten von SpaceX, Musks Raketenunternehmen, einbezogen: Starlink-Satellitentelemetrie, Fertigungsunterlagen und Protokolle technischer Fehler. Das Versprechen: ein Modell, das bei Hardware und physischen Systemen besser reasonen kann als alles, was rein auf Internettexten trainiert wurde.

Benchmarks erzählen eine bekannte Geschichte

GDPval misst, wie ein Modell bei realer, wirtschaftlich wertvoller Wissensarbeit abschneidet – Rechtsgutachten, Tabellen, Präsentationen –, anhand von Aufgaben, die von aktiven Fachleuten des jeweiligen Bereichs geprüft wurden, und bewertet sie als Elo-Wertung, demselben Duell-Ranglistensystem, das auch im Schach verwendet wird. Grok 4.7 erreichte 1695 bei GDPval, während Claude Fable 5.1 mit 1735 die Spitze markierte – ein Abstand von 40 Punkten auf der Elo-Skala.

AA-Briefcase, entwickelt von Artificial Analysis, testet mehrstündige Büroarbeit, die Recherche, Analyse und Dokumentenerstellung zu einer langen Aufgabe verbindet, ebenfalls bewertet auf der Elo-Skala. Grok 4.7 erreichte 1657 gegenüber Fable 5.1s 1678 – ein geringerer Abstand von 21 Punkten, dasselbe Ergebnis bei einem anderen Test.

CursorBench 4.0, Cursors Benchmark für echte Programmieraufgaben in seinem Editor, stellt die Genauigkeit den Kosten und der Token-Anzahl pro Aufgabe gegenüber. Grok 4.7 landet im Mittelfeld: pro Aufgabe teurer als GPT-6 Astra, der Nachfolger von GPT-5.6 Sol, und Claude Sonnet 5, aber weiterhin hinter Fable 5.1, das an jedem Preispunkt der Grafik gewinnt.

Ein wiederkehrendes Muster bei xAI

Das Unternehmen hat wiederholt Flaggschiff-Modelle gestartet, die bei unabhängigen Bewertungen hinter der Konkurrenz zurückblieben. Grok 4.5 debütierte im Juli mit dem größten Trainingscluster der Branche und dritten Plätzen hinter den Modellen von Claude und OpenAI. Vor diesem handelte Grok 4.20 Zuverlässigkeit für Geschwindigkeit und Persönlichkeit ein, und Grok 4.6 lag beim Coding-Autonomiefähigkeiten ebenfalls hinter der Frontier-Gruppe.

Das alles macht Grok 4.7 nicht zu einem schlechten Produkt für die Millionen Menschen, die über X, die eigenständige App oder das Armaturenbrett ihres Tesla mit ihm sprechen. Es bedeutet jedoch, dass das Modell, das am ehesten die Fragen der Nutzer beantwortet – oder den Sprachassistenten ihres Autos antreibt –, auf einem System läuft das die Benchmarks seines eigenen Herstellers eine Stufe unter die Spitze der Leiter einordnen.

Genau deshalb ist für die meisten Menschen der Preis wichtiger als die Position auf der Rangliste. xAI unterbietet Anthropic und OpenAI konsequent bei den Kosten pro Token, selbst wenn es bei der Rohleistung zurückliegt – in der Wette, dass „gut genug, günstig und überall“ für den Großteil des Alltagsgebrauchs gegen „das Beste, aber teurere“ gewinnt.

Musks Erwartungen und der Weg nach vorn

Musk hatte die Erwartungen bereits Tage vor dem Launch gedämpft und auf X geschrieben, Grok 4.7 werde „ungefähr auf Augenhöhe“ mit Anthropics Claude Opus 5.0 liegen – nicht mit dem neueren Opus 5.1 –, wobei die multimodale Leistung noch Verbesserungsbedarf habe.

Im selben Beitrag skizzierte er die nächsten drei Modelle: Grok 4.8 als einen deutlichen Schritt nach vorn, Grok 4.9 in der „Astra-/Fable-Klasse“ und Grok 5 als möglichen Frontier-Führer. Für diese Upgrades gibt es noch keine Veröffentlichungstermine – ein Detail, das zusätzliches Gewicht bekommt, wenn man bedenkt, dass Grok 4.7s eigener Zeitplan vor dem Launch mindestens fünf Mal korrigiert wurde. „We shall see“, schrieb er.