xAI veröffentlicht Grok 4.7 mit neuen Sicherheitsmaßnahmen und höherer Leistung bei stundenlangen Aufgaben
Wichtige Erkenntnisse
- •Grok 4.7 basiert auf einem neuen, größeren Basismodell und wurde durch eine verlängerte Reinforcement-Learning-Phase mit schwierigeren Aufgaben trainiert, was laut xAI die Code-Generierung, den Umgang mit langen Kontexten und die Selbstverifikation verbessert.
- •Die größten Benchmark-Gewinne des Modells lagen bei lang andauernder Coding- und Terminal-Arbeit, mit einem Anstieg bei Terminal-Bench 4.0 von 20,3 % auf 38,0 % und bei CursorBench 4.0 von 40,4 % auf 46,3 %.
- •Grok 4.7 erscheint mit einem vollständig neuen Sicherheits-Stack, den xAI als seinen stärksten getesteten bei Verweigerungsverhalten und Jailbreak-Resistenz beschreibt, und führt LatchBios Biosafety-Benchmark mit 62,4 % an.
- •Die Preise bleiben auf dem Niveau von Grok 4.6 mit 2 US-Dollar pro Million Input-Token und 6 US-Dollar pro Million Output-Token und liegen damit unter den Tarifen von GPT-5.6 Sol und Fable 5.1.
- •Artificial Analysis bewertete Grok 4.7 mit 46 Punkten auf dem Intelligence Index, ein Plus von zwei Punkten, das SpaceXAI unter die vier führenden KI-Labore brachte, stellte jedoch fest, dass das Modell etwa 81.000 Output-Token pro Aufgabe verbrauchte, mehr als doppelt so viel wie Grok 4.6 mit 36.000, wodurch die effektiven Kosten steigen.

xAI hat Grok 4.7 veröffentlicht und beschreibt es als sein leistungsfähigstes Modell bisher für Coding- und Wissensarbeit. Das Unternehmen positionierte das Modell als Frontier-Angebot zu einem wettbewerbsfähigen Preis, wobei die Preise gegenüber dem Vorgänger Grok 4.6 unverändert bleiben.
Grok 4.7 basiert auf einem neuen, größeren Basismodell und wurde durch eine verlängerte Reinforcement-Learning-Phase mit einer schwierigeren Aufgabenmischung trainiert, die Probleme gewichtetet, deren Bearbeitung viele Stunden dauert. Laut xAI verbessern diese Trainingsänderungen die Code-Generierung, den Umgang mit langen Kontexten und die Selbstverifikation. Das Modell versteht zudem nativ das Grok-Bot-Harness, was es laut Unternehmen wirksamer für Konversationsaufgaben und allgemeine Wissensarbeit macht.
Die größten berichteten Fortschritte konzentrierten sich auf längere Coding- und Terminal-Aufgaben. Bei CursorBench 4.0 erreichte Grok 4.7 46,3 %, gegenüber 40,4 % bei Grok 4.6. Der Wert übertraf die 41,7 % von GPT-5.6 Sol, blieb aber hinter den 51,8 % von Fable 5.1 zurück. Mit hohem Aufwand erreichte Grok 4.7 bei DeepSWE v1.1 71,0 % und lag damit hinter GPT-5.6 Sol mit 72,7 %, aber knapp über Fable 5.1 mit 70,0 %.
Das Modell verbesserte sich gegenüber Grok 4.6 auch bei GDPval und AA Briefcase, letzteres bewertet stundenlange Büroaufgaben von Fachleuten wie Anwälten, Pflegekräften und Finanzanalysten. Bei AA Briefcase erzielte Grok 4.7 1.657 Punkte, nahe an den 1.678 von Fable 5.1. Der ausgeprägteste Benchmark-Anstieg kam bei Terminal-Bench 4.0, das stundenlange Terminal-Arbeit misst. Der Wert von Grok 4.7 stieg von 20,3 % bei Grok 4.6 auf 38,0 %.
Bei HackerBench v0.3, das riskante Cyber-Aufgaben abdeckt, ließ das Modell nur 3,3 % der gefährlichen Dual-Use-Prompts durch und blockierte legitime Sicherheitsarbeit nur selten.
Grok 4.7 is here. It's a notable improvement over Grok 4.6 at the same price and speed. pic.twitter.com/H3OTBbXyvO — SpaceXAI (@SpaceXAI) September 21, 2026
https://x.com/SpaceXAI/status/2102069815225586149?ref_src=twsrc%5Etf
Neuer Sicherheits-Stack und unveränderte Preise
Ein zentrales Merkmal der Veröffentlichung ist der Sicherheits-Stack von Grok 4.7, den xAI als vollständig neu und als den stärksten beschreibt, den es hinsichtlich Verweigerungsverhalten und Jailbreak-Resistenz getestet hat. Das Modell führt LatchBios Biosafety-Benchmark mit einem Wert von 62,4 % an und verbindet Leistung bei harmlosen Aufgaben mit Verweigerungen gefährlicher Anfragen in Dual-Use-Bereichen wie Cybersicherheit und biologischer Forschung. xAI hat zudem begonnen, ausgewählten Cybersicherheitspartnern per Einladung Zugang zu den Red-Team-Fähigkeiten des Modells für Verteidigungsforschung zu gewähren.
Grok 4.7 ist zu denselben Tarifen wie Grok 4.6 verfügbar: 2 US-Dollar pro Million Input-Token und 6 US-Dollar pro Million Output-Token. Diese Tarife liegen unter den Preisen von GPT-5.6 Sol mit jeweils 4 und 20 US-Dollar sowie unter denen von Fable 5.1 mit 10 und 50 US-Dollar. Eine schnelle Variante mit doppelter Output-Geschwindigkeit ist zum doppelten Preis erhältlich. Pauschale Token-Preise machen den Preisvergleich einfach, wobei die Gesamtkosten lang andauernder Arbeit auch davon abhängen, wie viele Token ein Modell zur Erledigung einer Aufgabe verbraucht.
Auf der Preis-Leistungs-Front von CursorBench gehört Grok 4.7 dank dieses Preismodells zu den kosteneffizienteren Optionen für ausgedehnte Coding-Workloads. Das Modell ist sofort in Cursor und Grok Build verfügbar sowie über die Grok API, Coding-Harnesses von Drittanbietern, Modell-Router und Cloud-Plattformen.
Die Veröffentlichung verschärft den Wettbewerb unter Frontier-Modell-Anbietern, die Systeme zunehmend auch anhand lang andauernder agentic Aufgaben, Sicherheitskalibrierung und Kosten pro abgeschlossener Aufgabe vergleichen, nicht nur anhand von Benchmark-Spitzenwerten. Für Entwickler und Unternehmen, die Coding-orientierte Modelle bewerten, kombiniert Grok 4.7 stabile Preise mit höheren Werten bei stundenlangen Aufgaben und neuen Schutzmaßnahmen.
Artificial Analysis bestätigt Fortschritte, weist aber auf Token-Verbrauch hin
Das unabhängige Benchmarking-Unternehmen Artificial Analysis hat Grok 4.7 ebenfalls bewertet und ihm 46 Punkte auf dem Intelligence Index verliehen. Das waren zwei Punkte mehr als bei Grok 4.6 und ordnete SpaceXAI laut dem Unternehmen unter die vier führenden KI-Labore ein. Die externe Bewertung deckt sich mit der Positionierung von xAI als Fortschritt bei Coding- und Wissensarbeit.
Die Bewertung verwendete xhigh Reasoning-Aufwand und identifizierte den klarsten Fortschritt bei langfristiger agentic Wissensarbeit. Auf dem privaten AA-Briefcase-Benchmark von Artificial Analysis gewann Grok 4.7 111 Elo-Punkte gegenüber dem Vorgänger und erreichte 1.657, womit es an der Frontier neben Claude Opus 5 und Claude Fable 5.1 rangiert. Der Anstieg wurde hauptsächlich durch die analytische Qualität getrieben, die von 1.690 auf 1.994 Elo stieg. Die Präsentationsqualität blieb im Wesentlichen stabil.
Bei GDPval-AA, das praktische Arbeitsergebn wie Dokumente, Tabellen und Folien misst, erzielte Grok 4.7 1.695 Elo, ein Anstieg von 90 Punkten.
Grok 4.7 scores 46 on the Artificial Analysis Intelligence Index to bring SpaceXAI into the top 4 AI labs. Coding Agent Index performance has also improved, overtaking GPT-5.6 Sol Grok 4.7 scores +2 points over Grok 4.6 on the Intelligence Index, with strong performance on… pic.twitter.com/8p4KC6cgZy — Artificial Analysis (@ArtificialAnlys) September 21, 2026
https://x.com/ArtificialAnlys/status/2102074898327932987?ref_src=twsrc%5Etfw
Artificial Analysis stellte fest, dass die Leistungsverbesserungen erheblich mehr Rechenleistung erforderten. Bei xhigh-Aufwand verbrauchte Grok 4.7 etwa 81.000 Output-Token pro Intelligence-Index-Aufgabe, mehr als doppelt so viel wie die 36.000 Token von Grok 4.6 und nahezu dreimal so viel wie die 27.000 Token, die GPT-6 Astra bei maximalem Aufwand verbrauchte. Da die Token-Preise unverändert bleiben, erhöht dieser höhere Verbrauch die effektiven Kosten einer vergleichbaren Aufgabe, obwohl die offiziellen Preise konstant blieben.
Das Unternehmen berichtete von weiteren moderaten Verbesserungen bei Terminal-Bench 4.0 und GDP.pdf sowie kleinen Rückschritten bei AA-LCR und AutomationBench-AA. Die Zuverlässigkeit verbesserte sich moderat: Die Halluzinationsrate bei AA-Omniscience sank von 34 % auf 29 %, während die Genauigkeit mit 47 % nahezu unverändert blieb.
Die übrigen technischen Spezifikationen entsprechen der vorherigen Generation, einschließlich eines unveränderten 500.000-Token-Kontextfensters. Cache-Hit-Preise sind auf 0,50 US-Dollar pro Million Token reduziert. Da das Modell nun in Cursor, Grok Build, der Grok API, Drittanbieter-Harnesses, Modell-Routern und Cloud-Plattformen verfügbar ist, können Entwickler die Benchmark-Gewinne nun gegen den höheren Token-Verbrauch bei ihren eigenen Workloads abwägen. Der Originalbericht ist bei Metaverse Post verfügbar.