NachrichtenAktienElon Musks SpaceXAI veröffentlicht Grok 4.7 mit 71% beim DeepSWE-Benchmark

Elon Musks SpaceXAI veröffentlicht Grok 4.7 mit 71% beim DeepSWE-Benchmark

Autor: Coinotag·

Wichtige Erkenntnisse

  • SpaceXAI hat Grok 4.7 am 21. September veröffentlicht und es als das leistungsfähigste Modell des Unternehmens für Coding und Wissensarbeit beschrieben, mit Training auf Aufgaben, deren Bearbeitung mehrere Stunden dauert.
  • Das Modell startet bei 2 Dollar pro Million Input-Tokens und 6 Dollar pro Million Output-Tokens — identisch mit Grok 4.6 und weit unter GPT-5.6 Sol mit 4/20 Dollar und Fable 5.1 mit 10/50 Dollar.
  • Bei den veröffentlichten Benchmarks erzielte Grok 4.7 71,0% bei DeepSWE v1.1, steigerte Terminal-Bench 4.0 von 20,3% auf 38,0%, führte bei EEBench und dem Harvey-Legal-Agenten-Benchmark und lag bei CursorBench 4.0 und HealthBench Professional hinter Fable 5.1.
  • Ein neu aufgebautes Sicherheits-Stack blockierte in HackerBench v0.3 alle bis auf 3,3% der hochriskanten Dual-Use-Prompts, bei wenigen Fehlablehnungen; ausgewählte Cybersecurity-Partner erhielten Einladungs-Red-Team-Zugang.
  • Stunden vor dem Launch verloren Grok 4.6s drei Setups in Ben Swerdlows Brood War Bench gegen jede Codex- und Claude-Konfiguration, mit bestenfalls 2 Siegen in 18 Matches; Grok 4.7 wurde noch nicht gerankt.
Elon Musks SpaceXAI veröffentlicht Grok 4.7 mit 71% beim DeepSWE-Benchmark

Grok 4.7 für Workloads über mehrere Stunden

SpaceXAI, Elon Musks KI-Sparte, hat Grok 4.7 am 21. September veröffentlicht und es als das leistungsfähigste Modell des Unternehmens bislang für Coding und Wissensarbeit beschrieben. Laut der offiziellen Ankündigung basiert das neue System auf einem größeren Basismodell als Grok 4.6 und durchlief längere Bestärkungslernen-Zyklen mit anspruchsvolleren Aufgabenmischungen, mit bewusstem Fokus auf Probleme, deren Bearbeitung mehrere Stunden dauert.

Das Unternehmen stellte die Veröffentlichung unter das Motto der Ausdauer. Wo frühere Modelle in Minuten antworteten, ist Grok 4.7 darauf ausgelegt, Aufgaben durchzuarbeiten, die einen menschlichen Ingenieur oder Analysten Stunden kosten würden. SpaceXAI erklärte, das Modell sei nun deutlich besser darin, seine eigene Ausgabe über lange Läufe zu verifizieren, sehr lange Kontextfenster zu verarbeiten (die Textmenge, die ein Modell gleichzeitig im Blick behalten kann), und das Grok-Bot-Agenten-Framework nativ zu bedienen — ein mehrstufiges Setup, in dem ein Modell plant, Tools aufruft und Arbeit selbstständig ausführt, statt nur eine einzelne Anfrage zu beantworten. Diese Verbesserungen, so das Unternehmen, zeigten sich in Konversation, allgemeinen Wissensaufgaben sowie der Erstellung professioneller Dokumente und Präsentationen.

Bei den veröffentlichten Benchmarks liegt die xhigh-Konfiguration nahe an der Spitze. Bei DeepSWE v1.1, einer Suite für Software-Engineering, erzielte Grok 4.7 71,0% und verdrängte damit Fable 5.1 max mit 70,0% vom Platz; nur GPT-5.6 Sol max mit 727% lag vorn. Bei Terminal-Bench 4.0, das mehrstündige Terminalarbeit bewertet, sprang das Modell von 20,3% des Vorgängers auf 38,0%. Bei Suiten, die mehrstündige berufliche Aufgaben für Anwälte, Pflegekräfte und Finanzanalysten simulieren — darunter AA Briefcase und HealthBench — läuft Grok 4.7 laut SpaceXAI nun auf Augenhöhe mit den Besten der Branche.

Sicherheit ist die zweite zentrale Behauptung. Ein neu aufgebautes Sicherheits-Stack macht diese Version zur widerstandsfähigsten des Unternehmens gegenüber unangemessenen Anfragen und Jailbreaks — Versuchen, ein Modell an seinen Schutzmaßnahmen vorbeizureden. Bei HackerBench v0.3, das bösartige Cyber-Aufgaben testet, kamen nur 3,3% der hochriskanten Dual-Use-Prompts — Anfragen mit sowohl legitimen als auch schädlichen Anwendungen — durch, bei wenigen Fehlablehnungen legitimer defensiver Sicherheitsarbeit. Ausgewählte Cybersecurity-Partner erhielten allein auf Einladung zugänglichen Red-Team-Zugang, adversitives Testen, bei dem Sicherheitsforscher ein System auf Schwachstellen prüfen, zur Unterstützung der Verteidigungsforschung.

Das Modell ist jetzt über Cursor, Grok Build, die Grok API, große Cloud-Plattformen und Modell-Router verfügbar — Dienste, die die Anfrage eines Entwicklers über eine einzige Schnittstelle an das KI-Modell seiner Wahl weiterleiten.

2-Dollar-Preis gehalten, während Brood War Bench Grok 4.6 blamiert

Der Preis bleibt die stille Konstante: Grok 4.7 startet bei 2 Dollar pro Million Input-Tokens und 6 Dollar pro Million Output-Tokens — identisch mit Grok 4.6 — plus eine schnelle Variante, die die Ausgabegeschwindigkeit verdoppelt zum doppelten Preis. Tokens sind die Texteinheiten, die Sprachmodelle lesen und erzeugen; die API-Abrechnung erfolgt darauf basisend: Input umfasst, was ein Entwickler sendet, Output, was das Modell zurückschreibt. Die Sätze undercut die Konkurrenz deutlich: GPT-5.6 Sol kostet 4/20 Dollar pro Million Tokens, Fable 5.1 10/50 Dollar — Groks Preise liegen damit bei etwa einem Drittel bis der Hälfte des Wettbewerbsniveaus, bei schnellerer Lieferung.

SpaceXAIs eigene Vergleichstabelle zeigt Grok 4.7 vorn bei Elektrotechnik (EEBench: 64,0% gegenüber 39,4% für GPT-5.6 Sol und 56,4% für Fable 5.1) und beim Harvey-Legal-Agenten-Benchmark (19,6% gegenüber 2,5% und 6,7%), während es bei Software-Engineering (CursorBench 4.0: 46,3% gegenüber 51,8%) und klinischem Denken (HealthBench Professional: 56,7% gegenüber 62,1%) hinter Fable 5.1liegt. Alle Zahlen stammen aus SpaceXAIs veröffentlichten Daten.

Der unternehmerische Hintergrund ist relevant: SpaceXAI erhielt seine heutige Form im Februar, als xAI in SpaceX aufging, gefolgt von der Übernahme von Cursor im Juni, dem KI-Code-Editor, der zugleich einer der Launch-Kanäle von Grok 4.7 ist — Teil von Musks Imperium, das auch Tesla (TSLA) umfasst und laut früheren Berichten innerhalb weniger Wochen KI-Abos zusammenführen will.

Stunden vor dem Launch blamierte jedoch ein Community-Benchmark den Vorgänger. Entwickler Ben Swerdlows Brood War Bench, in dem KI-Agenten StarCraft: Brood War spielen, kursierte am 20. September auf X: 19 Konfigurationen von Codex, Claude und Grok bestritten 171 Direktduelle, und Codex Astra gewann alle 18 Spiele mit maximaler Reasoning-Stufe. Grok 4.6s drei Setups verloren gegen jede Codex- und Claude-Konfiguration; bestes Ergebnis waren 2 Siege in 18 Spielen. Echtzeit-Strategie ist ein anspruchsvoller Test für Agenten, weil Wirtschafts-, Produktions- und Kampfesentscheidungen kontinuierlich eintreffen — es gibt keinen Zug, um zu pausieren und zu planen.

Swerdlow dokumentierte ein Match, in dem ein Grok-Setup mit höchstem Reasoning-Level 11.138 Reasoning-Tokens über 43 Minuten verbrannte, aber nur sechs Befehlsstapel ausgab — nie ein einziges Kampfeinheiten ins Spiel brachte. Er schrieb, Grok sei für das Spiel noch nicht klug genug; ältere Modelle behandelten Echtzeit-Strategie wie ein rundenbasiertes Spiel. Zudem überstieg kein Teilnehmer das Niveau eines Anfängers. Grok 4.7 wurde noch nicht gerankt.

COINOTAGs Einordnung: Der Preisdruck ist das eigentliche Signal

Zusammen gelesen erzählen die Launch-Zahlen und die Brood-War-Ergebnisse eine Geschichte: Frontier-Labore verkaufen Reasoning inzwischen zu Rohstoffpreisen, und agentische Zuverlässigkeit — nicht statische Benchmark-Scores — entscheidet, wer gewinnt. Nach COINOTAGs Einschätzung verschafft der 2/6-Dollar-Satz Grok 4.7 eine Tokenomics, die Wettbewerber erreichen müssen, ähn wie Terminpreise Märkte zwingen, Erwartungen neu zu verankern, während Labore ohne vergleichbare Rechenkapazitäten riskieren, in diesem Preiskrieg zu Exit-Liquidität zu werden. Das Portal fügte hinzu, dass Musk-Compute-Schlagzeilen historisch die Stimmung bei Musk-nahen Assets wie Dogecoin (DOGE) bewegt haben, und empfahl, auf Grok 4.7s Agenten-Ergebnisse zu achten statt auf seine Launch-Versprechen.