NieuwsAandelenElon Musks SpaceXAI lanceert Grok 4.7 met 71% DeepSWE-benchmarkscore

Elon Musks SpaceXAI lanceert Grok 4.7 met 71% DeepSWE-benchmarkscore

Auteur: Coinotag·

Belangrijkste punten

  • SpaceXAI bracht Grok 4.7 op 21 september uit en omschrijft het als het krachtigste model tot nu toe voor codeer- en kenniswerk, met training gericht op taken die enkele uren in beslag nemen.
  • Het model verschijnt tegen $2 per miljoen inputtokens en $6 per miljoen outputtokens, identiek aan Grok 4.6 en ver onder G-5.6 Sol ($4/$20) en Fable 5.1 ($10/$50).
  • Volgens de gepubliceerde benchmarks van SpaceXAI scoorde Grok 4.7 71,0% op DeepSWE v1.1, bracht Terminal-Bench 4.0 naar 38,0% vanaf 20,3% bij de voorganger, en leidde op EEBench en de Harvey-benchmark voor juridische agents, maar bleef achter op Fable 5.1 bij CursorBench 4.0 en HealthBench Professional.
  • Een herbouwde veiligheidsstack blokkeerde in HackerBench v0.3 alles behalve 3,3% van de high-risk dual-use prompts, met weinig vals-positieve afwijzingen, en geselecteerde cybersecuritypartners kregen op uitnodiging toegang tot red-teamtests.
  • Uren voor de lancering verloren de drie setups van Grok 4.6 in Ben Swerdlows Brood War Bench van elke Codex- en Claude-configuratie, met een beste resultaat van 2 overwinningen in 18 wedstrijden; Grok 4.7 is niet meegenomen in de ranglijst.
Elon Musks SpaceXAI lanceert Grok 4.7 met 71% DeepSWE-benchmarkscore

Grok 4.7 gebouwd voor taken van meerdere uren

SpaceXAI, de AI-eenheid van Elon Musk, bracht Grok 4.7 op 21 september uit en omschrijft het als het krachtigste model van het bedrijf tot nu toe voor codeer- en kenniswerk. Volgens de officiële aankondiging draait het nieuwe systeem op een groter basismodel dan Grok 4.6 en doorliep het langere reinforcement-learningcycli op moeilijkere taakcombinaties, met een bewuste nadruk op problemen waarvoor enkele uren nodig zijn.

Het bedrijf presenteerde de release rond het thema uithoudingsvermogen. Waar eerdere modellen binnen enkele minuten antwoordden, is Grok 4.7 afgestemd om door te werken aan opdrachten die een menselijke ingenieur of analyst uren zou kosten. SpaceXAI zei dat het model nu aanzlijk beter is in het verifiëren van eigen output tijdens lange sessies, in het verwerken van zeer lange contextvensters (de hoeveelheid tekst die een model tegelijk in het werkgeheugen kan houden), en in het native bedienen van het Grok Bot-agentframework, een meerstapsopzet waarin een model zelf plant, tools aanroept en werk uitvoert in plaats van één prompt te beantwoorden — verbeteringen die volgens het bedrijf zichtbaar zijn in conversaties, algemene kennistaken en het genereren van professionele documenten en presentaties.

Op de gepubliceerde benchmarks zit de xhigh-configuratie dicht bij de grens van het mogelijke. Op DeepSWE v1.1, een software-engineeringtestsuite, behaalde Grok 4.7 71,0%, waarmee het Fable 5.1 max (70,0%) nipt voorbijging en alleen GPT-5.6 Sol max (72,7%) erboven blijft. Op Terminal-Bench 4.0, dat meerurig terminalwerk beoordeelt, sprong het model naar 38,0% vanaf 20,3% bij de voorganger. Op suites die meerurige professionele taken voor advocaten, verpleegkundigen en financieel analisten simuleren — waaronder AA Briefcase en HealthBench — zei SpaceXAI dat Grok 4.7 nu gelijk oploopt met de besten in de sector.

Veiligheid is de andere kopclaim. Een herbouwde veiligheidsstack maakt dit de tot nu toe strenge versie van het bedrijf in het weigeren van ongepaste verzoeken en het weerstaan van jailbreaks, de pogingen om een model voorbij zijn beveiliging te praten. In HackerBench v0.3, dat kwaadwillende cybertaken test, kwam slechts 3,3% van de high-risk dual-use prompts — verzoeken met zowel legitieme als schadelijke toepassingen — erdoorheen, met weinig ten onrechte afgewezen legitieme defensieve beveiligingswerkzaamheden. Geselecteerde cybersecuritypartners hebben op uitnodiging toegang gekregen tot red-teamtestfaciliteiten, adversoriale tests waarbij beveiligingsonderzoekers een systeem op zwakke plekken doorlichten, ter ondersteuning van defensieonderzoek.

Het model is nu beschikbaar via Cursor, Grok Build, de Grok API, grote cloudplatforms enrouters, diensten die het verzoek van een developer doorsturen naar het AI-model van hun keuze via één interface.

Prijs van $2 gehouden terwijl Brood War Bench Grok 4.6 in verlegenheid brengt

De prijs is de stille constante: Grok 4.7 komt uit op $2 per miljoen inputtokens en $6 per miljoen outputtokens — identiek aan Grok 4.6 — plus een snelle variant die de outputsnelheid verdubbelt tegen dubbele prijs. Tokens zijn de teksteenheden die taalmodellen lezen en genereren, en API-facturering wordt daarop gemeterd: input dekt wat een developer stuurt, output wat het model terugstuurt. De tarieven ondergraven de concurrentie scherp: GPT-5.6 Sol staat genoteerd op $4/$20 per miljoen tokens en Fable 5.1 op $10/$50, waarmee de prijzen van Grok ruwweg een derde tot de helft van het concurrentieniveau bedragen, met snellere levering.

De eigen vergelijkingstabel van SpaceXAI toont dat Grok 4.7 voorloopt op elektrotechniek (EEBench: 64,0% versus 39,4% voor GPT-5.6 Sol en 56,4% voor Fable 5.1) en op de Harvey-benchmark voor juridische agents (19,6% versus 2,5% en 6,7%), terwijl het achter Fable 5.1 aanloopt op software-engineering (CursorBench 4.0: 46,3% versus 51,8%) en klinisch redeneren (HealthBench Professional: 56,7% versus 62,1%). Alle cijfers komen uit de gepubliceerde data van SpaceXAI.

De zakelijke context is relevant: SpaceXAI kreeg zijn huidige vorm in februari, toen xAI opging in SpaceX, gevolgd door de overname in juni van Cursor, de AI-code-editor die tevens een van de lanceringkanalen van Grok 4.7 is — onderdeel van Musks imperium dat ook Tesla (TSLA) omvat en, volgens eerder berichtgeving, een voornemen om AI-abonnementsplannen binnen enkele weken samen te voegen.

Uren voor de lancering kreeg de voorganger echter een knauw van een door de community samengestelde benchmark. Brood War Bench van developer Ben Swerdlow, waarin AI-agents StarCraft: Brood War spelen, deed op 20 september de ronde op X: 19 configuraties van Codex, Claude en Grok vochten 171 onderlinge duels uit, en Codex Astra won alle 18 van zijn wedstrijden op maximaal redeneern. De drie setups van Grok 4.6 verloren van elke Codex- en Claude-configuratie, met een beste resultaat van 2 overwinningen in 18. Realtimestrategie is een veeleisende test voor agents, omdat beslissingen over economie, productie en gevechten continu binnenkomen — er is geen beurt om te pauzeren en te plannen.

Swerdlow registreerde één wedstrijd waarin een Grok-setup met maximale redeneerstand 11.138 reasoning-tokens verbruikte in 43 minuten, maar slechts zes commandobatches gaf — zonder ook maar één gevechtseenheid op het veld te brengen. Hij schreef dat Grok nog niet slim genoeg is voor het spel, dat oudere modellen realtimestrategie als turn-based behandelen, en voegde eraan toe dat geen enkele deelnemer boven het beginnende niveau uitkwam. Grok 4.7 is niet meegenomen in de ranglijst.

COINOTAGs analyse: prijzdruk is het echte signaal

Samengevat vertellen de cijfers van de lanceerdag en de Brood War-resultaten één verhaal: frontier-labs verkopen nu redeneervermogen tegen grondstofprijzen, en agentbetrouwbaarheid — niet statische benchmarkscores — bepaalt wie wint. Volgens COINOTAG geeft het $2/$6-tarief Grok 4.7 tokenomics die concurrenten moeten evenaren, vergelijkbaar met de manier waarop futures-prijsprijzen markten dwingt verwachtingen bij te stellen, terwijl labs zonder vergelijkbare rekenkracht risico leren exit-liquidity te worden in deze prijzenoorlog. De uitgeverij voegde eraan toe that koppen over Musks rekenkracht historisch het sentiment in aan Musk gelinkte assets zoals Dogecoin (DOGE) hebben beïnvloed, en raadde aan te letten op de agentresultaten van Grok 4.7 in plaats van op de lancingsclaims.