xAI brengt Grok 4.7 uit met nieuwe beveiligingslagen en hogere prestaties bij meerurige taken
Belangrijkste punten
- •Grok 4.7 is gebouwd op een nieuw, groter basismodel en getraind met een verlengde reinforcement-learning-run met moeilijkere taken, wat volgens xAI de codegeneratie, het verwerken van lange contexten en de zelfverificatie verbetert.
- •De grootste benchmarkwinsten van het model zaten in langlopend codeer- en terminalwerk, met Terminal-Bench 4.0 stijgend naar 38,0% vanaf 20,3% en CursorBench 4.0 naar 46,3% vanaf 40,4%.
- •Grok 4.7 wordt geleverd met een volledig nieuwe beveiligingsstack die xAI beschreef als zijn sterkst geteste qua weigeringsgedrag en jailbreakresistentie, en het model leidt LatchBio's biosafety-benchmark met 62,4%.
- •De prijzen blijven op Grok 4.6-niveau van $2 per miljoen inputtokens en $6 per miljoen outputtokens, onder de tarieven van GPT-5.6 Sol en Fable 5.1.
- •Artificial Analysis gaf Grok 4.7 een score van 46 op de Intelligence Index, een winst van twee punten die SpaceXAI bij de topvier AI-labs plaatste, maar constateerde dat het model ongeveer 81.000 outputtokens per taak gebruikte, meer dan het dubbele vank 4.6's 36.000, wat de effectieve kosten verhoogt.

xAI heeft Grok 4.7 uitgebracht en beschrijft het als zijn krachtigste model tot nu toe voor codeer- en kenniswerk. Het bedrijf positioneert het model als een frontier-aanbod tegen een concurrerende prijs, met prijzen die ongewijzigd zijn ten opzichte van zijn voorganger, Grok 4.6.
Grok 4.7 is gebouwd op een nieuw, groter basismodel en is getraind via een verlengde reinforcement-learning-run met een moeilijkere taakmix, gewogen richting problemen die vele uren in beslag nemen. Volgens xAI verbeteren de trainingsaanpassingen de codegeneratie, het verwerken van lange contexten en de zelfverificatie. Het model begrijpt ook native de Grok Bot-harness, wat volgens het bedrijf effectiever maakt voor conversationele taken en algemeen kenniswerk.
De grootste gerapporteerde winsten waren geconcentreerd in langlopende codeer- en terminale taken. Op CursorBench 4.0 scoorde Grok 4.7 46,3%, tegenover 40,4% voor Grok 4.6. De score overtrof GPT-5.6 Sol's 41,7% maar bleef onder Fable 5.1's 51,8%. Bij hoge inspanning op DeepSWE v1.1 scoorde Grok 4.7 71,0%, achter GPT-5.6 Sol met 72,7% en net boven Fable 5.1 met 70,0%.
Het model presteerde ook beter dan Grok 4.6 op GDPval en AA Briefcase, dat meerurige kantoortaken evalueert die worden uitgevoerd door professionals zoals advocaten, verpleegkundigen en financieel analisten. Op AA Briefcase scoorde Grok 4.7 1.657, dicht bij Fable 5.1's 1.678. De meest uitgesproken benchmarkstijging kwam op Terminal-Bench 4.0, dat meerurig terminalwerk meet. De score van Grok 4.7 steeg van 20,3% voor Grok 4.6 naar 38,0%.
Op HackerBench v0.3, dat risicovolle cybertaken dekt, liet het model slechts 3,3% van gevalijke dual-use prompts door terwijl legitiem beveiligingswerk zelden werd geblokkeerd.
Grok 4.7 is here. It's a notable improvement over Grok 4.6 at the same price and speed. pic.twitter.com/H3OTBbXyvO — SpaceXAI (@SpaceXAI) September 21, 2026
https://x.com/SpaceXAI/status/2102069815225586149?ref_src=twsrc%5Etfw
Nieuwe beveiligingsstack en ongewijzigde prijzen
Een centraal kenmerk van de release is de beveiligingsstack van Grok 4.7, die xAI beschreef als volledig nieuw en het sterkst wat het heeft getest qua weigeringsgedrag en resistentie tegen jailbreaks. Het model leidt LatchBio's biosafety-benchmark met een score van 62,4%, waarbij prestaties op onschuldige taken worden gecombineerd met weigeringen op gevaarlijke verzoeken in dual-use domeinen zoals cyberbeveiliging en biologisch onderzoek. xAI is ook begonnen geselecteerde cybersecuritypartners toegang op uitnodiging te geven tot de red-team-mogelijkheden van het model voor defensieonderzoek.
Grok 4.7 is beschikbaar tegen dezelfde tarieven als Grok 4.6: $2 per miljoen inputtokens en $6 per miljoen outputtokens. Die tarieven liggen onder de prijzen van respectievelijk $4 en $20 van GPT-5.6 Sol en de prijzen van $10 en $50 van Fable 5.1. Een snelle variant met de dubbele outputsnelheid is beschikbaar tegen de dubbele prijs. Vaste per-token-tarieven maken de prijsvergelijking eenvoudig, hoewel de totale kosten van langlopend werk ook afhangen van hoeveel tokens een model verbruikt om een taak te voltooien.
Op CursorBench's prijs-prestatiegrens plaatst de prijstelling Grok 4.7 bij de kostenefficiëntere opties voor uitgebreide coderingsworkloads. Het model is onmiddellijk beschikbaar in Cursor en Grok Build, evenals via de Grok API, third-party coding harnesses, modelrouters en cloudplatforms.
De release voegt toe aan de concurrentie onder frontier-modelaanbieders, die systemen in toenemende mate vergelijken op langdurige agentische taken, veiligheidskalibratie en kosten per voltooide taak, naast de opvallende benchmarkscores. Voor ontwikkelaars en bedrijven die codeergerichte modellen beoordelen, combineert Grok 4.7 stabiele prijzen met hogere meerurige taakscores en nieuwe beveiligingsmaatregelen.
Artificial Analysis bevestigt winsten maar signaleert tokenverbruik
Het onafhankelijke benchmarkingbedrijf Artificial Analysis heeft Grok 4.7 ook geëvalueerd en gaf het een score van 46 op de Intelligence Index. Dat was twee punten hoger dan Grok 4.6 en plaatste SpaceXAI bij de topvier AI-labs, aldus het bedrijf. De externe beoordeling sluit aan bij de positionering van xAI van de release als een stap vooruit op codeer- en kenniswerk.
De evaluatie gebruikte xhigh reasoning effort en identificeerde de duidelijkste vooruitgang inlopend agentisch kenniswerk. Op de private AA-Briefcase-benchmark van Artificial Analysis won Grok 4.7 111 Elo-punten ten opzichte van zijn voorganger en bereikte 1.657, waarmee het naast Claude Opus 5 en Claude Fable 5.1 aan de frontier staat. De stijging werd primair gedreven door analytische kwaliteit, die steeg naar 1.994 Elo vanaf 1.690. De presentatiekwaliteit bleef ongeveer stabiel.
Op GDPval-AA, dat praktische werkproducten meet zoals documenten, spreadsheets en slides, scoorde Grok 4.7 1.695 Elo, een stijging van 90 punten.
Grok 4.7 scores 46 on the Artificial Analysis Intelligence Index to bring SpaceXAI into the top 4 AI labs. Coding Agent Index performance has also improved, overtaking GPT-5.6 Sol Grok 4.7 scores +2 points over Grok 4.6 on the Intelligence Index, with strong performance on… pic.twitter.com/8p4KC6cgZy — Artificial Analysis (@ArtificialAnlys) September 21, 2026
https://x.com/ArtificialAnlys/status/2102074898327932987?ref_src=twsrc%5Etfw
Artificial Analysis ontdekte dat de prestatieverbeteringen aanzienlijk meer rekenkracht vereisten. Bij xhigh effort gebruikte Grok 4.7 ongeveer 81.000 outputtokens per Intelligence Index-taak, meer dan het dubbele van de 36.000 tokens die Grok 4.6 gebruikte en bijna drie keer de 27.000 tokens die GPT-6 Astra bij maximale inspanning verbruikte. Omdat de per-token-tarieven ongewijzigd zijn, verhoogt dit zwaardere verbruik de effectieve kosten van een vergelijkbare taak, zelfs al bleven de officiële prijzen gelijk.
Het bedrijf meldde bescheiden aanvullende verbeteringen op Terminal-Bench 4.0 en GDP.pdf, samen met kleine achteruitgangen op AA-LCR en AutomationBench-AA. De betrouwbaarheid verbeterde enigszins: het hallucinatiepercentage van AA-Omniscience daalde naar 29% vanaf 34%, terwijl de nauwkeurigheid vrijwel onveranderd bleef op 47%.
Andere technische specificaties blijven gelijk aan die van de vorige generatie, waaronder een contextvenster van 500.000 tokens. Cache-hitprijzen zijn gekort tot $0,50 per miljoen tokens. Nu het model live is op Cursor, Grok Build, de Grok API, third-party harnesses, modelrouters en cloudplatforms, kunnen ontwikkelaars de benchmarkwinsten nu afwegen tegen het hogere tokenverbruik op hun eigen workloads. Het originele rapport is beschikbaar via Metaverse Post.