xAI uruchamia Grok 4.7 po licznych opóźnieniach — w benchmarkach ustępuje rywalom z czołówki
Najważniejsze informacje
- •Grok 4.7 używa 2,1 biliona parametrów — o 40% więcej niż 1,5 biliona w Grok 4.6 — i jest wyceniony na 2 dolary za milion tokenów wejściowych oraz 6 dolarów za milion tokenów wyjściowych.
- •xAI uzupełniło trening modelu danymi ze SpaceX, w tym telemetrią satelitów Starlink, zapiskami produkcyjnymi i logami awarii inżynieryjnych, aby poprawić rozumowanie o sprzęcie i systemach fizycznych.
- •Wczesne wyniki benchmarków plasują Grok 4.7 na drugim miejscu za Claude Fable 5.1 w GDPval (1695 wobec 1735) i AA-Briefcase (1657 wobec 1678) oraz za GPT-6 Astra w teście EEBench z zakresu inżynierii elektrycznej.
- •Premiera nastąpiła po co najmniej pięciu zmianach terminu od końca lipca, a model uruchomiono natychmiast, bez listy oczekujących, w aplikacji Grok, Cursor, Grok Build i API xAI.
- •Musk powiedział, że Grok 4.7 powinien wypaść mniej więcej na poziomie Claude Opus 5.0 Anthropic, i nakreślił nadchodzące modele — Grok 4.8, Grok 4.9 oraz możliwego lidera czołówki Grok 5 — bez podawania dat premier.

xAI Elona Muska wydał w poniedziałek po południu Grok 4.7, swój najpotężniejszy model do tej pory, który firma określiła jako „znaczącą poprawę względem Grok 4.6 w tej samej cenie i z tą samą szybkością”.
Wczesne wyniki benchmarków plasowały model na drugim miejscu za Claude Fable 5.1 w GDPval i AA-Briefcase oraz za GPT-6 Astra w EEBench, benchmarku z zakresu inżynierii elektrycznej.
Premiera nastąpiła po serii przekładanych terminów. Musk przekładał harmonogram premiery co najmniej pięć razy od końca lipca: najpierw „za cztery tygodnie”, potem „kilka tygodni”, potem „3 do 4 tygodni”, potem „10 dni” 1 września, a wreszcie „potrzebuje jeszcze kilku dni na dopracowanie” 11 września.
Tym razem nie ma listy oczekujących. Grok 4.7 jest dostępny natychmiast w aplikacji Grok, Cursor, Grok Build oraz przez API xAI.
Musk odniósł się do tego na X, nazywając Grok 4.7 „mocnym połączeniem inteligencji, szybkości i niskiego kosztu”.
Grok 4.7 is here. It's a notable improvement over Grok 4.6 at the same price and speed. pic.twitter.com/H3OTBbXyvO
Według oficjalnego ogłoszenia xAI model dłużej pracuje nad trudnymi problemami i częściej weryfikujene odpowiedzi niż robił to Grok 4.6, a do tego firma określa go jako wyposażonego w dotychczas najsilniejsze zabezpieczenia bezpieczeństwa.
Skala, ceny i dane SpaceX
Grok 4.7 ma 2,1 biliona parametrów, o 40% więcej niż 1,5 biliona w Grok 4.6, który sam był dopracowaniem modelu Grok 4.5. Koszty ustalono na 2 dolary za milion tokenów wejściowych i 6 dolarów za milion tokenów wyjściowych. Parametry to wewnętrzne „pokrętła”, które model dostosowuje podczas treningu — im więcej ich jest, tym większa ogólnie zdolność do uczenia się wzorców, natomiast tokeny to podstawowe jednostki informacji, które model AI może zapisać lub wygenerować.
xAI włączyło także dodatkowe dane treningowe pozyskane z SpaceX, firmy rakietowej Muska: telemetrię satelitów Starlink, zapiski produkcyjne oraz logi awarii inżynieryjnych. Obietnica to model, który rozumuje lepiej o sprzęcie i systemach fizycznych niż cokolwiek trenowanego wyłącznie na tekstach z internetu.
Benchmarki mówią znajomą historię
GDPval mierzy, jak model radzi sobie z realną, wartościową ekonomicznie pracą knowledge work — notatkami prawnymi, arkuszami, prezentacjami — przy użyciu zadań sprawdzonych przez czynnych zawodowo specjalistów w każdej dziedzinie, i ocenia go w ratingu Elo, tym samym systemie rankingowym „jeden na jednego”, jakiego używa szachy. Grok 4.7 uzyskał 1695 w GDPval, podczas gdy Claude Fable 5.1 zdominował zestawienie z wynikiem 1735 — 40-punktowa różnica w skali Elo.
AA-Briefcase, stworzony przez Artificial Analysis, testuje wielogodzinną pracę biurową łączącą badania, analizę i tworzenie dokumentów w jedno długie zadanie, również oceniany w skali Elo. Grok 4.7 uzyskał 1657 wobec 1678 Fable 5.1 — węższa, 21-punktowa różnica i ten sam wynik na innym teście.
CursorBench 4.0, benchmark Cursora dla rzeczywistych zadań programistycznych w jego edytorze, zestawia trafność z kosztem i liczbą tokenów zużywanych przez każde zadanie. Grok 4.7 plasuje się w środku: droższy na zadanie niż GPT-6 Astra, następca GPT-5.6 Sol, oraz Claude Sonnet 5, ale wciąż za Fable 5.1, który wygrywa w każdym punkcie cenowym na wykresie.
Powtarzający się schemat xAI
Firma wielokrotnie wypuszczała flagowe modele, które w niezależnych ocenach przychodziły za rywalami. Grok 4.5 zadebiutował w lipcu z największym klastrem treningowym w branży i wynikami z trzeciego miejsca, za modelami Claude i OpenAI. Wcześniej Grok 4.20 wymienił niezawodność na szybko i osobowość, a Grok 4.6 również ustępował czołówce pod względem autonomii w kodowaniu.
Nic z tego nie czyni Grok 4.7 złym produktem dla milionów ludzi, którzy rozmawiają z nim przez X, samodzielną aplikację lub panel swojego Tesli. Oznacza to jedynie, że model najczęściej odpowiadający na pytania użytkowników — albo napędzający asystenta głosowego ich samochodu — działa na systemie, który benchmarki samego twórcy lokują o szczebel poniżej szczytu drabiny.
Ta różnica to powód, dla którego dla większości ludzi cena znaczy więcej niż pozycja w zestawieniu. xAI konsekwentnie podcina ceny Anthropic i OpenAI pod względem kosztu za token, nawet jeśli ustępuje im w surowych możliwościach, stawiając na to, że „wystarczająco dobre, tanie i wszędzie” bije „najlepsze, ale droższe” w większości codziennych zastosowań.
Oczekiwania Muska i droga naprzód
Musk już na kilka dni przed premierą obniżył oczekiwania, pisząc na X, że Grok 4.7 powinien wypaść „w przybliżeniu na poziomie” Claude Opus 5.0 od Anthropic — nie nowszego Opus 5.1 — przy czym wydajność multimodalna wciąż wymaga pracy.
W tym samym poście naszkicował kolejne trzy modele: Grok 4.8 jako znaczący krok naprzód, Grok 4.9 w „klasie Astra/Fable” oraz Grok 5 jako możliwy lider czołówki. Te uaktualnienia nie mają jeszcze dat premier — szczegół, który nabiera dodatkowej wagi, biorąc pod uwagę, że sam harmonogram Grok 4.7 był przekładany co najmniej pięć razy przed premierą. „Zobaczymy” — napisał.