AktualnościMakroxAI wypuszcza Grok 4.7 z nowymi zabezpieczeniami i wyższą wydajnością w zadaniach wielogodzinnych

xAI wypuszcza Grok 4.7 z nowymi zabezpieczeniami i wyższą wydajnością w zadaniach wielogodzinnych

Autor: Metaverse Post·

Najważniejsze informacje

  • •Grok 4.7 został zbudowany na nowej, większej bazie i wytrenowany rozszerzonym treningiem ze wzmocnieniem na trudniejszych zadaniach, co, według xAI, poprawia generowanie kodu, obsługę długich kontekstów i samoweryfikację.
  • •Największe przyrosty benchmarkowe modelu odnotowano w długotrwałej pracy programistycznej i terminalowej: Terminal-Bench 4.0 wzrósł do 38,0% z 20,3%, a CursorBench 4.0 do 46,3% z 40,4%.
  • •Grok 4.7 debiutuje z całkowicie nowym stosem bezpieczeństwa, opisanym przez xAI jako najsilniejszy z przetestowanych pod względem odmów i odporności na jailbreaki, i prowadzi w benchmarku biobezpieczeństwa LatchBio z wynikiem 62,4%.
  • •Cennik pozostał na poziomie Grok 4.6: 2 dolary za milion tokenów wejściowych i 6 dolarów za milion tokenów wyjściowych, poniżej stawek GPT-5.6 Sol i Fable 5.1.
  • •Artificial Analysis oceniło Grok 4.7 na 46 punktów w Intelligence Index, o dwa punkty więcej, co umieściło SpaceXAI w czwórce czołowych laboratoriów AI, ale ustaliło, że model zużywa około 81 000 tokenów wyjściowych na zadanie, ponad dwukrotnie więcej niż 36 000 Grok 4.6, podnosząc efektywne koszty.
xAI wypuszcza Grok 4.7 z nowymi zabezpieczeniami i wyższą wydajnością w zadaniach wielogodzinnych

xAI udostępniło Grok 4.7, opisując go jako swój najzdolniejszy jak dotąd model do programowania i pracy z wiedzą. Firma pozycjonuje model jako ofertę najwyższej klasy w konkurencyjnej cenie, przy czym cennik pozostał bez zmian względem poprzednika, Grok 4.6.

Grok 4.7 został zbudowany na nowej, większej bazie i wytrenowany poprzez rozszerzony trening ze wzmocnieniem, wykorzystujący trudniejszy zestaw zadań z naciskiem na problemy wymagające wielu godzin pracy. Według xAI zmiany w treningu poprawiły generowanie kodu, obsługę długich kontekstów i samoweryfikację. Model natywnie rozumie również harness Grok Bot, co, jak zapewnia firma, czyni go skuteczniejszym w zadaniach konwersacyjnych i ogólnej pracy z wiedzą.

Największe zgłaszane przyrosty koncentrowały się w dłuższych zadaniach programistycznych i terminalowych. W CursorBench 4.0 Grok 4.7 uzyskał 46,3% wobec 40,4% dla Grok 4.6. Wynik przewyższył 41,7% GPT-5.6 Sol, ale pozostał poniżej 51,8% Fable 5.1. Przy wysokim wysiłku w DeepSWE v1.1 Grok 4.7 uzyskał 71,0%, ustępując GPT-5.6 Sol z wynikiem 72,7%, minimalnie przewyższając Fable 5.1 z wynikiem 70,0%.

Model poprawił się również względem Grok 4.6 w GDPval i AA Briefcase, które ocenia wielogodzinne zadania biurowe wykonywane przez profesjonalistów, takich jak prawnicy, pielgniarki i analitycy finansowi. W AA Briefcase Grok 4.7 uzyskał 1 657, blisko wyniku Fable 5.1 – 1 678. Najbardziej wyraźny wzrost odnotowano w Terminal-Bench 4.0, mierzącym wielogodzinną pracę w terminalu. Wynik Grok 4.7 wzrósł z 20,3% dla Grok 4.6 do 38,0%.

W HackerBench v0.3, obejmującym ryzykowne zadania cybernetyczne, model przepuścił jedynie 3,3% niebezpiecznych promptów dwufunkcyjnych, rzadko blokując przy tym zgodną z prawem pracę nad bezpieczeństwem.

Grok 4.7 is here. It's a notable improvement over Grok 4.6 at the same price and speed. pic.twitter.com/H3OTBbXyvO — SpaceXAI (@SpaceXAI) September 21, 2026

https://x.com/SpaceXAI/status/2102069815225586149?ref_src=twsrc%5Etfw

Nowy stos bezpieczeństwa i niezmieniony cennik

Centralnym elementem premiery jest stos bezpieczeństwa Grok 4.7, który xAI opisało jako całkowicie nowy i najsilniejszy z przetestowanych pod względem zachowań odmowy i odporności na jailbreaki. Model prowadzi w benchmarku biobezpieczeństwa LatchBio z wynikiem 62,4%, łącząc wydajność w nieszkodliwych zadaniach z odmowami w przypadku niebezpiecznych żądań w dziedzinach dwufunkcyjnych, takich jak cyberbezpieczeństwo i badania biologiczne. xAI rozpoczęło również udzielanie wybranym partnerom z branży cyberbezpieczeństwa dostępu na zaproszenie do zdolności red-team modelu na potrzeby badań obronnych.

Grok 4.7 jest dostępny w tych samych stawkach co Grok 4.6: 2 dolary za milion tokenów wejściowych i 6 dolarów za milion tokenów wyjściowych. Stawki te są niższe niż odpowiednio 4 i 20 dolarów GPT-5.6 Sol oraz 10 i 50 dolarów Fable 5.1. Szybki wariant oferujący dwukrotnie większą prędkość generowania wyjścia jest dostępny za dwukrotnie wyższą cenę. Stałe stawki za token ułatwiają porównanie cen, choć całkowity koszt długotrwałej pracy zależy również od tego, ile tokenów model zużywa do ukończenia zadania.

Na froncie ceny i wydajności CursorBench ten cennik plasuje Grok 4.7 wśród bardziej opłacalnych opcji dla rozszerzonych obciążeń programistycznych. Model jest natychmiast dostępny w Cursor i Grok Build, a także poprzez Grok API, zewnętrzne harnessy programistyczne, routery modeli i platformy chmurowe.

Premiera zaostrza konkurencję wśród dostawców modeli najwyższej klasy, którzy coraz częściej porównują systemy pod kątem długotrwałych zadań agentowych, kalibracji bezpieczeństwa i kosztu uczonego zadania, a nie tylko nagłówkowych wyników benchmarków. Dla programistów i przedsiębiorstw oceniających modele zorientowane na programowanie Grok 4.7 łączy stabilne ceny z wyższymi wynikami w wielogodzinnych zadaniach i nowymi zabezpieczeniami.

Artificial Analysis potwierdza przyrosty, ale wskazuje zużycie tokenów

Niezależna firma benchmarkingowa Artificial Analysis również oceniła Grok 4.7, przyznając mu wynik 46 w Intelligence Index. To o dwa punkty więcej niż Grok 4.6, co umieściło SpaceXAI w czwórce czołowych laboratoriów AI, według firmy. Zewnętrzna ocena pokrywa się z pozycjonowaniem premiery przez xAI jako kroku naprzód w programowaniu i pracy z wiedzą.

Ocena została przeprowadzona przy wysokim (xhigh) wysiłku rozumowania i wskazała najwyraźniejszy postęp w długoterminowej agentowej pracy z wiedzą. W prywatnym benchmarku AA-Briefcase firmy Artificial Analysis Grok 4.7 zyskał 111 punktów Elo względem poprzednika, osiągając 1 657, co plasuje go obok Claude Opus 5 i Claude Fable 5.1 na froncie. Wzrost był napędzany przede wszystkim jakością analityczną, która wzrosła z 1 690 do 1 994 Elo. Jakość prezentacji pozostała w przybliżeniu stabilna.

W GDPval-AA, mierzącym praktyczne produkty pracy, takie jak dokumenty, arkusze kalkulacyjne i prezentacje, Grok 4.7 uzyskał 1 695 Elo, wzrost o 90 punktów.

Grok 4.7 scores 46 on the Artificial Analysis Intelligence Index to bring SpaceXAI into the top 4 AI labs. Coding Agent Index performance has also improved, overtaking GPT-5.6 Sol Grok 4.7 scores +2 points over Grok 4.6 on the Intelligence Index, with strong performance on… pic.twitter.com/8p4KC6cgZy — Artificial Analysis (@ArtificialAnlys) September 21, 2026

https://x.com/ArtificialAnlys/status/2102074898327932987?ref_src=twsrc%5Etfw

Artificial Analysis ustaliło, że poprawa wydajności wymagała znacznie większej mocy obliczeniowej. Przy wysiłku xhigh Grok 4.7 zużywał około 81 000 tokenów wyjściowych na zadanie Intelligence Index, ponad dwukrotnie więcej niż 36 000 tokenów używanych przez Grok 4.6 i niemal trzykrotnie więcej niż 27 000 tokenów zużywanych przez GPT-6 Astra przy maksymalnym wysiłku. Ponieważ stawki za token pozostały niezmienione, większe zużycie podnosi efektywny koszt porywalnego zadania, mimo że ceny nominalne nie wzrosły.

Firma odnotowała umiarkowane dodatkowe poprawy w Terminal-Bench 4.0 i GDP.pdf, a także niewielkie regresje w AA-LCR i AutomationBench-AA. Niezawodność poprawiła się umiarkowanie: wskaźnik halucynacji AA-Omniscience spadł z 34% do 29%, a trafność pozostała niemal bez zmian na poziomie 47%.

Pozostałe specyfikacje techniczne pozostają takie same jak w poprzedniej generacji, w tym niezmienione okno kontekstowe 500 000 tokenów. Cennik przy trafieniach w pamięci podręcznej jest obniżony do 0,50 dolara za milion tokenów. Przy modelu dostępnym w Cursor, Grok Build, Grok API, zewnętrznych harnessach, routerach modeli i platformach chmurowych programiści mogą teraz ważyć zyski benchmarkowe względem wyższego zużycia tokenów na własnych obciążeniach. Oryginalny raport jest dostępny w Metaverse Post.