AktualnościAkcjeSpaceXAI Elona Muska uruchamia Grok 4.7 z wynikiem 71% w benchmarku DeepSWE

SpaceXAI Elona Muska uruchamia Grok 4.7 z wynikiem 71% w benchmarku DeepSWE

Autor: Coinotag·

Najważniejsze informacje

  • SpaceXAI wydała 21 września Grok 4.7, opując go jako najzdolniejszy dotąd model do kodowania i pracy z wiedzą, z treningiem skupionym na zadaniach trwających kilka godzin.
  • Model startuje w cenie 2 USD za milion tokenów wejściowych i 6 USD za milion wyjściowych — identycznie jak Grok 4.6 i znacznie poniżej GPT-5.6 Sol (4 USD/20 USD) i Fable 5.1 (10 USD/50 USD).
  • W opublikowanych benchmarkach SpaceXAI Grok 4.7 zdobył 71,0% w DeepSWE v1.1, podniósł Terminal-Bench 4.0 z 20,3% do 38,0% oraz prowadził w EEBench i benchmarku agenta prawniczego Harvey, ustępując Fable 5.1 w CursorBench 4.0 i HealthBench Professional.
  • Przebudowany stos zabezpieczeń zablokował w HackerBench v0.3 wszystko poza 3,3% ryzykownych podpowiedzi o podwójnym zastosowaniu, przy niewielu fałszywych odmowach, a wybrani partnerzy z cyberbezpieczeństwa otrzymali dostęp red-team tylko na zaproszenie.
  • Na godziny przed premierą trzy ustawienia Groka 4.6 przegrały z każdą konfiguracją Codexa i Claude'a w Brood War Bench Bena Swerdlowa, z najlepszym wynikiem 2 zwycięstw na 18 meczów, a Grok 4.7 nie został jeszcze sklasyfikowany.
SpaceXAI Elona Muska uruchamia Grok 4.7 z wynikiem 71% w benchmarku DeepSWE

Grok 4.7 zaprojektowany dla zadań wielogodzinnych

SpaceXAI, jednostka sztucznej inteligencji Elona Muska, wydała 21 września Grok 4.7, opisując go jako najzdolniejszy dotąd model firmy do kodowania i pracy z wiedzą. Zgodnie z oficjalnym ogłoszeniem nowy system działa na większym modelu bazowym niż Grok 4.6 i przeszedł dłuższe cykle uczenia ze wzmocnieniem na trudniejszych zestawach zadań, ze świadomym naciskiem na problemy, których rozwiązanie zajmuje kilka godzin.

Firma osadziła premierę wokół wytrwałości. Tam, gdzie wcześniejsze modele odpowiadały w ciągu minut, Grok 4.7 jest dostrojony do drążenia zadań, które zajęłyby ludzkiemu inżynierowi lub analitykowi godziny. SpaceXAI podało, że model jest teraz wyraźnie lepszy w weryfikowaniu własnych wyników podczas długich sesji, obsłudze bardzo długich okien kontekstowych (ilości tekstu, którą model może naraz utrzymać w widoku roboczym) oraz natywnym operowaniu frameworkiem agentowym Grok Bot — czyli takiej konfiguracji wieloetapowej, w której model planuje, wywołuje narzędzia i sam wykonuje pracę, zamiast odpowiadać na pojedyncze polecenie — ulepszenia, które według firmy widać w rozmowach, zadaniach z wiedzy ogólnej oraz tworzeniu profesjonalnych dokumentów i prezentacji.

W opublikowanych benchmarkach konfiguracja xhigh sytuuje się blisko czołówki. W DeepSWE v1.1, zestawie testów z inżynierii oprogramowania, Grok 4.7 uzyskał 71,0%, minimalnie wyprzedzając Fable 5.1 max z wynikiem 70,0% i ustępując jedynie GPT-5.6 Sol max z wynikiem 727%. W Terminal-Bench 4.0, który ocenia wielogodzinną pracę w terminalu, model skoczył z 20,3% swojego poprzednika do 38,0%. W zestawach symulujących wielogodzinne zadania zawodowe prawników, pielęgniarek i analityków finansowych — w tym AA Briefcase i HealthBench — SpaceXAI stwierdziło, że Grok 4.7 dorównuje teraz najlepszym w branży.

Bezpieczeństwo to drugi główny claim. Przebudowany stos zabezpieczeń czyni tę wersję najtwardszą w historii firmy w odmawianiu niewłaściwych żądań i opieraniu się jailbreakom, czyli próbom nakłonienia modelu do obejścia zabezpieczeń. W HackerBench v0.3, testującym złośliwe zadania cybernetyczne, przez przeszło jedynie 3,3% podpowiedzi wysokiego ryzyka o podwójnym zastosowaniu — żądań mających zarówno legalne, jak i szkodliwe zastosowania — z niewieloma fałszywymi odmowami wobec legalnej defensywnej pracy bezpieczeństwa. Wybranym partnerom z cyberbezpieczeństwa przyznano dostęp red-team tylko na zaproszenie — testy adwersaryjne, w których badacze bezpieczeństwa szukają słabości systemu — w celu wsparcia badań defensywnychn
Model jest już dostępny przez Cursor, Grok Build, API Groka, największe platformy chmurowe oraz routery modeli — usługi, które przekazują żądanie dewelopera wybranemu przez niego modelowi AI przez jeden interfejs.

Ceny 2 USD utrzymane, podczas gdy Brood War Bench kompromituje Grok 4.6

Ceną jest cicha stała: Grok 4.7 startuje w cenie 2 USD za milion tokenów wejściowych i 6 USD za milion tokenów wyjściowych — identycznie jak Grok 4.6 — plus szybki wariant, który podwaja prędkość generowania za podwójną cenę. Tokeny to jednostki tekstu, które modele językowe czytają i generują, i według nich rozliczane jest API: wejście obejmuje to, co wysyła deweloper, a wyjście to, co odsyła model. Stawki mocno biją konkurencję: GPT-5.6 Sol kosztuje 4 USD/20 USD za milion tokenów, a Fable 5.1 — 10 USD/50 USD, co stawia ceny Groka na poziomie mniej więcej jednej trzeciej do połowy stawek rywali przy szybszym działaniu.

Własna tabela porównawcza SpaceXAI pokazuje, że Grok 4.7 prowadzi w inżynierii elektrycznej (EEBench: 64,0% wobec 39,4% dla GPT-5.6 Sol i 56,4% dla Fable 5.1) oraz w benchmarku agenta prawniczego Harvey (19,6% wobec 2,5% i 6,7%), podczas gdy ustępuje Fable 5.1 w inżynierii oprogramowania (CursorBench 4.0: 46,3% wobec 51,8%) i w rozumowaniu klinicznym (HealthBench Professional: 56,7% wobec 62,1%). Wszystkie powyższe dane pochodzą z opublikowanych materiałów SpaceXAI.

Kontekst korporacyjny ma znaczenie: SpaceXAI przybrało obecną formę w lutym, gdy xAI połączyło się ze SpaceX, po czym w czerwcu nastąpiło przejęcie Cursora — edytora kodu AI, który jest jednocześnie jednym z kanałów premiery Groka 4.7 — części imperium Muska obejmującego Teslę (TSLA) i, według wcześniejszych doniesień, dążenie do konsolidacji planów subskrypcyjnych AI w ciągu kilku tygodni.

Na godziny przed premierą crowdsourcedowy benchmark however obnił reputację poprzednika. Brood War Bench dewelopera Bena Swerdlowa, w którym agenty AI grają w StarCraft: Brood War, krążył po X 20 września: 19 konfiguracji z Codexa, Claude'a i Groka stoczyło 171 meczów bezpośrednich a Codex Astra wygrał wszystkie 18 swoich gier przy maksymalnym rozumowaniu. Trzy ustawienia Groka 4.6 przegrały z każdą konfiguracją Codexa i Claude'a, z najlepszym wynikiem 2 zwycięstw na 18. Strategia czasu rzeczywistego to wymagający test dla agentów, ponieważ decyzje gospodarcze, produkcyjne i bojowe napływają nieprzerwanie — nie ma tury, w której można się zatrzymać i zaplanować.

Swerdlow odnotował mecz, w którym konfiguracja Groka o najwyższym rozumowaniu spaliła 11 138 tokenów rozumowania przez 43 minuty, wydając jedynie sześć paczek rozkazów — nie wystawiając ani jednej jednostki bojowej. Napisał, że Grok nie jest jeszcze na tyle inteligentny, by grać w tę grę, a starsze modele traktują strategię czasu rzeczywistego jak turową; dodał, że żaden uczestnik nie przekroczył poziomu nowicjusza. Grok 4.7 nie został jeszcze sklasyfikowany.

Ocena COINOTAG: presja cenowa to prawdziwy sygnał

Razem wyniki z dnia premiery i rezultaty z Brood War opowiadają jedną historię: laboratoria frontowe sprzedają teraz rozumowanie w cenach towarowych, a niezawodność agentowa — a nie statyczne wyniki benchmarków — decyduje o tym, kto wygrywa. Według oceny COINOTAG harmonogram 2 USD/6 USD daje Grokowi 4.7 tokenomikę, którą rywale muszą dorównać, podobnie jak ceny kontraktów futures zmuszają rynki do zakotwiczenia oczekiwań na nowo, podczas gdy laboratoria bez porównywalnej mocy obliczeniowej ryzykują staniem się exit liquidity w tej wojnie cenowej. Serwis dodał, że nagłówki Muska dotyczące mocy obliczeniowej historycznie poruszały sentyment wobec powiązanych z Muskiem aktywów, takich jak Dogecoin (DOGE), i doradzał śledzenie wyników agentowych Groka 4.7, a nie jego obietnic premiery.