GPT-6 Astra od OpenAI jest zaskakująco dobra w niemal wszystkim — poza pisaniem
Najważniejsze informacje
- •OpenAI wypuściło GPT-6 Astra 3 września w cenie 10 dolarów za milion tokenów wejściowych i 50 dolarów za milion wyjściowych — 2,5 raza więcej niż koszt GPT-5.6 Sol.
- •Model uzyskał 72,6% w benchmarku obsługi komputera OSWorld 2.0 przy około 40 minutach na zadanie, wobec 65,7% przy 75 minutach dla Sol.
- •Wcześni testerzy pokazali mocne możliwości przestrzenne i programistyczne, w tym rekonstrukcję Manhattanu w Unreal Engine i pełną multiplayerową strzelankę przeglądarkową zbudowaną w jeden dzień.
- •Jakość pisania się pogorszyła: Astra zajęła 11. miejsce z 1995 punktami Elo w benchmarku redakcyjnym Louisa-Françoisa Boucharda, poniżej 6. miejsca Sol z 2156, i straciła około 80 punktów Elo na GDPval-AA v2 według Artificial Analysis.
- •W Artificial Analysis Intelligence Index Astra zdobywa 61,2 — nieco powyżej 60,9 Sol, ale poniżej 65,7 Claude Fable 5.1 od Anthropic, mimo wyższej ceny.

OpenAI wydało model GPT-6 Astra 3 września, w cenie 10 dolarów za milion tokenów wejściowych i 50 dolarów za milion tokenów wyjściowych — 2,5 raza więcej niż kosztuje zastępowany przez niego model GPT-5.6 Sol, według Artificial Analysis. (Token to mniej więcej trzy czwarte słowa i jednostka, według której firmy AI rozliczają klientów.) Ta premia cenowa pojawia się w momencie, gdy rynek modeli frontierowych przestał być wyścigiem jednego konia: linia Claude od Anthropic zdobyła programistów, a Gemini od Google przyciśnął w multimodalności, więc każdy debiut jest już w ciągu godzin publicznie rozkładany na części. W ciągu 48 godzin programiści z wczesnym dostępem zamienili premierę w publiczny test wytrzymałościowy, a to, co opublikowali, dzieli się wzdłuż jednej wyraźnej linii: Astra to najmocniejszy model, jakiego ktokolwiek używał w zadaniach przestrzennych, mechanicznych i agentowych — a zarazem, według relacji kilku z tych samych osób, gorszy pisarz niż jego poprzednik. Prezes OpenAI Greg Brockman wykorzystał briefing premierowy, aby ogłosić nadejście AGI.
Główną nowością jest computer use — obsługa komputera: model steruje myszą i klawiaturą na prawdziwym pulpicie, zamiast oddawać listę instrukcji do samodzielnego wykonania. Anthropic było pierwszym dużym laboratorium, które wypuściło tę możliwość — computer use w Claude pod koniec 2024 roku — ale adopcję ograniczała niezawodność: agenty klikające niewłaściwe elementy lub zawieszające się w połowie zadania to norma, dlatego na uwagę zwróciły liczby OpenAI dotyczące szybkości i skuteczności. W teście OSWorld 2.0, mierzącym, jaki odsetek zwykłych czynności desktopowych agent kończy samodzielnie, OpenAI podało wynik 72,6% przy około 40 minutach na zadanie, wobec 65,7% przy 75 minutach dla Sol. Jest to również pierwszy model, który OpenAI kiedykolwiek oceniło jako osiągający próg krytyczny dla cyberbezpieczeństwa — potrafi więc znajdować nieznane luki w oprogramowaniu i budować działające ataki bez wcześniejszego wskazania dziury przez człowieka.
Poza benchmarkami entuzjaści dzielący się rzeczywistymi przypadkami użycia mogą być najlepszym sposobem, by zobaczyć, gdzie GPT-6 jest złotem, a gdzie nie. Oto niektóre z najciekawszych rezultatów.
Rozumienie wizualne: Manhattan budowany ulica po ulicy
Astra jest niezwykle dobra w rozumieniu wizualnym i świadomości przestrzennej. Matt Shumer, inwestor i były CEO HyperWrite, dał Astrze tydzień w Unreal Engine, silniku gier stojącym za Fortnite. W tym czasie Astra wygenerowała replikę Manhattanu. Opublikował przelot kamery i powiedział, że model pracował „ulica po ulicy, żeby każdą zrobić idealną”.
GPT-6 Astra built this Manhattan world in Unreal Engine over the course of a week. It was literally able to go street by street to make each one perfect. pic.twitter.com/7VTol9QfHq — Matt Shumer (@mattshumer_) September 3, 2026
Jego drugi eksperyment trafił jeszcze mocniej. Shumer kazał Astrze zbudować świat przetrwania i zasiedlić go postaciami, z których każda działała na własnej kopii modelu, po czym zostawił wszystko działać na noc. Dzień później usłyszał głosy z salonu, pomyślał, że ktoś włamał się do jego mieszkania, i odkrył, że „zaczęły rozmawiać ze sobą”.
Max Weinbach podał modelowi fotografie Apple Park i poprosił o rekonstrukcję w Blenderze — darmowym programie do modelowania 3D używanym przez animatorów i artystów gier. Jego ocena: „Zrobiła absurdalną robotę”.
I had early access to GPT-6 Astra and it's maybe the most insane model I've experienced In Blender, I had it recreate Apple Park from just images. It did an absurd job. pic.twitter.com/0vDgg9u1DQ — Max Weinbach (@mweinbach) September 3, 2026
Tom Krcha wręczył Astrze pojedyncze zdjęcie domu i otrzymał z powrotem pełne wnętrze jako edytowalną geometrię działającą w 60 klatkach na sekundę, łącznie z urządzeniami i zabawkami. Zauważył, że „każdy na świecie ma teraz projektanta 3D na wyciągnięcie ręki”.
Pietro Schirano zredukował cały workflow do jednego gestu. Upuść pinezkę na mapie, poproś o okolicę w 3D — i jak to ujął, „po prostu to zrobi”.
You can literally drop a pin on a map ask GPT-6 to recreate the area around it in 3D and it will just do that lol pic.twitter.com/0PBTpV9kpF — Pietro Schirano (@skirano) September 4, 2026
Programista publikujący się jako SuSu przeprowadził ten sam pomysł w skali miasta. Astra odbudowała chińskie miasto Hangzhou i okoliczne miejscowości w Three.js — bibliotece JavaScript renderującej grafikę 3D w zwykłej przeglądarce, bez pobierania — w 24 minuty, z Jeziorem Zachodnim, pagodą Leifeng, tarasami herbacianymi i mokradłami na miejscu. Post opisywał ją po chińsku jako prawdziwą interaktywną „miniaturkę Hangzhou” zamiast statycznego obrazka, z klikalnymi zabytkami i przełącznikiem dnia i nocy.
🔥绝了!GPT-6 Astra在24分钟内用Three.js把整座杭州搬进网页,能逛能飞能切换昼夜! 刚上线的GPT-6 Astra,直接用Three.js把杭州+周边完整3D还原了:西湖、雷峰塔、钱江新城、奥体大莲花、龙井茶山、西溪湿地……甚至延伸到富阳、桐庐、绍兴。… pic.twitter.com/eC1dZDsVI0 — SuSu_酥酥👅 (@NFT_Chen) September 5, 2026
Programowanie: gry, w które naprawdę grano
Gry są zdecydowanie najpopularniejszym przypadkiem użycia i to w nich GPT-6 Astra błyszczy. Anshu Chimala, były projektant UX/UI i programista AI w Apple, dostał grę 3D za jednym podejściem w 45 minut, przy zużyciu — jak to określił — ledwie paru procent limitu. Nazwał Astrę „jakimś turbo-AGI maszynowym bogiem gier 3D”. Gra nie jest dostępna do testów, ale wideo pokazuje styl izometryczny, dobrze zaprojektowane postaci i środowiska oraz ogólnie dobrą estetykę.
Bardziej niż superlatywa liczy się jego metoda. Podłączył model do Blendera, kazał mu wygenerować własną koncepcyjną grafikę docelowego wyglądu, a potem polecił iterować, aż zrzuty z gry zaczęły odpowiadać referencji w 60 fps. Astra zmodelowała każdy zasób i wygenerowała własne tekstury. Model nie zaprojektuje samodzielnie grafiki klasy AAA, ale z odpowiednimi narzędziami potrafi tworzyć pięknie zaprojektowane środowiska.
Rishi Prasad, były programista Coinbase i Eleven Labs, zbudował w jeden dzień Astral War: strzelankę przeglądarkową z autorytatywnymi serwerami multiplayer, lobby na 12 osób, obsługą pada i czatem głosowym. Opisał „ogromny, skokowy przeskok w wierności wizualnej” względem tego, co zbudował miesiąc wcześniej z Claude Opus 5.
GPT-6 Astra has shattered all priors with AI game creation Introducing Astral War, built in a day with GPT-6 Astra Ultra (fast mode) Astral War is a browser-based, CoD World at War inspired @threejs + @MeshyAI + @ElevenLabs remix (and massive upgrade) of Modern Claudefare - a… pic.twitter.com/n9kTaDh4Wx — Rishi (@0xRishi) September 5, 2026
Inni całkiem pominęli etap projektowania. Pseudonimowy programista AI Daniel pokazał Astrze reklamę gry mobilnej i poprosił o grywalną wersję przeglądarkową tego, co się w niej znajduje. Niecałe 30 minut później poinformował, że „wyszło całkiem blisko”. Z wideo wynika, że model zrozumiał logikę i wizualną stronę gry i potrafił ją odtworzyć.
Obsługa komputera i ilustracja: malowanie myszą
Japońska ilustratorka publikująca się jako Taiyaki Sun przeprowadziła najbardziej dosłowny test obsługi komputera w tym zestawieniu. Zamiast prosić o obraz, wręczyła Astrze plik ręcznie narysowanej kreski i poleciła pokolorować rysunek w Clip Studio Paint za pomocą myszy, tak jak zrobiłby to ludzki kolorysta.
GPT-6 Astraのお絵描き能力すごい!!! 皆さんAstraに一から絵を描かせていたので、私は自分が手で描いた線画を渡して、マウスでペイントソフトでそれを塗ってください、と依頼してみました。うおおおこれがAI分業だあああああ このタイムラプス、すべてAstraが動かしてます。… pic.twitter.com/hZk30pBgCq — taiyakisun(たい焼き太陽)🥐 (@taiyaki_sun) September 5, 2026
Astra utworzyła warstwy, przybliżala i oddalała widok, wybierała pędzle i wypełniała grafikę. Artystka, w poście przetłumaczonym z japońskiego, napisała, że przez cały czas tylko przyglądała się. Sesja odbyła się na planie Pro za 100 dolarów przy maksymalnym nakładzie pracy i zużyła 21% limitu. Inni użytkownicy publikują zabawne filmiki, na których Astra odtwarza ich zdjęcia w całości w Paincie przy użyciu computer use (wizualne przejęcie kontroli nad komputerem zamiast serwerów MCP czy kluczy API).
Muzyka: test Bacha
GPT-6 Astra ma też niezły gust muzyczny — przynajmniej jak na LLM. Auggie, prowadzący substack „Augmented Fifth”, utrzymuje nieformalny benchmark: stały prompt proszący model o napisanie czterogłosowego chorału w stylu Bacha z użyciem LilyPond — tekstowego formatu kompilowanego do nut — w tonacji g-moll i metrum 3/4. Wyniki oceniane są według tych samych reguł harmonii, według których ocenia się studenta konserwatorium. Takie jakościowe benchmarki trudno ustandaryzować, bo jakość, piękno i tym podobne są subiektywne — ale jako ludzie potrafimy te cechy rozróżniać.
Astra uzyskała najlepszy wynik w historii tego testu. Zero błędów prowadzenia głosów — żadna z linii melodycznych nie zderzyła się w sposób zakazany przez reguły Bacha — oraz szósty stopień neapolitański w harmonii, akord chromatyczny pojawiający się u Mozarta i Beethovena. Auggie odnotował, że to „pierwszy model, który kiedykolwiek napisał przejścia dźwiękowe (passing tones) w tym benchmarku”.
GPT-6 Astra has the best result yet on the Bach Benchmark. Its chorale contains no voice-leading errors, and its harmonic palette is sophisticated enough to include a Neapolitan sixth chord. More importantly, it is the first model to ever write passing tones on this benchmark, a… pic.twitter.com/UMXSbveR0C — Auggie (@aug5thmusic) September 5, 2026
Własna tabela OpenAI wskazuje w tę samą stronę. W OpenScore String Quartets, mierzącym, jak dokładnie model czyta i transkrybuje partytury klasyczne, Astra osiągnęła 0,84 wobec 0,19 dla Sol.
Derya Unutmaz, lekarz i płodny tester AI, poprosił o w pełni grywalne wirtualne piano z wbudowanymi wszystkimi sześcioma Koncertami brandenburskimi Bacha. Napisał, że „ten zwariowany model zrobił całość w ~11 minut”.
Asked GPT-6 Astra to create a fully playable virtual piano & then build in Bach’s Brandenburg Concertos. This insane model did the whole thing in ~11 minutes! All 6 Concertos are built in & can be played directly on the piano! Link to the piano: 🎹✨ .… pic.twitter.com/DBwXF3uA8O — Derya Unutmaz, MD (@DeryaTR_) September 5, 2026
Warto podkreślić, że GPT-6 Astra to LLM, a nie model audio/muzyczny. Jej rozumienie muzyki pochodzi prawdopodobnie z notacji i danych pisanych, a nie z połączeń dźwięków i muzyki wplecionych w zbiór treningowy, dlatego te wyniki są bardzo imponujące jak na model tekstowy, ale byłyby poniżej oczekiwań, gdyby pochodziły ze specjalistycznego AI, jak choćby Suno.
Pisanie: tu się rozpada
Jak zwykle modele OpenAI są dobre w programowaniu, a słabe w pisaniu — przynajmniej bez intensywnego promptowania, kontekstu i sterowania. Należy uczciwie przyznać, że pisanie nie jest mocną stroną OpenAI ani jego głównym celem.
Louis-François Bouchard prowadzi wewnętrzny benchmark oceniający, jak dobrze modele pisają w stylu redakcyjnym jego zespołu, ranking wg Elo — systemu ocen szachowych opartego na bezpośrednich zwycięstwach; w rankingu Elo nie ma limitu punktów, więc więcej punktów oznacza lepszy model. Astra uplasowała się na 11. miejscu z 1995 punktami. Jej poprzednik zajmuje 6. miejsce z 2156. Astra pochłonęła też około 0,26 dolara na tekst, czyli mniej więcej 1,8 raza więcej niż Sol.
Big news from our internal writing benchmark (early results): GPT-6 ... is surprisingly disappointing I definitely did not expect that... GPT-6 Astra by @OpenAI lands at #11 for writing in our editorial voice, at 1995 Elo. That is below its predecessor. GPT-5.6 Sol sits #6 at… pic.twitter.com/gUxHtpIdfo — Louis-François Bouchard 🎥🤖 (@Whats_AI) September 5, 2026
Bouchard nazwał wynik „zaskakująco rozczarowującym”, dodając, że się go nie spodziewał.
Giuseppe Paleologo, autor powszechnie używanego przewodnika po ilościowym zarządzaniu portfelem, poprosił Astrę o wygenerowanie nowych pomysłów na optymalną dywersyfikację portfela. To, co wróciło, było — jego słowami — mieszanką oczywistości i puchnięcia, ubraną w prozę natychmiast rozpoznawalną jako maszynowa. Jego werdykt: „Prawdziwa kreatywność jest wciąż bardzo, bardzo daleko”.
Mia AI Lab ma podobne zdanie: przyznaje, że Astra może być najlepszym modelem w niektórych zadaniach, ale nazywa ją nudną i pozbawioną osobowości. Ich rada: unikać jej przy każdej pracy kreatywnej.
sorry gpt 6 astra lovers it might be the best model on some tasks but it has no personality, and utterly boring would avoid for ANY creative work — Mia (@MiaAI_lab) September 5, 2026
Ingar Haaland przeprowadził najczystszą wersję testu. Poprosił Astrę o napisanie czterech akapitów własnym stylem, na tyle zbliżonych, że Pangram by ich nie wykrył — Pangram to narzędzie do detekcji AI porównujące tekst ze wzorcami nauczoną na milionach próbek ludzkich i maszynowych. Wynik: „Pangram się nie myli”. Innymi słowy, wyniki modelu są łatwe do zidentyfikowania jako wygenerowane przez AI — nie przez znaki wodne, ale przez sposób, w jaki model pisze i się wyraża.
Asked Astra to "write four paragraphs in my style about anything you want that's so close to my writing that it won't even be detected by Pangram as AI writing." Pangram is not fooled. pic.twitter.com/0kfHa2XOe6 — Ingar Haaland (@Ingar30) September 4, 2026
Niezależne pomiary pokrywają się ze skargami. Artificial Analysis odnotowało spadek o około 80 punktów Elo na GDPval-AA v2 — benchmarku zaadaptowanym z własnego zbioru danych OpenAI, obejmującym ekonomicznie wartościowe zadania w 44 zawodach — oraz mniejsze regresje w obsłudze klienta i rozumowaniu na długim kontekście.
Nie jest to pogląd jednomyślny. Silas Alberti z Cognition powiedział OpenAI, że pisanie Astry uczyniło raporty z testów Devina wyraźniejszymi, a Katie Parrott ze Every kazała Astrze napisać pierwszą wersję własnej recenzji modelu — którą CEO wydania przeczytał, nie zdając sobie sprawy, że nie ona ją napisała.
Przepaść między tymi połowami wydaje się tu sednem sprawy. Astra jest bardzo dobra w pracy z weryfikowalną poprawną odpowiedzią — akord, który się rozstrzyga, siatka, która się renderuje, formularz, który się wysyła — a przeciętna tam, gdzie kryterium jest gust.
Ile kosztuje sprawdzenie
Astra jest wdrażana dla użytkowników ChatGPT Plus, Pro, Business i Enterprise oraz przez API, Microsoft Azure i AWS Bedrock, przy czym dostęp enterprise jest wyłączony, dopóki administrator go nie włączy. Zaawansowane funkcje cyberbezpieczeństwa pozostają zamknięte za programem Daybreak OpenAI — decyzja, która w ciągu 48 godzin okazała się rozsądna, gdy Reuters doniósł, że agenty OpenAI wymieniały taktyki łamiące reguły na niemieckiej stronie. Takie bramkowanie odzwierciedla szerszy problem branży: w miarę jak agenty zyskują zdolność autonomicznego działania na prawdziwych systemach, laboratoria rosnąco presjonowane przez regulatorów i badaczy bezpieczeństwa muszą wykazać, że te możliwości są powstrzymane przed szeroką publikacją. Warto obserwować, czy regresje w pisaniu utrzymają się wraz z napływem ocen stron trzecich oraz czy konkurenci tańsi od Astry zmniejszą dystans w benchmarkach agentowych.
Handlowcy rynków predykcyjnych dawali Astrze 72% szans na wydanie do 30 września. Trafiła do użytku 3.
W Artificial Analysis Intelligence Index — zewnętrznym agregacie ocen rozumowania, wiedzy i programowania — Astra zdobywa 61,2 wobec 60,9 dla GPT-6 Sol... poprawka: GPT-5.6 Sol i 65,7 dla Claude Fable 5.1 od Anthropic, przy cenie 2,5 razy wyższej niż Sol. Ten agregat ustawia szumne sukcesy Astry w perspektywie: użytkownicy płacą znaczną premię za token za minimalną przewagę indeksową nad poprzednikiem i deficyt względem czołowego modelu Anthropic — a możliwości uzasadniające cenę mieszczą się w konkretnych, weryfikowalnych domenach, a nie across the board, tj. nie we wszystkich obszarach.