AktualnościAkcjeUżytkownicy GPT-6 Astra twierdzą, że nowy model OpenAI został „nerfed”

Użytkownicy GPT-6 Astra twierdzą, że nowy model OpenAI został „nerfed”

Autor: Decrypt·

Najważniejsze informacje

  • Niektórzy użytkownicy zgłaszają, że GPT-6 Astra teraz oferuje szybsze odpowiedzi o niższej jakości, a deweloper Pankaj Kumar podejrzewa, że OpenAI zmniejszyło wysiłek obliczeniowy modelu — zmianę, której firma nie potwierdziła.
  • Salio i badacz Md Ismail Sojal powiedzieli, że wykonali identyczne prompty w dniu premiery i na bieżącej wersji przy tych samych ustawieniach, i obaj zgłosili gorsze wyniki z aktualnego modelu.
  • Zespół Daxa Raada (Opencode) wrócił do GPT-5.6 Sol po podwojeniu się wydatków, uznając, że wady Astery nie były warte jej premium ceny.
  • Krytycy, w tym Antikythera i założyciel T3Chat Theo, twierdzą, że model się nie zmienił, a wygasający entuzjazm z tygodnia premiery odsłania od dawna istniejące niespójności.
  • Astra pozostaje pierwszym modelem OpenAI, który przekroczył próg krytyczny ryzyka cyberbezpieczeństwa, i jest wyceniona na 10 dolarów za milion tokenów wejściowych i 50 dolarów za milion tokenów wyjściowych — 2,5 raza więcej niż Sol w dniu premiery.
Użytkownicy GPT-6 Astra twierdzą, że nowy model OpenAI został „nerfed”

Użytkownicy masowo skarżą się na X, że GPT-6 Astra od OpenAI stracił na możliwościach zaledwie tydzień po premierze. Niektórzy użytkownicy zgłaszają szybsze odpowiedzi i gorsze wyniki, inni zaś twierdzą, że model zawsze był niespójny, a początkowe podekscytowanie po prostu przesłaniało jego słabości.

Tydzień temu GPT-6 Astra odbudowywał Manhattan ulica po ulicy w silniku gry, imponując użytkownikom swoimi możliwościami. W tym tygodniu część z tych samych użytkowników publikuje zrzuty ekranu i pyta OpenAI, co stało się z modelem.

Astra wydaje mi się dziś wyraźnie głupsza”, napisał na X znany anonimowy deweloper synthwavedd. „To tylko kwestia czasu przed pooperacyjną lobotomią. Wstyd.”

Wzorzec jest znajomy użytkownikom chatbotów i agentów AI, którzy czasem mają wrażenie, że ich ulubiony model został po premierze „nerfed” — termin zapożyczony z gier, opisujący osłabianie przez deweloperów czegoś, co było nadmiernie silne. Za odczuwalnymi spadkami wydajności mogą stać racjonalne wyjaśnienia, ale liczba podobnych skarg na GPT-6 Astra skłoniła użytkowników do porównywania wyników i badania, czy model się zmienił. Pytanie ma praktyczne znaczenie dla deweloperów, którzy budują produkty na modelach wynajmowanych, a nie uruchamianych we własnym zakresie — a ponieważ systemy własnościowe nie udostępniają żadnych wnętrz do inspekcji, porównania wyników obok siebie są jednym z niewielu narzędzi weryfikacji dostępnych dla obserwatorów z zewnątrz.

Deweloper Pranjal Paliwal, który wcześniej chwalił Astrę, powiedział, że później przejrzał kod napisany przez model i zmienił swoją ocenę.

Nie mamy AGI”, napisał Paliwal. „Mamy regresję.”

AGI, czyli sztuczna inteligencja ogólna, to branżowy termin określający maszynę zdolną wykonać w zasadzie każde zadanie poznawcze, które potrafi wykonać człowiek. Prezes OpenAI użył tego terminu podczas premiery Astery. Tydzień później Paliwal przywołał go, by opisać rozdźwięk między pozornymi możliwościami modelu a jego błędami.

Inne skargi mają podobny charakter. Deweloper Pankaj Kumar wymienił wśród objawów szybsze odpowiedzi i niższą jakości, a także podejrzenie, że OpenAI „zmniejszyło juice value”. Założycielka Saba zapytała wprost OpenAI, dlaczego musi teraz „upraszczać zadania”, żeby je zrealizować.

„Juice value” nie jest oficjalnym terminem technicznym. W tym kontekście użytkownicy używają go jako skrótu myślowego oznaczającego wysiłek obliczeniowy, jaki model wkłada w zastanowienie się przed odpowiedzią, oraz podejrzenia, że OpenAI mogło zmniejszyć ten wysiłek po prezentacjach premierowych. OpenAI nie potwierdziło, że dokonało takiej zmiany w Astrze.

Niektórzy użytkownicy przeprowadzili bezpośrednie porównania. Salio i badacz Md Ismail Sojal powiedzieli, że wykonali identyczne prompty na Astrze w dniu premiery i ponownie na wersji bieżącej, przy tych samych ustawieniach. Obaj zgłosili gorsze wyniki z aktualnego modelu.

Dzisiejsze wyniki GPT-6 Astra wyglądają gorzej. GPT-6 Astra w dniu premiery kontra GPT-6 A dzisiaj”, napisał Sojal. W poście napisano, że porównanie użyło tego samego promptu i ustawień oraz że „[r]óżnica jest większa, niż oczekiwałem”.

Inni użytkownicy twierdzą, że wrócili do poprzednika Astery. Dax Raad, twórca narzędzia do kodowania Opencode, powiedział, że jego zespół wrócił do GPT-5.6 Sol, ponieważ wydatki się podwoiły, a wady korzystania z Astery nie były warte kosztów. Użytkownik ChatGPT Mustafa Sahinli porównał Astrę do Claude Opus 4.6 „po 1 tygodniu od premiery”, nawiązując do fali krytyki, jaką model Anthropic również spotkał po premierze.

Nie wszyscy wierzą, że OpenAI celowo osłabiło Astrę. Anonimowy użytkownik Antikythera przedstawił szczegółowe przeciwnargumenty, twierdząc, że oś czasu może biec w przeciwnym kierunku.

Jest tak samo głupia jak w dniu premiery”, napisał Antikythera. „Model jest dobry, ale ma mnóstwo problemów. Jest leniwy. Pisze jak uzależniony od punktów... ludzie byli przesadnie podekscytowani w tygodniu premiery, teraz mieli czas go przetestować i zobaczyć jego błędy.”

Według tego wyjaśnienia Astra nie stała się mniej zdolna; użytkownicy po prostu przestali być oślepieni wczesnymi pokazami i zaczęli zauważać powtarzające się problemy modelu.

Theo, założyciel T3Chat, przedstawił podobne zdanie. Powiedział, że Astra jest mniej spójna niż Claude Fable i potrafi wygenerować zarówno znakomity, jak i skrajnie słaby kod.

GPT-6 Astra dokonał niesamowitych rzeczy, o jakich nigdy nie myślałem, że model potrafi. Zrobił też niektóre z najgłupszych rzeczy, jakie kiedykolwiek widziałem po modelu. Ogólnie rzecz biorąc, Fable 5.1 po prostu robi to, o co proszę”, napisał Theo na X 8 września 2026 r. Wzrost liczby negatywnych przykładów może, jego zdaniem, odzwierciedlać koniec począowego okresu „miodowego miesiąca” modelu, a nie potwierdzoną zmianę jego zachowania.

Debata przypomina wydarzenia wokół poprzedniego flagowego modelu OpenAI, GPT-5.6 Sol. W lipcu użytkownicy mówili, że najwyższy tryb rozumowania Sola nagle stał się bardziej powierzchowny. Dyrektor OpenAI Tibo Sottiaux zaprzeczył celowemu osłabianiu modelu, ale potwierdził, że firma eksperymentowała z „reasoning effort” — ustawieniem kontrolującym, ile kroków model „przemyśli” przed udzieleniem odpowiedzi.

Jedna z odpowiedzi podsumowała powtarzający się żart o zamkniętych laboratoriach AI: firma wypuszcza model, a kilka dni później łapie on „jakąś chorobę i nagle staje się głupszy”. Inny użytkownik przedstawił bardziej cyniczne wyjaśnienie w jednym zdaniu: „Pewnie je kwantyzują, żeby firmy nie paliły tyle pieniędzy”.

Kwantyzacja zmniejsza precyzję wewnętrznych obliczeń modelu, by obniżyć koszty obliczeniowe, często kosztem potencjalnej utraty dokładności. OpenAI nigdy nie potwierdziło celowej kwantyzacji wydanego modelu.

OpenAI nie wydało oświadczenia w sprawie Astery w stylu tego dotyczącego Sola. W lipcu podobna fala skarg na Sol spotkała się z oficjalną odpowiedzią dyrektora firmy; czy OpenAI odniesie się do skarg na Astrę w ten sam sposób, pozostaje pytaniem otwartym. Model pozostaje pierwszym modelem firmy, który przekroczył to, co OpenAI nazywa progiem krytycznym ryzyka cyberbezpieczeństwa. To oznaczenie oznacza, że Astra może znajdować i łączyć w łańcuchy wcześniej nieznane luki w oprogramowaniu bez ludzkiego nadzoru — zdolność ograniczoną do zweryfikowanych obrońców w ramach programu OpenAI Daybreak.

Niezależnie od tego, czy Astra stała się mniej zdolna, jego cenę pozostaje 10 dolarów za milion tokenów wejściowych i 50 dolarów za milion tokenów wyściowych — 2,5 raza więcej niż Sol w dniu premiery, dopłata, która zdaniem co najmniej jednego zespołu już nie jest warta swoich pieniędzy.