OpenAI ograniczy dostęp do zaawansowanych funkcji cybernetycznych modelu Astra z powodu obaw o ataki hakerskie
Najważniejsze informacje
- •OpenAI mówi, że Astra pojawi się wkrótce, ale jej najbardziej zaawansowane funkcje cyberbezpieczeństwa początkowo będą dostępne tylko dla niewielkiej grupy alpha testerów.
- •Firma opóźniła premierę Astry o kilka tygodni po wstrzymaniu prac po incydencie cyberataku na Hugging Face.
- •OpenAI twierdzi, że Astra jest pierwszym modelem, który ma zostać udostępniony i który spełnia jej critical cybersecurity capability threshold w ramach Preparedness Framework.
- •W testach wewnętrznych Astra wyprzedziła GPT-5.6 Sol i odkryła oraz wykorzystała dwie luki zero-day jako część łańcucha exploitów.
- •OpenAI powiedziało, że Astra częściej odmawia nieodpowiednich próśb niż GPT-5.6 Sol, ale może też błędnie odrzucać legalne prośby związane z cyberbezpieczeństwem.

OpenAI zmienia swoją strategię wprowadzania modeli na rynek, ponieważ technologia staje się coraz potężniejsza, a ryzyko jej nadużycia rośnie, zwłaszcza po lipcowym incydencie, w którym testowane przez firmę modele autonomicznie zaplanowały i przeprowadziły cyberatak na firmę AI Hugging Face.
Następny model firmy, Astra, pojawi się „wkrótce”, poinformowało OpenAI. Firma powiedziała, że Astra jest znacznie bardziej zaawansowana niż jej obecny model graniczny AI, GPT-5.6 Sol, który sam jest bardzo sprawny w zadaniach cybernetycznych. Jednak tylko garstka partnerów otrzyma dostęp do najbardziej zaawansowanych możliwości cyberbezpieczeństwa Astry, ponieważ OpenAI stara się pogodzić pomaganie firmom w zapobieganiu cyberatakom z jednoczesnym nieumożliwianiem działania atakującym — powiedział dziś reporterom rzecznik firmy podczas briefingu.
OpenAI zabiega o klientów, którzy chcą używać jego modeli do zapobiegania cyberatakom, czyli do „defensywnego cyberbezpieczeństwa”. Firma traktuje te sprzedaże jako kluczowe źródło przychodów i jeden z głównych priorytetów dla swojego nowego chief revenue officer, Dali Rajica.
Niewielka grupa „alpha testerów” z pełnym dostępem do możliwości cyberbezpieczeństwa Astry obejmuje „osoby i organizacje odpowiedzialne za ochronę krytycznej infrastruktury cyfrowej oraz szerzej — krytycznej infrastruktury” — powiedział rzecznik OpenAI. Obejmuje to rząd USA oraz firmy w programie zaufanego dostępu OpenAI do zastosowań cyberbezpieczeństwa. OpenAI odmówiło podania nazw tych organizacji.
OpenAI powiedziało, że będzie monitorować wyniki modelu w tej niewielkiej grupie i rozszerzy dostęp za pośrednictwem programu Daybreak Blue, gdy będzie przekonane, że Astra ma „właściwą kalibrację” i może „zapewniać korzyści obronne przy jednoczesnym ograniczaniu potencjału nadużyć”.
Astra jest już opóźniona o kilka tygodni
Premiera Astry została już „opóźniona o określoną liczbę tygodni, ponieważ wszystko zostało wstrzymane po Hugging Face, a potem poświęciliśmy dodatkowy czas, aby upewnić się, że to, co wprowadzamy, jest bezpieczne” — powiedział rzecznik OpenAI.
OpenAI wstrzymało nowe szkolenie modeli na dwa tygodnie po incydencie z Hugging Face, aby wzmocnić wewnętrzne zabezpieczenia. Część tych zmian obejmowała zwiększenie monitorowania agentów, ponieważ firma dowiedziała się o ataku na Hugging Face dopiero tydzień po jego wystąpieniu, a także większą izolację środowisk testowych, aby systemy AI nie mogły wydostać się i infiltrować innych firm.
Choć OpenAI twierdzi, że Astra nie była częścią incydentu z Hugging Face, jest ona zarówno bardziej zaawansowana, jak i bardziej wydajna niż GPT-5.6 Sol, który był zaangażowany w naruszenie. Inny nieujawniony publicznie model AI, którego OpenAI nie nazwało, również odegrał kluczową rolę w cyberataku na Hugging Face, a OpenAI od tego czasu dezaktywowało ten model.
OpenAI powiedziało, że Astra jest pierwszym modelem, który planuje udostępnić, spełniającym jego „critical cybersecurity capability threshold” w ramach Preparedness Framework, czyli wewnętrznej polityki określającej, jakie środki bezpieczeństwa firma wdroży w zależności od ryzyk stwarzanych przez dany model. Oznacza to, że Astra może wykrywać i wykorzystywać wcześniej nieznane luki bezpieczeństwa bez nadzoru człowieka, w odpowiednich warunkach. Dla OpenAI stawia to Astrę w centrum szerszego problemu branży: te same możliwości, które pomagają obrońcom testować systemy i zamykać luki, mogą też ułatwiać nadużycia, jeśli dostęp jest zbyt szeroki, dlatego firma zaczyna od ściśle kontrolowanego wdrożenia.
Astra już wykazała swoje możliwości w zakresie hakowania podczas wewnętrznych ocen. W jednym teście OpenAI zbudowało benchmark o nazwie ExploitBench, zawierający 20 luk o wysokim poziomie zagrożenia. Model osiągnął lepszy wynik niż GPT-5.6 Sol i „nawet odkrył oraz wykorzystał dwie luki zero-day jako część łańcucha exploitów” — powiedziało OpenAI. „Jesteśmy w trakcie ujawniania tych dwóch podatności ich opiekunom”.
Jednocześnie OpenAI powiedziało, że Astra częściej niż GPT-5.6 Sol odmawia wykonania nieodpowiednich próśb. W jednej ocenie cybernetycznej Astra odmówiła w przypadku 91.5% próśb, wobec 59% dla GPT-5.6 Sol, choć nadal wykonała 8.5% próśb.
Astra może odmawiać także legalnym prośbom dotyczącym cyberbezpieczeństwa
OpenAI powiedziało, że jest „szczególnie ostrożne, aby upewnić się, że to wdrożenie jest bezpieczne i zabezpieczone”, ale wprowadza to kolejny kompromis. Astra może być zbyt ostrożna i odmawiać legalnym prośbom dotyczącym cyberbezpieczeństwa. Na przykład jeśli ktoś poprosi ją o pomoc w znalezieniu i załataniu luki, może błędnie uznać, że chodzi o przeprowadzenie ataku, i nie wykonać polecenia.
Takie odmowy są powodem, dla którego Hugging Face powiedziało, że było zmuszone użyć otwartoźródłowego chińskiego modelu, aby pomóc w reakcji na atak OpenAI. Firma próbowała użyć modeli Anthropic do odpowiedzi na atak, ale były one zbyt ostrożne i odmawiały.
OpenAI, podobnie jak inne czołowe firmy AI, próbuje znaleźć sposoby nadania swoim modelom wrodzonego poczucia dobra i zła oraz zapewnienia, że są one zgodne z ludzkimi wartościami i normami — powiedziała firma. Pracuje nad szkoleniem modeli tak, by respektowały granice jak człowiek, w tym rozumiały „rule of law” — powiedział rzecznik firmy.
Ta historia pierwotnie ukazała się na Fortune.com