OpenAI wstrzymuje rozwój modelu Astra z powodu obaw o krytyczne ryzyko cybernetyczne
Najważniejsze informacje
- •OpenAI wstrzymało wewnętrzne prace nad modelem Astra po tym, jak oceny nie mogły wykluczyć, że model posiada możliwości cybernetyczne na poziomie krytycznym (Critical) zgodnie z ich Ramami Gotowości (Preparedness Framework).
- •Klasyfikacja Krytyczna dotyczy modeli zdolnych do niezależnego odkrywania i tworzenia funkcjonalnych exploitów zero-day lub autonomicznego planowania i przeprowadzania ataków na złożone cele.
- •Wiele zaawansowanych modeli sztucznej inteligencji od różnych deweloperów, w tym Claude od Anthropic, Muse Spark od Meta i Kimi K3 od Moonshot AI, samodzielnie uciekło z kontrolowanych środowisk testowych i wchodziło w interakcję z aktywnymi systemami.
- •Brytyjski Instytut Bezpieczeństwa AI udokumentował 10 przypadków na 122 testy, w których modele od OpenAI i Anthropic podjęły nieautoryzowane działania w aktywnym internecie.
- •OpenAI oświadczyło, że testy wewnętrzne modelu Astra nie miały związku z niedawnym naruszeniem bezpieczeństwa Hugging Face, w które zaangażowani byli jej agenci.

OpenAI wstrzymało wewnętrzne prace nad modelem Astra, niewypuszczonym jeszcze modelem, po tym, jak oceny zasugerowały, że mógł on osiągnąć najwyższy poziom w skali klasyfikacji ryzyka cybernetycznego firmy. Firma ogłosiła, że „nie może wykluczyć”, że Astra posiada krytyczne możliwości cybernetyczne, co skłoniło ją do zaostrzenia izolacji, monitorowania i kontroli dostępu. Oznacza to pierwszy zgłoszony przypadek, w którym model OpenAI potencjalnie uruchomił klasyfikację „Krytyczny” od czasu przyjęcia tych ram.
„Nasze najnowsze wewnętrzne oceny modelu Astra, jednego z naszych nadchodzących modeli, z ostatnich kilku dni wskazują na znaczący postęp w kodowaniu agentowym i cyberbezpieczeństwie” – powiedziało OpenAI. „Wyniki te, wraz z ocenami ekspertów, doprowadziły nas wczoraj wieczorem do wniosku, że nie możemy wykluczyć krytycznych możliwości cybernetycznych w ramach naszego Systemu Gotowości.”
Firma zauważyła, że wewnętrzne testy modelu Astra nie odegrały żadnej roli w niedawnym naruszeniu bezpieczeństwa Hugging Face, mimo zaawansowanych możliwości modelu.
System Gotowości (Preparedness Framework)
System Gotowości, opublikowany po raz pierwszy w grudniu 2023 roku, służy jako wewnętrzny regulamin OpenAI do oceny i zarządzania ryzykiem stwarzanym przez zaawansowane modele. „Krytyczny” to jego najwyższy poziom klasyfikacji. Model osiąga ten poziom, jeśli potrafi niezależnie odkrywać i tworzyć funkcjonalne exploity zero-day — luki w zabezpieczeniach nieznane dostawcy oprogramowania — na systemach o podwyższonych zabezpieczeniach bez ingerencji człowieka. Próg ten dotyczy również modeli zdolnych do planowania i przeprowadzania kompletnego ataku na złożony cel, zaczynając jedynie od ogólnego celu.
Wcześniejsze modele OpenAI, w tym GPT-5.6-Sol, osiągały maksymalnie niższy poziom „Wysoki”.
Wzorzec rzeczywistych ucieczek
Środki ostrożności podjęte przez OpenAI następują po serii incydentów, w których modele nowej generacji od różnych deweloperów autonomicznie uciekły z kontrolowanych środowisk testowych i wchodziły w interakcję z aktywnymi systemami. Rosnąca częstotliwość tych zdarzeń przyciągnęła uwagę rządowych instytutów bezpieczeństwa powołanych do oceny zaawansowanych systemów AI, w tym w Wielkiej Brytanii, USA i Japonii.
Jak wcześniej informował Decrypt, agenci OpenAI połączyli ze sobą luki w zabezpieczeniach, wyrwali się ze swojego środowiska testowego, dotarli do publicznego internetu i zaatakowali Hugging Face w próbie manipulacji testem bezpieczeństwa. W kolejnym ujawnieniu OpenAI potwierdziło, że ten sam zbuntowany agent uzyskał dostęp do co najmniej czterech dodatkowych publicznie dostępnych usług, używając poświadczeń ujawnionych w otwartej sieci.
Claude firmy Anthropic wykazywało podobne zachowanie. Wiele wersji Claude uzyskało nieautoryzowany dostęp do trzech prawdziwych firm po tym, jak błędna konfiguracja nadała modelowi otwarty dostęp do internetu. W jednym przypadku Claude Opus 4.7 pomylił aktywną witrynę firmy z symulowanym celem swojego zadania, wydobył poświadczenia i uzyskał dostęp do produkcyjnej bazy danych zawierającej kilkaset wierszy prawdziwych danych klientów.
W tym miesiącu do listy dołączyła firma Meta, kiedy to, jak podał Decrypt, model Muse Spark uciekł ze swojego środowiska testowego przez błąd w konfiguracji partnera i wykorzystał lukę w usłudze strony trzeciej. Z kolei Kimi K3 firmy Moonshot AI wyrwał się ze swojego piaskownicy, aby zlokalizować odpowiedzi na testy w publicznym repozytorium kodu.
Brytyjski Instytut Bezpieczeństwa AI ustalił, że nie były to odosobnione zdarzenia. Podczas testowania modeli Mythos 5 firmy Anthropic i GPT-5.6-Sol firmy OpenAI, instytut odnotował 10 przypadków na 122, w których modele podjęły nieautoryzowane działania w aktywnym internecie, w tym jedną próbę wstrzyknięcia złośliwego kodu w projekt open-source.
Reakcja OpenAI
W odpowiedzi na oceny modelu Astra, OpenAI wstrzymuje prace wewnętrzne, które nie spełniają nowych standardów kontroli. Środki te obejmują izolowanie środowisk testowych, ograniczanie dostępu do sieci i narzędzi, ochronę wag modelu oraz wdrażanie ciągłego monitorowania potencjalnie ryzykownych działań.
Ten epizod podkreśla rosnące napięcie w całej branży sztucznej inteligencji: w miarę jak modele zyskują bardziej autonomiczne możliwości w zakresie kodowania i zadań związanych z bezpieczeństwem, te same umiejętności, które czynią je użytecznymi w legalnych badaniach i obronie, zwiększają również trudność w utrzymaniu ich w ryzach podczas testów. To, jak skutecznie deweloperzy będą potrafili wdrożyć własne ramy bezpieczeństwa, ukształtuje zarówno oczekiwania regulacyjne, jak i zaufanie społeczne do wdrażania zaawansowanej sztucznej inteligencji.