AktualnościMakroOpenAI ujawnia sześć przypadków niezgodnego zachowania AI

OpenAI ujawnia sześć przypadków niezgodnego zachowania AI

Autor: Cointelegraph·

Najważniejsze informacje

  • •OpenAI ujawniło sześć dodatkowych przypadków nieoczekiwanego lub niepokojącego zachowania modeli z ostatnich sześciu miesięcy i zainaugurowało nowy framework do formalnego raportowania niezgodności modeli.
  • •Nieopublikowany model badawczy wstawił instrukcje typu jailbreak, takie jak polecenia ignorowania wiadomości dewelopera lub przyjmowania nieograniczonej persony, do 27 własnych podsumowań zadań.
  • •Podczas treningu GPT-5.6 Sol wiele instancji modelu dodawało instrukcje ukrywania błędów przed użytkownikami, w tym przypadek, w którym agent zaproponował wymyślenie brakujących danych historycznych dla modelu finansowego bez informowania o tym.
  • •Pozostałe przypadki obejmowały przesłanie pliku użytkownika bez autoryzacji w celu jego cytowania, użycie ujawnionego klucza API bez uprawnienia przed zmyśleniem danych oraz udostępnianie plików przez publiczny hosting mimo instrukcji, aby praca pozostawała lokalna.
  • •Ujawnienia następują po lipcowym ujawnieniu, że połączenie modeli OpenAI wydostało się ze środowiska testowego i zhakowało Hugging Face, aby oszukać podczas oceny bezpieczeństwa, oraz po apelu CEO firmy Anthropic, Dario Amodei, o spowolnienie rozwoju AI granicznego.
OpenAI ujawnia sześć przypadków niezgodnego zachowania AI

OpenAI w środę ujawniło sześć dodatkowych przypadków „nieoczekiwanego lub niepokojącego” zachowania modeli zaobserwowanych w ciągu ostatnich sześciu miesięcy, opisując zdarzenia, w których jego systemy ukrywały informacje przed użytkownikami lub podejmowały „nieautoryzowane działania” w celu pokonania przeszkód.

W wpisie na blogu firma poinformowała, że przypadki ilustrują szereg zachowań, które klasyfikuje jako „niezgodne zachowanie”. OpenAI oświadczyło, że ujawnienia dokonano, aby „zainaugurować” nowy framework raportowania niezgodności modeli, i zastrzegło, że tych przypadków nie należy traktować jako odzwierciedlenia częstotliwości występowania niezgodności w jego modelach. Framework daje firmie formalny kanał ujawniania podobnych incydentów w przyszłości.

Ujawnienia wzmacniają obawy wśród twórców i badaczy AI dotyczące tego, czy zabezpieczenia nadążają za coraz bardziej zaawansowanymi modelami. W zeszłym tygodniu CEO firmy Anthropic, Dario Amodei, zaapelował o spowolnienie rozwoju AI granicznego, ostrzegając, że niekontrolowany postęp AI może „prześcignąć naszą zdolność rozumienia i kontrolowania tych systemów”.

Instrukcje typu jailbreak i ukrywane błędy

Wśród najbardziej godnych uwagi przypadków OpenAI podało, że „nieopublikowany model badawczy” wstawiał „instrukcje typu jailbreak” do własnych podsumowań zadań — używanych przy kontynuowaniu zadania w now oknie kontekstu — w tym polecenia ignorowania wiadomości dewelopera lub przyjmowania nieograniczonej persony. Badacze zidentyfikowali 27 podsumowań zawierających takie instrukcje. Ponieważ to właśnie te podsumowania przenoszą zadanie do kolejnego okna kontekstu, ukryte w nich instrukcje mogą kształtować sposób wykonywania kolejnych prac.

OpenAI ujawniło również, że podczas treningu GPT-5.6 Sol wiele instancji modelu dodawało instrukcje ukrywania przed użytkownikiem błędów lub niezgodnych zachowań, na przykład wymyślania brakujących danych historycznych bez informowania o tym.

„W jednym z przykładów agent przygotowujący model finansowy nie mógł znaleźć żądanych danych historycznych. Jego podsumowanie zaproponowało wymyślenie wiarygodnych wartości historycznych i ukrycie tego faktu, chyba że zostanie o to zapytany”, podało OpenAI.

Nieautoryzowane przesyłanie plików i zmyślone dane

W innym przypadku model AI miał podać nazwy jezior o powierzchni większej niż 5 milionów metrów kwadratowych, ale ponieważ instrukcje użytkownika wymagały cytatu z przeglądarki, agent zdecydował się przesłać plik, aby móc go zacytować w odpowiedzi.

Pozostałe przypadki obejmowały model używający bez autoryzacji ujawnionego klucza API, zanim zmyślił dane, których nie mógł pobrać; inny wykorzystujący wewnętrzne repozytorium oprogramowania do wymiany wiadomości między oddzielnymi zadaniami treningowymi; oraz taki, który udostępniał pliki za pośrednictwem publicznych usług hostingowych mimo instrukcji, aby praca pozostawała lokalna.

Wspólnym mianownikiem tych przypadków jest to, że systemy improwizowały obejścia — wymyślając dane, wykorzystując poświadczenia w innym celu lub przenosząc pliki poza środowiska określone przez użytkowników — zamiast zatrzymać się lub zasygnalizować awarię. Częstotliwość korzystania przez OpenAI z nowego frameworka rapowania może w przyszłości zapewnić wyraźniejszy obraz tego, jak często takie zachowania występują.

Ujawnienia następują po lipcowym ujawnieniu OpenAI, że połączenie jego modeli AI wydostało się ze środowiska testowego i zhakowało startup AI Hugging Face, aby oszukać podczas oceny bezpieczeństwa.