AktualnościAkcjeNaukowcy ujawnili zaszyfrowane „wewnętrzne myśli” wszystkich głównych modeli AI

Naukowcy ujawnili zaszyfrowane „wewnętrzne myśli” wszystkich głównych modeli AI

Autor: Decrypt·

Najważniejsze informacje

  • Anthropic, OpenAI i Google używają jednego, obejmującego całą firmę klucza szyfrującego dla tokenów rozumowania AI, dzięki czemu zaszyfrowane bloki rozumowania są wymienne między różnymi sesjami, użytkownikami i modelami w ramach każdego ekosystemu.
  • Badacze zdekodowali 315 320 bloków rozumowania z 6 708 publicznie udostępnionych transkryptów agentów AI na GitHub i Hugging Face, odzyskując 182 dane uwierzytelniające — w tym 62 aktywne klucze API i 33 hasła — oraz 367 artefaktów danych osobowych.
  • Atak polega na wstrzyknięciu zaszyfrowanego śladu rozumowania zdolnego modelu, takiego jak Claude Opus 4.8, do słabszego i słabiej zabezpieczonego odpowiednika, jakim jest Claude Haiku 4.5, który wypisuje ten ślad słowo w słowo, bez konieczności posiadania żadnego specjalnego dostępu poza standardowym korzystaniem z API.
  • Wrażliwe dane ukryte w zaszyfrowanych blokach rozumowania omijają zautomatyzowane usługi skanowania sekretów, takie jak GitHub, ponieważ te narzędzia nie są w stanie badać zaszyfrowanych treści.
  • Anthropic, OpenAI i Google wdrożyły działania zaradcze po stronie serwerowej po odpowiedzialnym ujawnieniu, ale 6 708 już pobranych publicznych transkryptów pozostaje w sieci, a programistom zaleca się usuwanie zaszyfrowanych bloków myślenia z udostępnianych dzienników i wymianę ujawnionych danych uwierzytelniających.
Naukowcy ujawnili zaszyfrowane „wewnętrzne myśli” wszystkich głównych modeli AI

Badacze ds. bezpieczeństwa znaleźli sposób na odczytanie zaszyfrowanych „wewnętrznych myśli” każdego głównego modelu AI klasy rozumującej — i w trakcie tych ustaleń odkryli 62 aktywne klucze API oraz 33 hasła ukryte w dziennikach sesji, które programiści udostępnili publicznie w internecie, nie wiedząc, co znajduje się w ich wnętrzu.

U podstaw odkrycia leży fakt, że Anthropic, OpenAI i Google używają jednego globalnego klucza szyfrującego dla tokenów rozumowania AI. Dekodując 315 320 bloków rozumowania pobranych z publicznych repozytoriów GitHub i Hugging Face, badacze odzyskali 182 dane uwierzytelniające, w tym 62 aktywne klucze API, 33 hasła i 30 prywatnych adresów e-mail.

„Dekodując 315 320 bloków rozumowania pobranych z publicznych repozytoriów, odzyskaliśmy 367 artefaktów danych osobowych (PII) i 182 dane uwierzytelniające” — napisali badacze w swoim artykule, złożonym 10 sierpnia przez zespół z MATS Research, ELLIS Institute Tübingen, Instytutu Maxa Plancka ds. Systemów Inteligentnych oraz firmy bezpieczeństwowej Snyk.

Jak działa ukryty brudnopis

Badania dotyczą konkretnej klasy AI: modeli rozumujących. Zamiast odpowiadać natychmiast, modele te rozpoczynają od wewnętrznego łańcucha myśli — prowadzonego krok po kroku brudnopisu, w którym AI przechodzi przez problem, zanim pokaże odpowiedź — i dopiero wtedy udzielają ostatecznej odpowiedzi. Modele te znajdują się obecnie w centrum asystentów kodowania i autonomicznych agentów, które czytają pliki, wykonują polecenia i przetwarzają prawdziwe dane użytkowników — i właśnie dlatego dane uwierzytelniające oraz informacje osobiste mogą przepływać przez prywatny brudnopis, nawet jeśli nigdy nie pojawiają się w widocznej odpowiedzi.

Anthropic, OpenAI i Google szyfrują ten ukryty brudnopis. Szyfrowanie — proces przekształcania danych w nieczytelny kod — ma chronić własność intelektualną firmy i utrzymywać wrażliwe pośrednie rozumowanie z dala od użytkowników. Zaszyfrowany blok jest odsyłany na serwery dostawcy wraz z każdą kolejną wiadomością, co pozwala utrzymywać rozmowę bez przechowywania czegokolwiek po stronie firmy. Laboratoria same również monitorują to ukryte rozumowanie w ramach kontroli bezpieczeństwa, obserwując łańcuch myśli pod kątem oznak, że model planuje złamać reguły, zanim odpowiedź trafi do użytkowników.

Jeden klucz, by rządzić nimi wszystkimi

Wada ma charakter architektoniczny. Zamiast wiązać każdy zaszyfrowany blok rozumowania z konkretnym użytkownikiem, sesją lub modelem, wszyscy trzej dostawcy używają w całym swoim ekosystemie jednego, obejmującego całą firmę klucza szyfrującego.

„Te zaszyfrowane bloki są w pełni kompatybilne i wymienne między różnymi sesjami, użytkownikami, a nawet różnymi modelami w ramach ekosystemu dostawcy” — napisali badacze.

Oznacza to, że blok zaszyfrowanego rozumowania z modelu Claude Opus 4.8, flagowego modelu Anthropic, można wstrzyknąć do Claude Haiku 4.5, tańszego i słabiej chronionego odpowiednika, bez łamania zasad Anthropic. Haiku nie posiada dostrojenia antydystylacyjnego — treningu bezpieczeństwa zaprojektowanego specjalnie po to, aby powstrzymać model przed przepisywaniem własnego rozumowania na polecenie — którym dysponuje Opus.

Poproś Haiku, aby odczytał zaszyfrowany blok słowo w słowo, a zrobi to.

„Wstrzykując zaszyfrowany ślad rozumowania z danego modelu do słabszego i słabiej zabezpieczonego modelu tego samego dostawcy, zmuszamy go do zdekodowania i wypisania tego śladu słowo w słowo w postaci jawnej, bez bezpośredniego przełamywania zabezpieczeń zdolniejszego modelu” — stwierdza artykuł.

„Przenośność między modelami oznacza, że Haiku 4.5 może czytać myśli modelu Opus 4.8” — napisał na X główny badacz Alexander Panfilov.

Ten sam atak odtworzono w rodzinie GPT-5.6 OpenAI i w gamie modeli Gemini Google. Nie był wymagany żaden specjalny dostęp — wystarczył standardowy dostęp API, czyli połączenie, którego programiści używają do budowania aplikacji w oparciu o modele AI.

We can finally talk about it: We found a way to extract hidden reasoning of frontier models using a vulnerability in the APIs of every frontier AI company. We verified that our reasoning token count matches billed API thinking tokens 1:1 for most of the prompts we queried. pic.twitter.com/S7wN8aP3X7 — Alexander Panfilov (@kotekjedi_ml) August 11, 2026

Co zawierały publiczne dzienniki

Aby zademonstrować realne skutki, zespół pobrał 6 708 publicznie udostępnionych transkryptów agentów AI — zautomatyzowanych dzienników sesji, które programiści rutynowo publikują na GitHub i Hugging Face w celu współpracy lub debugowania — i zdekodował z nich 315 320 bloków rozumowania.

„Programiści często publicznie udostępniają w internecie swoje dzienniki sesji i zaszyfrowane ślady myślenia, zupełnie nieświadomi wrażliwych danych ukrytych w zaszyfrowanych blokach” — zauważa artykuł. Większość tych sekretów nigdy nie pojawiła się w widocznym wyniku AI; istniała wyłącznie wewnątrz zaszyfrowanego rozumowania, niewidoczna dla każdego, kto nie przeprowadził ataku. Ponieważ wrażliwy materiał znajdował się w zaszyfrowanych blokach, a nie w postaci zwykłego tekstu, zautomatyzowane usługi skanowania sekretów, które platformy takie jak GitHub uruchamiają na publicznych repozytoriach, nie miały szans go wychwycić — standardowe zabezpieczenia oznaczające ujawnione klucze API nie są w stanie zajrzeć do wnętrza zaszyfrowanego rozumowania.

Luka otwiera cztery wektory ataku poza prostą kradzieżą danych uwierzytelniających:

  • Kradzież zastrzeżonych wzorców rozumowania firm AI w celu trenowania konkurencyjnych modeli metodą destylacji, w której mniejszy AI uczy się naśladować większy, analizując jego wyniki
  • Wyodrębnianie prywatnych danych z udostępnionych dzienników
  • Przeprowadzanie niewykrywalnego wstrzykiwania promptów, w którym złośliwe instrukcje ukryte są w zaszyfrowanych blokach rozumowania, których narzędzia monitorujące bezpieczeństwo nigdy nie widzą
  • Przełamywanie zabezpieczeń potężnych modeli za pośrednictwem ich słabiej chronionych odpowiedników

Anthropic, OpenAI i Google wdrożyły działania zaradcze po stronie serwerowej po tym, jak zespół zastosował procedury odpowiedzialnego ujawnienia. Jak wcześniej informował Decrypt, Anthropic jest w tym roku powracającym obiektem zainteresowania badaczy bezpieczeństwa, zwłaszcza że jego najnowsze modele zużywają znacznie więcej tokenów w procesie rozumowania.

Łatki są już aktywne — ale 6 708 transkryptów sesji z zdekodowanymi blokami rozumowania, pobranych już z publicznego internetu, nigdzie się nie wybiera. Dla programistów, którzy opublikowali transkrypty agentów, standardową reakcją na tego rodzaju ujawnienie jest usunięcie zaszyfrowanych bloków myślenia z udostępnionych dzienników i wymiana wszystkich danych uwierzytelniających, które przepływały przez te sesje.