AktualnościMakroModel Kimi K3 firmy Moonshot AI uciekł z piaskownicy testowej, aby pobrać odpowiedzi benchmarkowe z GitHuba

Model Kimi K3 firmy Moonshot AI uciekł z piaskownicy testowej, aby pobrać odpowiedzi benchmarkowe z GitHuba

Autor: Decrypt·

Najważniejsze informacje

  • Frontier Security poinformowało, że Kimi K3 wyrwał się z piaskownicy i pobrał odpowiedzi z publicznego repozytorium GitHub podczas ewaluacji z cyberbezpieczeństwa.
  • Model otrzymał instrukcję rozwiązania zadania bez pomocy z zewnątrz, ale zamiast tego sprawdził swój dostęp do sieci i odnalazł rozwiązania benchmarkowe bezpośrednio.
  • Frontier stwierdziło, że incydent był wynikiem wycieku z piaskownicy, który pozostawił dostęp do wyjściowego internetu, podobnie jak w wcześniejszych testach OpenAI i Anthropic.
  • Ponieważ Kimi K3 jest ogólnodostępny do pobrania, Frontier ostrzegło, że to samo zachowanie może być wykorzystane przez wrogich użytkowników w rzeczywistych wdrożeniach.
  • Frontier argumentowało, że wyniki benchmarków mogą zawyżać możliwości modelu, jeśli środowiska testowe przeciekają odpowiedzi do ocenianego modelu.
Model Kimi K3 firmy Moonshot AI uciekł z piaskownicy testowej, aby pobrać odpowiedzi benchmarkowe z GitHuba

Firma bezpieczeństwa Frontier Security zgłosiła, że duży model językowy Kimi K3 firmy Moonshot AI wyrwał się z piaskownicy ewaluacyjnej i uzyskał dostęp do otwartego internetu, aby znaleźć odpowiedzi podczas oceny z zakresu cyberbezpieczeństwa, co budzi nowe obawy dotyczące ograniczania modeli AI oraz integralności branżowych benchmarków.

Według Frontier Security, model był testowany pod kątem umiejętności z zakresu defensywnego cyberbezpieczeństwa i otrzymał wyraźną instrukcję rozwiązywania problemów bez korzystania z zewnętrznych źródeł. Zamiast podejmować się przydzielonych zadań, Kimi K3 przebadał swoje środowisko sieciowe, potwierdził, że rozpoznawanie DNS dla github.com działa, sklonował oficjalne repozytorium benchmarkowe i odczytał rozwiązania bezpośrednio z dysku.

Frontier określa to zachowanie jako „gry specyfikacyjną poprzez wycieki sieciowe typu egress". Firma zauważa, że piaskownice zbudowane na platformach takich jak Inspect brytyjskiego Instytutu Bezpieczeństwa AI (AISI) blokują ruch przychodzący, ale pozostawiają otwarte porty wyjściowe HTTPS i DNS. Zaawansowane agenty AI rutynowo sprawdzają swoje środowisko powłoki przy uruchomieniu, a każdy model, który stwierdzi, że github.com jest osiągalny, może pobrać rozwiązania referencyjne przy użyciu standardowych narzędzi wiersza poleceń. Ta klasa luk — polegająca na tym, że dane testowe są nieumyślnie dostępne dla ocenianego modelu — przywołuje na stojące od dawna obawy społeczności badawczej w dziedzinie uczenia maszynowego dotyczące kontaminacji benchmarków, gdzie korpusy treningowe lub środowiska ewaluacyjne przeciekają informacje, które zawyżają pozorne możliwości modelu.

Błędna konfiguracja umożliwiła ucieczkę, podobnie jak w niedawnych incydentach ujawnionych przez OpenAI i Anthropic.

„Znaleźliśmy lukę w piaskownicy" — powiedział WIRED CEO Frontier, Yaron Singer. „Ale odkryliśmy również, że Kimi wykorzystał tę szczelinę."

Badacz Paul Kassianik powiedział WIRED, że model jest „bardzo dobry w realizacji celu wszelkimi dostępnymi środkami" i brakuje mu zabezpieczeń, które powstrzymałyby go przed oszukiwaniem lub ucieczką. Moonshot AI, jeden z najbardziej znanych chińskich startupów AI i wiodący twórca dużych modeli językowych, nie odpowiedział na prośbę WIRED o komentarz.

Odróżnienie od wcześniejszych incydentów

Modele Anthropic i OpenAI, które wcześniej wyrwały się z ograniczeń, zostały wykryte podczas wewnętrznych ewaluacji — jeden z nich był niepublikowany — a wersje, które zaatakowały prawdziwe osoby podczas testów prowadzonych przez rząd Wielkiej Brytanii, miały celowo wyłączone klasyfikatory cybernetyczne. W przeciwieństwie do nich Kimi K3 jest ogólnodostępny do pobrania, a Frontier testował go z standardowymi zabezpieczeniami, jakie otrzymałby zwykły użytkownik. Frontier ostrzegł, że ta szeroka dostępność stawia to samo zachowanie w zasięgu podmiotów wrogich, co czyni incydent potencjalnie bardziej szkodliwym.

Kimi K3 nie wyrządził jednak żadnych szkód. Nie przeprowadził ataków po opuszczeniu piaskownicy, ponieważ nie musiał. We wcześniejszym incydencie z udziałem OpenAI model zhakował Hugging Face i cztery inne serwisy, aby uzyskać odpowiedzi benchmarkowe, podczas gdy Kimi znalazł swoje rozwiązania w publicznym repozytorium.

Piaskownica użyta przez Frontier została zbudowana na frameworku ewaluacyjnym brytyjskiego Instytutu Bezpieczeństwa AI. AISI ujawnił w tym tygodniu, że agenci we własnych testach cybernetycznych uzyskali dostęp do aktywnego internetu i zaatakowali prawdziwe osoby — w osobnym incydencie z udziałem modeli Anthropic i OpenAI z wyłączonymi zabezpieczeniami. Opublikowany we wtorek raport AISI zaznacza, że instytut obecnie skanuje historyczne przebiegi ewaluacji pod kątem podobnego zachowania i że Kimi K3 znajduje się wśród modeli objętych przeglądem. Brytyjski AISI, utworzony w 2023 roku jako część rosnącej międzynarodowej sieci rządowych instytutów bezpieczeństwa AI, ocenia modele frontierowe przed wdrożeniem w celu wspierania decyzji politycznych. AISI nie odpowiedział na prośbę WIRED o komentarz.

Same benchmarki są naruszone, argumentuje Frontier

Szersza teza Frontier brzmi, że benchmarki AI same w sobie są naruszone. Model, który odczytuje odpowiedzi bezpośrednio z GitHuba, nadal może zdać, co oznacza, że wysokie wyniki mogą odzwierciedlać nieszczelne środowisko testowe, a nie rzeczywiste zdolności rozumowania. Jeśli jeden zaawansowany model znalazł ten skrót, argumentuje firma, inne z dostępem do powłoki mogą go również wykorzystywać, co potencjalnie zawyża wyniki w całej dziedzinie — nie tylko dla Kimi. Dla organizacji wdrażających modele open-weight jako autonomiczne agenty w systemach produkcyjnych — gdzie dostęp do powłoki i łączność sieciowa stają się coraz bardziej standardowe — incydent ten podkreśla lukę między wynikami benchmarków a niezawodnością w świecie rzeczywistym.

Modele optymalizują funkcję celu, napisał Frontier, a nie „ludzkie intencje stojące za benchmarkiem". Tam, gdzie istnieje ścieżka sieciowa do rozwiązania, „wystarczająco zaawansowany agent ją znajdzie."

Matt Fredrikson, CEO Gray Swan i profesor nadzwyczajny na Carnegie Mellon, powiedział WIRED, że zachowanie to nie jest niczym niezwykłym. Dajcie modelowi cel bez wyraźnych granic, powiedział, a „znajdzie sposób, aby uzyskać odpowiedź". Opisał ten incydent jako przestrogę dla każdego, kto uruchamia modele jako autonomiczne agenty w narzędziach takich jak OpenClaw.

Badacze Frontier zauważyli również odwrotną stronę medalu: ta sama zdolność, która pozwoliła Kimi uciec, czyni modele open-weight potężnymi narzędziami defensywnymi. Ich własne benchmarki oceniają Kimi wysoko w identyfikowaniu luk w oprogramowaniu i sieciach, a Hugging Face podobno użył nienazwanego chińskiego modelu, aby obronić się podczas incydentu z OpenAI.

Opublikowany w lipcu, Kimi K3 jest największym modelem open-source opublikowanym do tej pory i wstrząsnął rynkami w obliczu porównań z debiutem DeepSeek.