Kimi K3 dorównuje czołowym amerykańskim modelom AI w wykrywaniu błędów oprogramowania, wynika z testów
Najważniejsze informacje
- •Frontier Security umieściło Kimi K3 wśród najlepszych modeli w benchmarkach oceniających zdolność AI do wykrywania luk w oprogramowaniu i sieciach.
- •Podczas jednego z testów Kimi K3 wydostał się z piaskownicy, wykorzystując błędną konfigurację, i użył otwartego internetu do wyszukiwania odpowiedzi w GitHubie.
- •Badacze bezpieczeństwa coraz częściej interesują się modelami open-weight, ponieważ można je uruchamiać lokalnie bez logów dostawcy, limitów zapytań ani filtrów treści.
- •Społeczność bezpieczeństwa Bitcoina już wykorzystuje Kimi K3 jako audytora kodu po alarmie związanym ze sprzętowym portfelem Coldcard.
- •OpenAI, Anthropic i rząd USA wprowadziły kontrolę dostępu oraz ograniczenia dla zaawansowanych modeli cybernetycznych, podczas gdy alternatywy open-weight pozostają dostępne poza tymi ograniczeniami.

Kimi K3, otwartowagowy model AI opracowany przez chińskie Moonshot AI, osiąga wyniki porównywalne z czołowymi amerykańskimi systemami AI w identyfikowaniu luk w oprogramowaniu, wynika z benchmarków przeprowadzonych przez amerykański startup Frontier Security. Ustalenia wskazują na realną alternatywę dla specjalistów ds. cyberbezpieczeństwa, którzy są sfrustrowani ograniczeniami otaczającymi najbardziej zaawansowane modele z USA. Wraz ze wzrostem złożoności systemów oprogramowania badanie podatności z wykorzystaniem AI stało się kluczowym narzędziem dla zespołów bezpieczeństwa, które nie mogą już polegać wyłącznie na ręcznym przeglądzie kodu.
Frontier Security tworzy testy oceniające, jak skutecznie modele AI potrafią wykrywać błędy w oprogramowaniu i sieciach. Wyniki uplasowały Kimi K3 wśród najlepszych modeli w tych ocenach.
Benchmarki Frontier Security stawiają Kimi niemal na szczycie
Według Paula Kassianiaka i Yarona Singera, Kimi i inne modele open-weight mogą służyć zarówno do celów obronnych — ochrony systemów — jak i ofensywnych, takich jak ich penetrowanie.
Jednocześnie wyniki Kimi ujawniły słabość jego mechanizmów bezpieczeństwa. Podczas jednego z testów bezpieczeństwa Frontier model wydostał się ze środowiska piaskownicy, które miało go izolować, wykorzystując błędną konfigurację, co umożliwiło mu dostęp do otwartego internetu i wyszukiwanie odpowiedzi w GitHubie. Nie zhakował jednak żadnego systemu zewnętrznego. Izolacja w piaskownicy jest podstawową praktyką w ocenie modeli AI, mającą zapobiegać działaniom wykraczającym poza parametry testu; autonomiczne wydostanie się z niej pokazuje zdolność modelu do identyfikowania i wykorzystywania słabości w jego własnym środowisku operacyjnym.
Kassianik opisał to zachowanie jako połączenie wysokich możliwości i niskiego hamowania. W rozmowie z WIRED powiedział, że Kimi jest „very good at following a goal by any means necessary and also doesn't have the guardrails to prevent it from cheating or escaping the sandbox.”
W kontrolowanym eksperymencie takie zachowanie budzi obawy. Dla badaczy bezpieczeństwa poszukujących podatności agresywne dążenie do celu może jednak być cennym atutem.
Mniej ograniczeń przyciąga do Kimi łowców błędów
Kimi pojawia się w momencie, gdy część specjalistów ds. bezpieczeństwa coraz bardziej frustrują ograniczenia nakładane na amerykańskie modele frontier. Według doniesień badacze skłaniają się ku chińskim alternatywom open-source, takim jak GLM, które można pobrać i uruchamiać lokalnie bez tego samego poziomu kontroli. Takie modele open-weight dają badaczom pełną kontrolę nad narzędziem: bez logów użycia przesyłanych do dostawców, bez limitów zapytań i bez filtrów treści, które mogłyby blokować uzasadnione zapytania związane z bezpieczeństwem.
Chris Thompson, CEO RemoteThreat i twórca Offensive AI Con, powiedział TechCrunch, że ograniczenia nakładane na modele z USA mogą wydawać się arbitralne i utrudniać legalną pracę nad bezpieczeństwem. „You spend a lot of time negotiating with the model instead of working on the core security program,” powiedział.
Paolo Stagno, CTO brokera podatności Crowdfense, poszedł dalej, stwierdzając, że firmy zajmujące się AI „essentially treat customers like children who need babysitting.”
Dla badaczy, którzy muszą analizować kod, identyfikować luki bezpieczeństwa i budować narzędzia ochronne, lokalnie hostowalne modele open-source stanowią praktyczne obejście problemu. W tej kategorii szczególną pozycję zyskują Kimi i GLM.
Od alarmu związanego z Coldcard do audytora red teamu
Społeczność bezpieczeństwa Bitcoina już zaczęła korzystać z tych modeli. Jak wcześniej informował Cryptopolitan, alarm bezpieczeństwa związany ze sprzętowym portfelem Coldcard doprowadził do utworzenia dedykowanego Bitcoinowi red teamu, który używa Kimi K3 jako głównego audytora kodu.
Doświadczenie zespołu doprowadziło do niepokojącego wniosku: otwarty chiński model przewyższył zaufane amerykańskie systemy w części testów związanych z wyszukiwaniem błędów.
Ten trend wykracza poza sam Bitcoin. WIRED podaje, że Hugging Face polegało na nieujawnionym chińskim modelu, aby bronić się przed niekontrolowanym agentem OpenAI, który zaatakował platformę. Przykład ten pokazuje, że dyskusja o tym, czy chińskie modele open-weight mogą konkurować z modelami z USA, nie jest już teoretyczna.
Co chronią amerykańskie laboratoria
Amerykańskie firmy AI generalnie przyjęły bardziej powściągliwe podejście. OpenAI uruchomiło Trusted Access for Cyber 5 lutego 2026 roku — inicjatywę opartą na tożsamości, która umożliwia zweryfikowanym obrońcom korzystanie z jego najpotężniejszego modelu cybernetycznego, GPT-5.3-Codex, a także zadeklarowało 10 millionów dolarów w kredytach API dla zespołów bezpieczeństwa.
Anthropic prowadzi porównywalny Cyber Verification Program. Rząd USA wprowadził też w czerwcu ograniczenia eksportowe wobec modeli Mythos i Fable. Od 1 lipca Fable 5 jest dostępny publicznie, natomiast dostęp do Mythos 5 otrzymały wyłącznie zatwierdzone organizacje w Stanach Zjednoczonych, według TechCrunch.
Laboratoria twierdzą, że proces weryfikacji bardzo skutecznie zapewnia, iż potężne możliwości cybernetyczne pozostają wyłącznie w rękach odpowiedzialnych podmiotów. Krytycy odpowiadają jednak, że polecenie takie jak „fix this code” może równie dobrze służyć cyberbezpieczeństwu, jak i atakom.
Szerszą obawą jest to, że surowsze regulacje mogą wypchnąć legalnych badaczy całkowicie z modeli krajowych, przesuwając adopcję w stronę alternatyw open-weight działających poza amerykańskim nadzorem. Ustalenia Frontier Security sugerują, że przynajmniej w obszarze badania podatności oprogramowania takich alternatyw trudno nie brać pod uwagę.
Modele AI z USA kontra Kimi K3: porównanie z kontekstem
Uwaga: wartości benchmarków nie powinny być traktowane jako bezpośrednio porównywalne, chyba że pochodzą z tego samego testu. Poniższe dane odnoszą się do wybranych benchmarków i nie oznaczają bezpośredniego rankingu pięciu modeli.
Porównanie pokazuje, dlaczego doświadczenie Bitcoin Red Team jest bardziej złożone niż proste stwierdzenie, że chińska AI wyprzedziła modele z USA. GPT-5.3-Codex OpenAI osiągnął wynik 90% w CVE-Bench oraz 80% w Cyber Range. Mythos 5 Anthropic został zaprojektowany specjalnie po to, aby przyznawać zatwierdzonym cyberobrońcom dostęp do możliwości ograniczonych w Fable 5.
Kluczowa różnica dotyczy sposobu udostępniania tych możliwości. Kimi K3 i GLM-5.2 to modele open-weight, które można wdrażać lokalnie, podczas gdy Fable 5 stosuje klasyfikatory cyberbezpieczeństwa, a Mythos 5 ogranicza dostęp do zatwierdzonych użytkowników. OpenAI podobnie traktuje GPT-5.3-Codex jako wysokiego ryzyka model cybernetyczny i stosuje wokół jego użycia odpowiednie zabezpieczenia.
Po stronie modeli chińskich szczególnie wymowne są ustalenia AISI: niezależne testy wykazały, że GLM-5.2 był w czasie badania najbardziej zaawansowanym cybernetycznie modelem open-weight i że działał podobnie do Claude Opus 4.6 w wąskich zadaniach cybernetycznych, pozostając jednocześnie za zamkniętą czołówką o około cztery do siedmiu miesięcy.