NotizieMacroLa valutazione cyber degli Stati Uniti rileva che il Kimi K3 di Moonshot AI è in ritardo rispetto ai principali modelli AI americani

La valutazione cyber degli Stati Uniti rileva che il Kimi K3 di Moonshot AI è in ritardo rispetto ai principali modelli AI americani

Autore: BeInCrypto·

Punti chiave

  • Kimi K3 ha ottenuto un punteggio del 32% su ExploitBench, ahead del GLM-5.2 cinese ma ben al di sotto dei principali modelli statunitensi a circa il 76%.
  • In un attacco simulato a una rete aziendale di 32 passaggi, Kimi K3 ha raggiunto in media il passaggio 17 e ha completato l'intera sequenza una sola volta su 10 tentativi.
  • La valutazione includeva delle riserve perché Kimi K3 è stato testato solo parzialmente e i modelli statunitensi sono stati valutati con i filtri di sicurezza disattivati.
  • CAISI ha dichiarato che le protezioni di Kimi K3 non hanno impedito tentativi di costruire hack o attaccare sistemi.
  • Washington ha accusato Moonshot di aver copiato il Claude Fable 5 di Anthropic attraverso la distillazione, un'accusa sostenuta da Anthropic.
La valutazione cyber degli Stati Uniti rileva che il Kimi K3 di Moonshot AI è in ritardo rispetto ai principali modelli AI americani

Il governo degli Stati Uniti ha condotto una valutazione di cybersicurezza sul più recente modello AI della Cina, concludendo che il Kimi K3 di Moonshot AI è nettamente inferiore rispetto ai migliori modelli americani.

Il Center for AI Standards and Innovation (CAISI), un'agenzia statunitense, ha effettuato i test in collaborazione con un partner britannico. I risultati sono stati pubblicati solo un giorno dopo che Washington aveva accusato Moonshot di aver sviluppato Kimi K3 utilizzando tecnologia statunitense rubata. Le capacità cyber offensive sono diventate una priorità nelle valutazioni di sicurezza AI sia negli Stati Uniti che nel Regno Unito, poiché i governi valutano se i modelli di frontiera possano automatizzare attività di hacking che attualmente richiedono operatori umani qualificati.

Kimi K3 inferiore nei benchmark cyber statunitensi

Il Dipartimento del Commercio ha pubblicato i risultati giovedì, affermando che Kimi K3 si è posizionato ben al di sotto dei principali modelli statunitensi sulla base di una valutazione congiunta con esperti britannici.

CAISI's latest blog post evaluates Kimi K3 and its cyber capabilities. Based on a preliminary cyber-focused evaluation, Kimi K3 performed significantly below the leading U.S. frontier AI models. — U.S. Department Commerce (@CommerceGov) July 23, 2026

Moonshot ha lanciato Kimi K3 il 16 luglio. La domanda è stata così alta che l'azienda ha dovuto sospendere le nuove registrazioni entro due giorni. Il lancio ha anche provocato scosse nei titoli dei chip statunitensi e ha sollevato nuove domande sulla posizione dell'America nella corsa globale all'AI.

Un benchmark, chiamato ExploitBench, utilizza vere vulnerabilità del browser Chrome sviluppate dalla Carnegie Mellon University. Kimi K3 ha ottenuto un punteggio del 32%, superando il GLM-5.2 cinese al 24%, ma restando indietro rispetto ai principali modelli statunitensi, che hanno raggiunto circa il 76%.

Il passaggio più difficile consiste nell'assumere il pieno controllo di una macchina bersaglio. Kimi K3 ha fallito questo passaggio in tutti i 41 test, mentre i migliori modelli statunitensi sono riusciti in 20 occasioni.

Un secondo test, chiamato The Last Ones, simula un attacco a una rete aziendale fittizia con 32 passaggi. Un esperto umano necessita in genere di circa 20 ore per completarlo. Kimi K3 ha raggiunto in media il passaggio 17, mentre i principali modelli statunitensi sono arrivati al passaggio 28,5. Kimi K3 ha completato l'intera sequenza una sola volta su 10 tentativi, mentre i migliori sistemi statunitensi lo hanno fatto circa sei o sette volte.

Il divario potrebbe apparire più ampio di quanto sia

Tuttavia, i numeri non raccontano tutta la storia. Le note di dettaglio del rapporto contengono diverse precisazioni.

Innanzitutto, i modelli statunitensi sono stati testati con i filtri di sicurezza disattivati, un'impostazione che rivela le loro capacità complete. Le versioni pubbliche mantengono quei filtri attivi, il che significa che i punteggi statunitensi rappresentano uno scenario ottimale anziché le prestazioni nel mondo reale.

Il team di valutazione ha inoltre descritto il lavoro come precoce e limitato. Kimi K3 è stato valutato su un solo test e solo parte della suite completa è stata eseguita, rendando incerta la sua classificazione. Alcuni test sono inoltre privati, il che significa che osservatori indipendenti non possono verificare i risultati.

Esiste anche una discrepanza fondamentale nel confronto. Kimi K3 è un modello aperto che chiunque può scaricare, mentre i modelli statunitensi sono sistemi chiusi e proprietari. L'istituto britannico aveva precedentemente rilevato che i modelli aperti sono in genere in ritardo di quattro-sette mesi rispetto ai migliori modelli chiusi. CAISI ha dichiarato che sottoporrà Kimi K3 al test completo solo dopo che Moonshot lo avrà rilasciato al pubblico.

Inoltre, questi test non sono veri attacchi. La rete simulata non aveva difensori umani né allarmi da attivare. Ciononostante, Kimi K3 ha superato il precedente miglior modello aperto ed è riuscito a completare l'intera catena di attacco una volta.

Anche i tempi e il contesto istituzionale sollevano interrogativi. CAISI era precedentemente noto come US AI Safety Institute prima che l'amministrazione Trump lo rinominasse nel giugno 2025. Opera all'interno dello stesso dipartimento che limita le vendite di chip statunitensi alla Cina. Il suo rapporto su un concorrente cinese è arrivato solo un giorno dopo l'accusa di furto.

Salvaguardie deboli sollevano preoccupazioni

Punteggi bassi non significano necessariamente che Kimi K3 sia sicuro, tuttavia. Il test ha rilevato che le sue protezioni non gli hanno impedito di tentare di costruire hack o attaccare sistemi.

Questa constatazione è significativa alla luce di ciò che accadrà next. Moonshot prevede di rilasciare il modello completo il 27 luglio. Una volta rilasciato, non potrà essere ritirato: chiunque potrà scaricarlo e rimuovere i filtri di sicurezza. L'irreversibilità dei rilasci open-weight è diventata una questione centrale nel dibattito politico statunitense sull'opportunità di imporre restrizioni al rilascio di modelli potenti, una conversazione che si è intensificata man mano che i laboratori cinesi pubblicano sempre più modelli aperti capaci, nonostante i controlli sulle esportazioni americane di chip avanzati.

La valutazione segue anche un'accusa di furto. Washington afferma che Moonshot ha sviluppato Kimi K3 sulla base di tecnologia AI statunitense rubata. Il responsabile tecnologico della Casa Bianca Michael Kratsios ha dichiarato che l'azienda ha copiato segretamente il Claude Fable 5 di Anthropic utilizzando una tecnica chiamata distillazione, che addestra un nuovo modello sulle risposte di uno più potente.

Anthropic sostiene l'accusa. A febbraio, l'azienda ha rintracciato oltre 3,4 milioni di conversazioni Claude a Moonshot attraverso centinaia di account falsi. Anthropic ha avvertito che i modelli copiati perdono i controlli di sicurezza dell'originale, la stessa vulnerabilità identificata da questo test.

Gli Stati Uniti spendono ancora 23 volte di più in AI rispetto alla Cina, eppure i laboratori cinesi continuano a ridurre il divario. La valutazione definitiva arriverà quando Kimi K3 sarà reso pubblico e gli esperti indipendenti potranno esaminare le affermazioni in prima persona.