NotizieMacroSakana AI rilascia Fugu-Cyber: l'endpoint di orchestrazione per la cybersecurity raggiunge l'86,9% su CyberGym e il 72,1% su CTI-REALM

Sakana AI rilascia Fugu-Cyber: l'endpoint di orchestrazione per la cybersecurity raggiunge l'86,9% su CyberGym e il 72,1% su CTI-REALM

Autore: MarkTechPost·

Punti chiave

  • Fugu-Cyber è un endpoint ottimizzato per la cybersecurity aggiunto alla piattaforma di orchestrazione Fugu di Sakana, anziché un modello di frontiera completamente nuovo.
  • Sakana riporta per Fugu-Cyber un punteggio dell'86,9% su CyberGym e del 72,1% su CTI-REALM, sebbene entrambi i risultati siano autocertificati e non replicati in modo indipendente.
  • L'architettura di orchestrazione assegna i ruoli di Thinker, Worker e Verifier tra più LLM, consentendo a Sakana di sostituire i modelli sottostanti senza riaddestrare l'endpoint.
  • L'accesso è limitato tramite revisione della domanda, una acceptable usage policy che vieta usi offensivi impropri, limitazioni di fatturazione al Token Plan e indisponibilità geografica nell'UE e nello SEE.
  • I prezzi presentano un premium fisso del 20% rispetto alle tariffe Fugu-Ultra, con tutti i costi dei token che raddoppiano per finestre di contesto superiori a 272K token.
Sakana AI rilascia Fugu-Cyber: l'endpoint di orchestrazione per la cybersecurity raggiunge l'86,9% su CyberGym e il 72,1% su CTI-REALM

Sakana AI ha presentato Fugu-Cyber (ID modello: fugu-cyber-v1.0), un endpoint specializzato in cybersecurity all'interno della famiglia di orchestrazione Fugu. Anziché presentare un modello di frontiera completamente nuovo, Sakana ha posizionato Fugu-Cyber come terzo endpoint dell'orchestratore Fugu, specificamente ottimizzato per compiti di security reasoning. L'orchestratore Fugu è stato lanciato circa un mese prima. Il rilascio arriva in un momento in cui diversi provider di modelli di frontiera hanno introdotto varianti orientate alla cybersecurity, riflettendo la domanda aziendale per l'analisi automatizzata delle vulnerabilità e il detection engineering.

Sakana riporta che Fugu-Cyber raggiunge un tasso di successo dell'86,9% su CyberGym e del 72,1% su CTI-REALM, descrivendo i risultati come paragonabili a modelli di frontiera cyber-focused come GPT-5.5-Cyber e Claude Mythos Preview.

Cosa misurano i benchmark

Le due valutazioni affrontano estremità opposte di un flusso di lavoro di sicurezza.

CyberGym è un benchmark della UC Berkeley composto da 1.507 vulnerabilità reali su 188 progetti OSS-Fuzz. Nel suo compito principale, un agente riceve una descrizione della vulnerabilità insieme a un codebase non patchato e deve scrivere una proof-of-concept che faccia crashare la build pre-patch ma non quella post-patch. È proprio questa fase di verifica a rendere il benchmark resistente alle manipolazioni.

CTI-REALM è il benchmark di detection engineering open source di Microsoft. Microsoft ha curato 37 report di minacce pubbliche provenienti da fonti tra cui Datadog Security Labs, Palo Alto Networks e Splunk. Un agente deve mappare le tecniche MITRE ATT&CK, esplorare la telemetria, iterare sulle query KQL e produrre regole Sigma validate. Il punteggio copre endpoint Linux, Azure Kubernetes Service e Azure cloud.

Insieme, la coppia copre lo spettro che va dal "trovare e dimostrare il bug" al "trasformare l'intelligence in una detection", un inquadramento che rappresenta la parte più solida dell'annuncio di Sakana.

Contesto competitivo su CyberGym

Quando i ricercatori di CyberGym hanno pubblicato i loro risultati iniziali, la migliore combinazione agente-modello ha raggiunto circa il 20%. Successivamente Anthropic ha riportato l'83,1% per Claude Mythos Preview nell'ambito di Project Glasswing nell'aprile 2026. OpenAI ha riportato l'85,6% per la sua versione aggiornata di GPT-5.5-Cyber, rispetto all'81,8% del GPT-5.5 standard. L'86,9% di Sakana rappresenta quindi un passo marginale oltre la frontiera riportata, più che un salto significativo.

CTI-REALM presenta un quadro diverso. La valutazione di Microsoft ha collocato le tre configurazioni migliori — tutte basate su Claude — in un range da 0,624 a 0,685. Il 72,1% di Fugu-Cyber lo posizionerebbe al di sopra di tale fascia. Tuttavia, va segnalata una precisazione: CTI-REALM è valutato come un trajectory reward tra 0 e 1, non come un tasso di superamento/fallimento. Ciononostante, Sakana definisce il valore come "tasso di successo".

Architettura di orchestrazione

Fugu è a sua volta un modello linguistico, addestrato per leggere una query e costruire dinamicamente uno scaffold agentico prima di delegare i sotto-compiti a modelli specialistici all'interno di un pool. L'approccio è documentato nel technical report di Fugu e in due paper di ICLR 2026: TRINITY e the Conductor. TRINITY assegna i ruoli di Thinker, Worker e Verifier tra più LLM, mentre il Conductor apprende strategie di coordinamento in linguaggio naturale attraverso il reinforcement learning. Questo modello di orchestrazione consente a Sakana di sostituire i modelli di frontiera sottostanti senza dover riaddestrare l'endpoint stesso, un aspetto rilevante in un panorama in cui i modelli base vengono aggiornati ogni pochi mesi.

Per il lavoro di sicurezza in particolare, il team di ricerca di Sakana sottolinea il ruolo del verificatore come elemento centrale. Una vulnerabilità candidata individuata da un agente viene sottoposta a validazione da parte di sotto-agenti specializzati in sicurezza prima che venga proposta qualsiasi patch. Il routing dei modelli rimanda proprietario, il che significa che il modello specifico che gestisce ogni passaggio non è visibile all'utente.

Accesso, policy e prezzi

L'accesso a Fugu-Cyber è limitato su quattro dimensioni.

Domanda richiesta: Gli utenti devono inviare un modulo che indichi il caso d'uso previsto e fornisca dettagli di contatto verificati. Il team di Sakana esamina manualmente ogni domanda.

Acceptable Usage Policy: Il modello viene fornito con una AUP aggiornata che vieta usi offensivi impropri.

Restrizione di fatturazione: L'utilizzo è limitato al Token Plan. I livelli di abbonamento da 20, 100 e 200 dollari coprono solo Fugu e Fugu-Ultra.

Limitazione geografica: L'API di Fugu non è disponibile nell'UE o nello SEE mentre Sakana lavora alla conformità GDPR.

I prezzi sono fissati a 6 dollari per milione di token di input, 36 dollari per milione di token di output e 0,60 dollari per milione di token di input in cache. Tutte e tre le tariffe raddoppiano oltre una finestra di contesto di 272K token. Ogni tariffa è esattamente 1,2 volte quella di Fugu-Ultra, rappresentando un premium del 20% per l'endpoint cybersecurity. Poiché le analisi estese di codebase superano frequentemente i 272K token, la fascia a tariffa raddoppiata non costituisce un caso limite.

Fugu-Cyber è stato lanciato il 21 luglio 2026. Entrambi i punteggi riportati sono autocertificati e non sono stati replicati in modo indipendente. I risultati benchmark autocertificati sono prassi comune nell'industria dell'AI, rendendo la verifica esterna tramite replica della community o audit di terze parti il traguardo chiave da osservare. I pesi del modello non vengono rilasciati. La posizione dichiarata di Sakana è che un'API performante combinata con l'expertise umano in materia di sicurezza offra risultati superiori rispetto alla sola API.