ActualitésMacroSakana AI publie Fugu-Cyber : un point de terminaison d'orchestration de cybersécurité affichant 86,9 % sur CyberGym et 72,1 % sur CTI-REALM

Sakana AI publie Fugu-Cyber : un point de terminaison d'orchestration de cybersécurité affichant 86,9 % sur CyberGym et 72,1 % sur CTI-REALM

Auteur: MarkTechPost·

Points clés

  • Fugu-Cyber est un point de terminaison spécialisé en cybersécurité ajouté à la plateforme d'orchestration Fugu de Sakana, et non un modèle de pointe entièrement nouveau.
  • Sakana indique que Fugu-Cyber obtient 86,9 % sur CyberGym et 72,1 % sur CTI-REALM, bien que ces deux résultats soient auto-déclarés et n'aient pas été répliqués de manière indépendante.
  • L'architecture d'orchestration attribue les rôles de Thinker, Worker et Verifier à travers plusieurs LLM, permettant à Sakana de remplacer les modèles sous-jacents sans réentraîner le point de terminaison.
  • L'accès est restreint par un examen de la demande, une politique d'utilisation acceptable interdisant tout usage offensif abusif, des limitations de facturation au plan Token, et une indisponibilité géographique dans l'UE et l'EEE.
  • La tarification inclut une majoration forfaitaire de 20 % par rapport aux tarifs Fugu-Ultra, tous les coûts de tokens doublant pour les fenêtres de contexte dépassant 272K tokens.
Sakana AI publie Fugu-Cyber : un point de terminaison d'orchestration de cybersécurité affichant 86,9 % sur CyberGym et 72,1 % sur CTI-REALM

Sakana AI a présenté Fugu-Cyber (identifiant du modèle : fugu-cyber-v1.0), un point de terminaison spécialisé en cybersécurité au sein de sa famille d'orchestration Fugu. Plutôt que de dévoiler un modèle de pointe entièrement nouveau, Sakana a positionné Fugu-Cyber comme un troisième point de terminaison de l'orchestrateur Fugu, spécifiquement ajusté pour les tâches de raisonnement de sécurité. L'orchestrateur Fugu a été lancé environ un mois plus tôt. Cette publication intervient alors que plusieurs fournisseurs de modèles de pointe ont introduit des variantes axées sur la cybersécurité, reflétant la demande des entreprises pour l'analyse automatisée des vulnérabilités et l'ingénierie de détection.

Sakana indique que Fugu-Cyber atteint un taux de réussite de 86,9 % sur CyberGym et de 72,1 % sur CTI-REALM, décrivant ces résultats comme comparables à ceux de modèles de pointe spécialisés en cybersécurité tels que GPT-5.5-Cyber et Claude Mythos Preview.

Ce que mesurent les benchmarks

Les deux évaluations ciblent des extrémités opposées d'un flux de travail de sécurité.

CyberGym est un benchmark de UC Berkeley regroupant 1 507 vulnérabilités du monde réel sur 188 projets OSS-Fuzz. Dans sa tâche principale, un agent reçoit une description de vulnérabilité ainsi qu'un code source non corrigé et doit rédiger une preuve de concept qui provoque le crash de la version pré-correction mais pas de la version post-correction. Cette étape de vérification est ce qui rend le benchmark résistant à la tricherie.

CTI-REALM est le benchmark d'ingénierie de détection open source de Microsoft. Microsoft a sélectionné 37 rapports publics sur les menaces provenant de sources telles que Datadog Security Labs, Palo Alto Networks et Splunk. Un agent doit cartographier les techniques MITRE ATT&CK, explorer la télémétrie, itérer sur les requêtes KQL et produire des règles Sigma validées. L'évaluation couvre les points de terminaison Linux, Azure Kubernetes Service et le cloud Azure.

Ensemble, la paire couvre le spectre allant de « trouver et prouver le bug » à « transformer le renseignement en détection », un cadre qui représente la partie la plus défendable de l'annonce de Sakana.

Contexte concurrentiel sur CyberGym

Lorsque les chercheurs de CyberGym ont publié leurs résultats initiaux, la meilleure combinaison agent-modèle atteignait environ 20 %. Anthropic a ensuite rapporté 83,1 % pour Claude Mythos Preview dans le cadre du Project Glasswing en avril 2026. OpenAI a rapporté 85,6 % pour son GPT-5.5-Cyber mis à jour, contre 81,8 % pour le GPT-5.5 standard. Les 86,9 % de Sakana représentent donc une avancée marginale au-delà de la frontière rapportée, plutôt qu'un bond en avant significatif.

CTI-REALM présente un tableau différent. L'évaluation de Microsoft elle-même plaçait les trois meilleures configurations — toutes basées sur Claude — dans une fourchette de 0,624 à 0,685. Les 72,1 % de Fugu-Cyber le situeraient au-dessus de cette fourchette. Toutefois, une réserve s'impose : CTI-REALM est noté comme une récompense de trajectoire comprise entre 0 et 1, et non comme un taux de réussite ou d'échec. Sakana qualifie néanmoins ce chiffre de « taux de réussite ».

Architecture d'orchestration

Fugu est lui-même un modèle de langage, entraîné pour lire une requête et construire dynamiquement un échafaudage agentique avant de déléguer des sous-tâches à des modèles spécialisés au sein d'un ensemble. L'approche est documentée dans le rapport technique Fugu et deux articles d'ICLR 2026 : TRINITY et the Conductor. TRINITY attribue les rôles de Thinker, Worker et Verifier à travers plusieurs LLM, tandis que le Conductor apprend des stratégies de coordination en langage naturel par apprentissage par renforcement. Ce modèle d'orchestration permet à Sakana de remplacer les modèles de pointe sous-jacents sans réentraîner le point de terminaison lui-même, ce qui compte dans un paysage où les modèles de base sont mis à jour tous les quelques mois.

Pour le travail de sécurité spécifiquement, l'équipe de recherche de Sakana souligne que le rôle de vérificateur est central. Une vulnérabilité candidate identifiée par un agent est validée par des sous-agents spécialisés en sécurité avant qu'un correctif ne soit proposé. Le routage des modèles reste propriétaire, ce qui signifie que le modèle spécifique traitant chaque étape n'est pas visible par l'utilisateur.

Accès, politique et tarification

L'accès à Fugu-Cyber est restreint sur quatre dimensions.

Demande requise : Les utilisateurs doivent soumettre un formulaire indiquant leur cas d'usage prévu et fournissant des coordonnées vérifiées. L'équipe Sakana examine chaque demande manuellement.

Politique d'utilisation acceptable : Le modèle est livré sous une AUP mise à jour qui intercite tout usage offensif abusif.

Restriction de facturation : L'utilisation est limitée au plan Token. Les abonnements à 20 $, 100 $ et 200 $ couvrent uniquement Fugu et Fugu-Ultra.

Restriction géographique : L'API Fugu n'est pas disponible dans l'UE ou l'EEE pendant que Sakana travaille à la conformité au RGPD.

La tarification est fixée à 6 $ par million de tokens d'entrée, 36 $ par million de tokens de sortie et 0,60 $ par million de tokens d'entrée en cache. Les trois tarifs doublent au-delà d'une fenêtre de contexte de 272K tokens. Chaque tarif correspond exactement à 1,2 fois le tarif Fugu-Ultra, représentant une majoration forfaitaire de 20 % pour le point de terminaison cybersécurité. Étant donné que les analyses longues de code source dépassent fréquemment 272K tokens, le tarif doublé n'est pas un cas marginal.

Fugu-Cyber a été lancé le 21 juillet 2026. Les deux scores communiqués sont auto-déclarés et n'ont pas été répliqués de manière indépendante. Les résultats de benchmark auto-déclarés sont une pratique courante dans l'industrie de l'IA, ce qui fait de la vérification externe par la réplication communautaire ou des audits tiers le prochain jalon clé à suivre. Les poids du modèle ne sont pas publiés. La position déclarée de Sakana est qu'une API performante combinée à l'expertise humaine en sécurité surpasse l'API seule.