NachrichtenMakroSakana AI veröffentlicht Fugu-Cyber: Cybersicherheits-Orchestrierungsendpunkt meldet 86,9 % bei CyberGym und 72,1 % bei CTI-REALM

Sakana AI veröffentlicht Fugu-Cyber: Cybersicherheits-Orchestrierungsendpunkt meldet 86,9 % bei CyberGym und 72,1 % bei CTI-REALM

Autor: MarkTechPost·

Wichtige Erkenntnisse

  • Fugu-Cyber ist ein auf Cybersicherheit abgestimmter Endpunkt, der Sakanas Fugu-Orchestrierungsplattform ergänzt, und kein vollständig neues Frontier-Modell.
  • Sakana meldet für Fugu-Cyber 86,9 % bei CyberGym und 72,1 % bei CTI-REALM; beide Ergebnisse sind jedoch selbst berichtet und nicht unabhängig repliziert.
  • Die Orchestrierungsarchitektur weist mehreren LLMs Thinker-, Worker- und Verifier-Rollen zu, sodass Sakana zugrunde liegende Modelle austauschen kann, ohne den Endpunkt neu zu trainieren.
  • Der Zugang ist durch Bewerbungsprüfung, eine Nutzungsrichtlinie gegen offensiven Missbrauch, Beschränkungen auf die Abrechnung über den Token Plan sowie Nichtverfügbarkeit in der EU und im EWR eingeschränkt.
  • Die Preise liegen pauschal 20 % über den Fugu-Ultra-Tarifen; alle Token-Kosten verdoppeln sich bei Kontextfenstern von mehr als 272K Token.
Sakana AI veröffentlicht Fugu-Cyber: Cybersicherheits-Orchestrierungsendpunkt meldet 86,9 % bei CyberGym und 72,1 % bei CTI-REALM

Sakana AI hat Fugu-Cyber (Modell-ID: fugu-cyber-v1.0) vorgestellt, einen auf Cybersicherheit spezialisierten Endpunkt innerhalb seiner Fugu-Orchestrierungs-Familie. Statt ein vollständig neues Frontier-Modell einzuführen, positioniert Sakana Fugu-Cyber als dritten Endpunkt des Fugu-Orchestrators, der speziell auf Aufgaben des Sicherheits-Reasonings abgestimmt ist. Der Fugu-Orchestrator wurde etwa einen Monat zuvor eingeführt. Die Veröffentlichung erfolgt zu einem Zeitpunkt, an dem mehrere Anbieter von Frontier-Modellen cyberfokussierte Varianten eingeführt haben, was die Unternehmensnachfrage nach automatisierter Schwachstellenanalyse und Detection Engineering widerspiegelt.

Sakana berichtet, dass Fugu-Cyber eine Erfolgsrate von 86,9 % bei CyberGym und 72,1 % bei CTI-REALM erreicht, und beschreibt die Ergebnisse als vergleichbar mit cyberfokussierten Frontier-Modellen wie GPT-5.5-Cyber und Claude Mythos Preview.

Was die Benchmarks messen

Die beiden Evaluierungen zielen auf entgegengesetzte Enden eines Sicherheitsworkflows.

CyberGym ist ein Benchmark der UC Berkeley mit 1.507 realen Schwachstellen aus 188 OSS-Fuzz-Projekten. In der Hauptaufgabe erhält ein Agent eine Schwachstellenbeschreibung zusammen mit einer ungepatchten Codebasis und muss einen Proof-of-Concept schreiben, der den Build vor dem Patch zum Absturz bringt, nicht jedoch den Build nach dem Patch. Dieser Verifizierungsschritt macht den Benchmark widerstandsfähig gegen Manipulation.

CTI-REALM ist Microsofts Open-Source-Benchmark für Detection Engineering. Microsoft hat 37 öffentliche Bedrohungsberichte aus Quellen wie Datadog Security Labs, Palo Alto Networks und Splunk kuratiert. Ein Agent muss MITRE ATT&CK-Techniken zuordnen, Telemetriedaten untersuchen, KQL-Abfragen iterieren und validierte Sigma-Regeln erzeugen. Die Bewertung umfasst Linux-Endpunkte, Azure Kubernetes Service und Azure Cloud.

Zusammen decken die beiden Benchmarks das Spektrum von „den Fehler finden und nachweisen“ bis „Informationen in eine Erkennung überführen“ ab — eine Einordnung, die den belastbarsten Teil von Sakanas Ankündigung darstellt.

Wettbewerbsumfeld bei CyberGym

Als die CyberGym-Forscher ihre ersten Ergebnisse veröffentlichten, erreichte die beste Agent-Modell-Kombination etwa 20 %. Anthropic meldete anschließend 83,1 % für Claude Mythos Preview im Rahmen von Project Glasswing im April 2026. OpenAI meldete 85,6 % für sein aktualisiertes GPT-5.5-Cyber, verglichen mit 81,8 % für das Standardmodell GPT-5.5. Sakanas 86,9 % entsprechen daher eher einem marginalen Schritt über die gemeldete Spitze hinaus als einem deutlichen Sprung.

Bei CTI-REALM ergibt sich ein anderes Bild. Microsofts eigene Evaluierung platzierte die drei besten Konfigurationen — alle Claude-basiert — in einer Spanne von 0,624 bis 0,685. Fugu-Cybers 72,1 % würden oberhalb dieser Spanne liegen. Allerdings gilt ein wichtiger Vorbehalt: CTI-REALM wird als Trajectory Reward zwischen 0 und 1 bewertet, nicht als Bestehens-/Nichtbestehensquote. Sakana bezeichnet den Wert dennoch als „Erfolgsrate“.

Orchestrierungsarchitektur

Fugu ist selbst ein Sprachmodell, das darauf trainiert ist, eine Anfrage zu lesen und dynamisch ein agentisches Gerüst zu konstruieren, bevor es Teilaufgaben an spezialisierte Modelle innerhalb eines Pools delegiert. Der Ansatz ist im technischen Bericht zu Fugu sowie in zwei ICLR-2026-Papern dokumentiert: TRINITY und der Conductor. TRINITY weist mehreren LLMs die Rollen Thinker, Worker und Verifier zu, während der Conductor Koordinationsstrategien in natürlicher Sprache durch Reinforcement Learning erlernt. Dieses Orchestrierungsmodell ermöglicht es Sakana, zugrunde liegende Frontier-Modelle auszutauschen, ohne den Endpunkt selbst neu zu trainieren — ein relevanter Punkt in einem Umfeld, in dem Basismodelle alle paar Monate aktualisiert werden.

Speziell für Sicherheitsaufgaben betont Sakanas Forschungsteam die zentrale Bedeutung der Verifier-Rolle. Eine von einem Agenten identifizierte potenzielle Schwachstelle wird von sicherheitsspezialisierten Sub-Agenten validiert, bevor ein Patch vorgeschlagen wird. Das Modell-Routing bleibt proprietär, sodass für den Nutzer nicht sichtbar ist, welches konkrete Modell welchen Schritt bearbeitet.

Zugang, Richtlinien und Preise

Der Zugang zu Fugu-Cyber ist in vier Dimensionen eingeschränkt.

Bewerbung erforderlich: Nutzer müssen ein Formular einreichen, in dem sie den beabsichtigten Anwendungsfall angeben und verifizierte Kontaktdaten bereitstellen. Das Sakana-Team prüft jede Bewerbung manuell.

Acceptable Usage Policy: Das Modell wird unter einer aktualisierten AUP bereitgestellt, die offensiven Missbrauch untersagt.

Abrechnungsbeschränkung: Die Nutzung ist auf den Token Plan beschränkt. Die Abonnementstufen für $20, $100 und $200 gelten nur für Fugu und Fugu-Ultra.

Geografische Beschränkung: Die Fugu API ist in der EU oder im EWR nicht verfügbar, während Sakana an der GDPR-Konformität arbeitet.

Die Preise sind auf $6 pro Million Eingabetoken, $36 pro Million Ausgabetoken und $0.60 pro Million zwischengespeicherter Eingabetoken festgelegt. Alle drei Tarife verdoppeln sich oberhalb eines Kontextfensters von 272K Token. Jeder Tarif entspricht exakt dem 1,2-Fachen des Fugu-Ultra-Tarifs, was einem pauschalen Aufpreis von 20 % für den Cybersicherheitsendpunkt entspricht. Da umfangreiche Codebasis-Analysen häufig mehr als 272K Token umfassen, ist die verdoppelte Tarifstufe kein Randfall.

Fugu-Cyber wurde am 21. Juli 2026 eingeführt. Beide gemeldeten Ergebnisse sind selbst berichtet und wurden nicht unabhängig repliziert. Selbst berichtete Benchmark-Ergebnisse sind in der KI-Branche gängige Praxis, wodurch externe Verifizierung durch Community-Replikation oder Prüfungen Dritter zum entscheidenden nächsten Meilenstein wird. Modellgewichte werden nicht veröffentlicht. Sakanas erklärte Position ist, dass eine leistungsfähige API in Kombination mit menschlicher Sicherheitsexpertise der API allein überlegen ist.