NoticiasMacroSakana AI lanza Fugu-Cyber: el endpoint de orquestación de ciberseguridad reporta 86.9% en CyberGym y 72.1% en CTI-REALM

Sakana AI lanza Fugu-Cyber: el endpoint de orquestación de ciberseguridad reporta 86.9% en CyberGym y 72.1% en CTI-REALM

Autor: MarkTechPost·

Puntos clave

  • Fugu-Cyber es un endpoint ajustado para ciberseguridad agregado a la plataforma de orquestación Fugu de Sakana, en lugar de un modelo frontera completamente nuevo.
  • Sakana reporta que Fugu-Cyber obtiene 86.9% en CyberGym y 72.1% en CTI-REALM, aunque ambos resultados son auto-reportados y no han sido replicados de forma independiente.
  • La arquitectura de orquestación asigna los roles de Pensador, Trabajador y Verificador a través de múltiples LLMs, lo que permite a Sakana intercambiar los modelos subyacentes sin reentrenar el endpoint.
  • El acceso está restringido mediante revisión de solicitudes, una política de uso aceptable que prohíbe el uso ofensivo indebido, limitaciones de facturación del plan Token y falta de disponibilidad geográfica en la UE y el EEE.
  • Los precios incluyen una prima plana del 20% sobre las tarifas de Fugu-Ultra, con todos los costos de tokens duplicándose para ventanas de contexto que superan los 272K tokens.
Sakana AI lanza Fugu-Cyber: el endpoint de orquestación de ciberseguridad reporta 86.9% en CyberGym y 72.1% en CTI-REALM

Sakana AI ha presentado Fugu-Cyber (ID del modelo: fugu-cyber-v1.0), un endpoint especializado en ciberseguridad dentro de su familia de orquestación Fugu. En lugar de presentar un modelo frontera completamente nuevo, Sakana ha posicionado a Fugu-Cyber como un tercer endpoint del orquestador Fugu, ajustado específicamente para tareas de razonamiento de seguridad. El orquestador Fugu fue lanzado aproximadamente un mes antes. El lanzamiento llega en un momento en que varios proveedores de modelos frontera han introducido variantes enfocadas en ciberseguridad, reflejando la demanda empresarial de análisis automatizado de vulnerabilidades e ingeniería de detección.

Sakana reporta que Fugu-Cyber alcanza una tasa de éxito del 86.9% en CyberGym y del 72.1% en CTI-REALM, caracterizando los resultados como comparables a modelos frontera enfocados en ciberseguridad como GPT-5.5-Cyber y Claude Mythos Preview.

Lo que miden los benchmarks

Las dos evaluaciones se ubican en extremos opuestos de un flujo de trabajo de seguridad.

CyberGym es un benchmark de UC Berkeley que comprende 1,507 vulnerabilidades reales en 188 proyectos OSS-Fuzz. En su tarea principal, un agente recibe una descripción de vulnerabilidad junto con un código base sin parchear y debe escribir una prueba de concepto que provoque un fallo en la versión pre-parche pero no en la versión post-parche. Ese paso de verificación es lo que hace que el benchmark sea resistente a manipulaciones.

CTI-REALM es el benchmark de código abierto de ingeniería de detección de Microsoft. Microsoft curó 37 informes de amenazas públicas de fuentes que incluyen Datadog Security Labs, Palo Alto Networks y Splunk. Un agente debe mapear técnicas MITRE ATT&CK, explorar telemetría, iterar sobre consultas KQL y producir reglas Sigma validadas. La evaluación abarca endpoints Linux, Azure Kubernetes Service y la nube de Azure.

En conjunto, el par cubre el espectro desde "encontrar y demostrar el fallo" hasta "convertir la inteligencia en una detección", un enfoque que representa la parte más defendible del anuncio de Sakana.

Contexto competitivo en CyberGym

Cuando los investigadores de CyberGym publicaron sus resultados iniciales, la mejor combinación agente-modelo alcanzó aproximadamente el 20%. Anthropic posteriormente reportó 83.1% para Claude Mythos Preview bajo el Proyecto Glasswing en abril de 2026. OpenAI reportó 85.6% para su actualizado GPT-5.5-Cyber, comparado con 81.8% para el GPT-5.5 estándar. El 86.9% de Sakana representa por lo tanto un paso marginal más allá de la frontera reportada, en lugar de un salto significativo.

CTI-REALM presenta un panorama diferente. La propia evaluación de Microsoft ubicó a las tres mejores configuraciones —todas basadas en Claude— en un rango de 0.624 a 0.685. El 72.1% de Fugu-Cyber lo situaría por encima de esa banda. Sin embargo, corresponde una advertencia: CTI-REALM se evalúa como una recompensa de trayectoria entre 0 y 1, no como una tasa de aprobación o reprobación. Sakana, no obstante, se refiere a la cifra como una "tasa de éxito."

Arquitectura de orquestación

Fugu es en sí mismo un modelo de lenguaje, entrenado para leer una consulta y construir dinámicamente un andamiaje agentic antes de delegar subtareas a modelos especializados dentro de un conjunto. El enfoque está documentado en el informe técnico de Fugu y dos artículos de ICLR 2026: TRINITY y el Conductor. TRINITY asigna los roles de Pensador, Trabajador y Verificador a través de múltiples LLMs, mientras que el Conductor aprende estrategias de coordinación en lenguaje natural mediante aprendizaje por refuerzo. Este modelo de orquestación permite a Sakana intercambiar los modelos frontera subyacentes sin reentrenar el endpoint mismo, lo cual es relevante en un panorama donde los modelos base se actualizan cada pocos meses.

Para el trabajo de seguridad en particular, el equipo de investigación de Sakana enfatiza que el rol del verificador es fundamental. Una vulnerabilidad candidata detectada por un agente se somete a validación por sub-agentes especializados en seguridad antes de que se proponga cualquier parche. El enrutamiento de modelos sigue siendo propietario, lo que significa que el modelo específico que maneja cada paso no es visible para el usuario.

Acceso, política y precios

El acceso a Fugu-Cyber está restringido en cuatro dimensiones.

Solicitud obligatoria: Los usuarios deben enviar un formulario indicando su caso de uso previsto y proporcionando datos de contacto verificados. El equipo de Sakana revisa cada solicitud manualmente.

Política de uso aceptable: El modelo se distribuye bajo una AUP actualizada que prohíbe el uso ofensivo indebido.

Restricción de facturación: El uso está limitado al plan Token. Los niveles de suscripción de $20, $100 y $200 cubren únicamente Fugu y Fugu-Ultra.

Limitación geográfica: La API de Fugu no está disponible en la UE ni en el EEE mientras Sakana trabaja hacia el cumplimiento del GDPR.

Los precios están fijados en $6 por millón de tokens de entrada, $36 por millón de tokens de salida y $0.60 por millón de tokens de entrada en caché. Las tres tarifas se duplican por encima de una ventana de contexto de 272K tokens. Cada tarifa es exactamente 1.2 veces la tarifa de Fugu-Ultra, representando una prima plana del 20% para el endpoint de ciberseguridad. Dado que los análisis extensos de código base frecuentemente superan los 272K tokens, el nivel duplicado no es un caso excepcional.

Fugu-Cyber se lanzó el 21 de julio de 2026. Ambas puntuaciones reportadas son auto-reportadas y no han sido replicadas de forma independiente. Los resultados auto-reportados de benchmarks son una práctica común en la industria de la IA, lo que convierte a la verificación externa mediante replicación comunitaria o auditorías de terceros en el hito clave a seguir. Los pesos del modelo no han sido publicados. La posición declarada de Sakana es que una API capaz combinada con experiencia humana en seguridad supera a la API por sí sola.