Google DeepMind presenta Gemini 3.8 Flash y 3.8 Flash Cyber para flujos de trabajo agénticos y ciberseguridad
Puntos clave
- •Google DeepMind lanzó Gemini 3.8, su modelo de razonamiento y programación más capaz, tres semanas después de 3.7 Flash, marcando su tercer lanzamiento Flash en seis semanas.
- •Gemini 3.8 Flash se ofrece a un precio introductorio de $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida, con tarifas que se duplicarán el 1 de enero de 2027.
- •Gemini 3.8 Flash Cyber logró un descubrimiento de vulnerabilidades de nivel de frontera en CyberGym y más del 70% de éxito en la evaluación interna de Google de 20 lenguajes.
- •El equipo de seguridad de Chrome encontró que Flash Cyber produjo 2.6 veces más parches correctos para vulnerabilidades de Chrome que modelos comerciales más grandes.
- •Flash Cyber está restringido a defensores de confianza mediante el nuevo programa Fairwind, mientras que 3.8 Flash está disponible a través de la API de Gemini, Gemini Enterprise y las suscripciones a Google AI Pro y Ultra.

Google DeepMind ha presentado Gemini 3.8, su modelo de razonamiento y programación más capaz hasta la fecha, que llega apenas tres semanas después de 3.7 Flash y que marca el tercer lanzamiento Flash de la compañía en seis semanas. Este ritmo acelerado refleja la velocidad actual del mercado de modelos de frontera, en el que Google, OpenAI y Anthropic han estado lanzando versiones sucesivas en intervalos de semanas en lugar de trimestres, y donde los modelos de clase media "Flash" son cada vez más los caballos de batalla de las aplicaciones de IA en producción. El lanzamiento incluye dos variantes: Gemini 3.8 Flash, un modelo de trabajo de propósito general, y Gemini 3.8 Flash Cyber, un modelo de ciberseguridad especializado disponible para defensores verificados a través del nuevo programa Fairwind.
Según el anuncio de Tulsee Doshi, Directora Sénior de Gestión de Producto, y Raluca Ada Popa, Líder de Seguridad de Gemini en Google DeepMind, ambos lanzamientos funcionan con la misma inteligencia fundamental, acelerada por bucles agénticos de larga duración que evalúan y refinan recursivamente los modelos subyacentes. Las mejoras en programación y razonamiento de este núcleo compartido provinieron de varias innovaciones, incluido un entrenamiento riguroso en el exigente dominio de la ciberseguridad. El emparejamiento es notable porque aplica una técnica —usar un dominio difícil y verificable como la seguridad como señal de entrenamiento— que también se ha empleado en otras partes de la industria para afinar el razonamiento general de los modelos.
Gemini 3.8 Flash: diseñado para programación de largo alcance y agentes autónomos
Gemini 3.8 Flash ofrece mejoras sustanciales sobre 3.7 Flash en ingeniería de software, tareas agénticas y razonamiento multipasos en dominios especializados, a menudo acercándose al rendimiento de modelos de frontera de mayor costo. Está disponible al mismo precio introductorio que 3.7 Flash: $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida. Este precio introductorio vence el 31 de diciembre de 2026; a partir del 1 de enero de 2027 se aplicarán tarifas de $1.50 por millón de tokens de entrada y $7.50 por millón de tokens de salida. Incluso a la tarifa completa, el modelo tiene un precio muy por debajo de los niveles típicos de los modelos de frontera, lo que subraya la presión competitiva sobre el precio por token mientras los proveedores compiten por cargas de trabajo agénticas que consumen muchos más tokens que las interacciones de chat.
En DeepSWE v1.1 (Long-Horizon Software Engineering), 3.8 Flash supera a la mayoría de los modelos de frontera más grandes en la resolución autónoma de problemas complejos de ingeniería de principio a fin, con una fracción del costo. El modelo también demuestra confiabilidad para la autonomía empresarial crítica en dominios de conocimiento especializados. En campos cuantitativos y profesionales que requieren análisis e informes avanzados, 3.8 Flash supera a 3.7 Flash y a otros modelos de frontera en evaluaciones como Vals Finance Agent V2 y el Harvey's Legal Agent Benchmark. También alcanza un 54.9% en HLE-Verified, lo que refleja su capacidad de razonamiento multipasos en campos STEM, humanidades y disciplinas profesionales.
Estas mejoras provienen de una decisión de diseño fundamental: 3.8 Flash trabaja más intensamente. En tareas complejas, el modelo ejecuta pasos de razonamiento adicionales y llama a herramientas de forma iterativa, consumiendo a veces más tokens para maximizar el rendimiento, especialmente en niveles de esfuerzo más altos. Este equilibrio entre precisión y gasto de tokens se ha convertido en una cuestión de diseño central para la IA agéntica, ya que los agentes autónomos que iteran sobre muchos pasos pueden multiplicar los costos de inferencia; el control del nivel de esfuerzo ofrece a los desarrolladores una palanca sobre ese equilibrio. Para aplicaciones con restricciones de cómputo, los desarrolladores pueden usar niveles de esfuerzo más bajos para reducir el gasto de tokens o seguir dependiendo de Gemini 3.7 Flash, que sigue totalmente compatible para cargas de trabajo orientadas a la eficiencia.
Google destacó varias demostraciones construidas con 3.8 Flash en Google Antigravity: un juego 3D de un mago que navega un castillo creado a partir de una instrucción simple en bucle, con rompecabezas, narrativa ambiental y texturas generadas por Nano Banana; una versión DOS completamente jugable de Google Maps con ubicaciones, indicaciones y Street View; un mapa topográfico de sitios geográficos famosos con cortes transversales en tiempo real, proyecciones 2D y explicaciones científicas usando conjuntos de datos reales del U.S. Geological Survey; y Hardware Anatomy, un visualizador 3D interactivo construido en Google AI Studio que genera renderizados realistas en Three.js de desmontajes de hardware con proporciones físicas y un control deslizante de descomposición en capas explotables.
Gemini 3.8 Flash Cyber: rendimiento cibernético de nivel experto
Gemini 3.8 Flash Cyber proporciona a los defensores capacidades de nivel de frontera en detección de vulnerabilidades y parcheo automatizado, entregadas a la velocidad y el costo de la clase Flash para permitir una iteración rápida. Llega en medio de un impulso más amplio de la industria hacia la seguridad asistida por IA, ya que los ataques a la cadena de suministro de software y las vulnerabilidades sin parchear en grandes organizaciones han convertido el descubrimiento y la remediación automatizados en un área activa de inversión en la industria de la seguridad, al tiempo que plantean preocupaciones de que capacidades similares, si no estuvieran restringidas, podrían favorecer a los atacantes.
Descubrimiento autónomo de vulnerabilidades. En CyberGym, la evaluación estándar de la industria para encontrar vulnerabilidades, 3.8 Flash Cyber demuestra un descubrimiento autónomo de vulnerabilidades de nivel de frontera, superando tanto a 3.5 Flash Cyber como a modelos de frontera significativamente más grandes. Para reflejar mejor las necesidades defensivas del mundo real más allá de las bases de código C/C++ cubiertas por CyberGym, Google también evaluó el modelo en una evaluación interna integral que exige descubrir vulnerabilidades en bases de código complejas que abarcan 20 lenguajes de programación, donde logró una tasa de éxito superior al 70%, un salto sustancial sobre los modelos anteriores.
Parcheo automatizado. Google afirmó que se enfocó en dotar a los defensores de capacidades expertas que los favorezcan frente a los atacantes, invirtiendo en la corrección de vulnerabilidades desde el inicio y priorizándola sobre capacidades ofensivas como la explotación. En CWE-Bench, una exigente evaluación externa de capacidades de parcheo dirigida por Collinear, 3.8 Flash Cyber se sitúa en la frontera de Pareto con un pass@1 de 47.2% frente al 47.8% de un modelo de frontera líder, a un costo significativamente menor.
Impacto en el mundo real. Google informó que ya está usando 3.8 Flash Cyber para proteger el código en toda la compañía. El equipo de seguridad de Chrome encontró que el modelo produjo 2.6 veces más parches correctos para vulnerabilidades de Chrome que los mejores modelos comerciales mucho más grandes. Wiz encontró que logró entre un 7.5% y un 9.7% más de recall en su evaluación interna de pruebas de penetración con un costo entre 2.3 y 5.2 veces menor en comparación con otros modelos de frontera líderes. El equipo de Investigación de Vulnerabilidades de Google Cloud usó el modelo para encontrar una vulnerabilidad fundamental crítica en menos de dos horas, un proceso de investigación y descubrimiento que normalmente lleva meses. La validación de terceros de Wiz y la evaluación externa de Collinear aportan cierta corroboración independiente de las afirmaciones de Google más allá de evaluaciones internas autoinformadas, aunque las metodologías detalladas de las evaluaciones siguen siendo publicadas por el propio proveedor.
Construido pensando en la seguridad
Gemini 3.8 Flash incluye salvaguardas contra el uso indebido en dominios químicos, biológicos, radiológicos y nucleares (CBRN) y en ofensivas cibernéticas, al tiempo que permite casos de uso beneficiosos, en línea con el Frontier Safety Framework de Google. 3.8 Flash Cyber lleva un conjunto más permisivo de mitigaciones de ciberseguridad y, por lo tanto, está restringido a defensores de confianza que requieren un conjunto más completo de capacidades cibernéticas. Este enfoque de acceso restringido refleja un debate más amplio en las comunidades de IA y seguridad sobre cómo distribuir capacidades cibernéticas ofensivas poderosas —limitándolas a defensores verificados— sin sofocar la investigación de seguridad legítima. Google también señaló que los modelos Gemini 3.8 han dado un salto significativo en robustez ante la inyección de instrucciones según la medición de Gray Swan, protegiendo a los usuarios de ataques maliciosos relacionados con la inyección de instrucciones; la inyección de instrucciones sigue siendo uno de los riesgos de seguridad más citados para los sistemas de IA agéntica que leen contenido no confiable y actúan en nombre de un usuario.
Disponibilidad
- Desarrolladores: construyan con 3.8 Flash y exploren flujos de trabajo centrados en agentes en Google Antigravity, o comiencen a desarrollar en la API de Gemini a través de Google AI Studio y Android Studio, o generen interfaces de usuario en Stitch. La documentación para desarrolladores está disponible en la documentación de desarrolladores de Google.
- Empresas: accedan a 3.8 Flash en Gemini Enterprise.
- Consumidores: 3.8 Flash está disponible para suscriptores de Google AI Pro y Ultra en la aplicación Gemini, el modo de IA en la Búsqueda de Google y Gemini en Google Sheets.
- Ciberseguridad: a través del nuevo programa Fairwind, las autoridades gubernamentales de confianza, los operadores de infraestructura crítica y los mantenedores de software reciben acceso prioritario a Gemini 3.8 Flash Cyber. Las organizaciones pueden solicitar acceso.
Fuente: Blog de Google DeepMind