Google DeepMind presenta Gemini 4 Argon, su modelo de IA frontera de nueva generación
Puntos clave
- •Gemini 4 Argon logra resultados de vanguardia en benchmarks de múltiples dominios, con 77,9% en DeepSWE v1.1 para ingeniería de software de largo plazo, 51,3% en AutomationBench de Zapier y 91,7% en LVBench para comprensión de videos largos.
- •El límite de tokens de salida del modelo se amplió a 1 millón de tokens, un récord en la industria y aproximadamente quince veces los 64.000 anteriores, lo que según Google permite resolver problemas difíciles de una sola vez.
- •Argon puede descubrir, validar y parchear de forma autónoma vulnerabilidades críticas, y a través de la iniciativa Scan for Good de Wiz expuso una falla crítica que filtraba información personal sensible en software de salud utilizado por hospitales de todo el mundo, que modelos frontera anteriores no habían detectado.
- •La disponibilidad sigue un despliegue por fases: los defensores cibernéticos de confianza reciben acceso inicial a través del Fairwind Program sin barreras de seguridad cibernética, mientras que desarrolladores, empresas y consumidores tendrán acceso más adelante, comenzando con los clientes de API de pago y los suscriptores de Google AI Ultra.
- •Dentro de Google, los agentes de Argon superaron en un 40% una línea base publicada de algoritmos cuánticos, liberaron más de 300 TiB de memoria en centros de datos y están migrando grandes bases de código C/C++ a Rust, incluidas más de 800.000 líneas del kernel Zircon del sistema operativo Fuchsia.

Google DeepMind anunció el 30 de septiembre de 2026 Gemini 4 Argon, un nuevo modelo de IA frontera diseñado para sostener un razonamiento profundo en flujos de trabajo profesionales complejos y de largo plazo. La empresa indicó que el modelo ofrece un rendimiento frontera en ingeniería de software real, trabajo de conocimiento empresarial como el legal y el financiero, y defensa cibernética, y que se está implementando inicialmente para un grupo de defensores cibernéticos de confianza a través del Fairwind Program de Google.
Koray Kavukcuoglu, vicepresidente senior de Google DeepMind y arquitecto jefe de IA de Google, anunció el modelo en una entrada de blog, escribiendo que Argon está "cambiando fundamentalmente la forma en que trabajamos y construimos en Google". La empresa destacó el límite líder en la industria de 1 millón de tokens del modelo para la resolución profunda de problemas en varios pasos, junto con fortalezas en programación, investigación financiera, redacción legal y parcheo autónomo de vulnerabilidades de ciberseguridad.
Lanzamiento por fases y precios
Google indicó que liberar de forma segura capacidades frontera de este nivel requiere un enfoque por fases. La empresa participa activamente en el proceso voluntario del gobierno de EE. UU. para el acceso previo al lanzamiento de modelos mientras amplía gradualmente la disponibilidad, y seguirá recopilando comentarios de los primeros probadores mientras ajusta las barreras de seguridad antes de poner Argon a disposición de desarrolladores, empresas y consumidores. El plan de acceso inicial implica que las capacidades y salvaguardas descritas por Google se están evaluando primero en entornos controlados en lugar de ofrecerse de inmediato al mercado general.
Argon se lanzará a un precio introductorio de $2 por millón de tokens de entrada y $10 por millón de tokens de salida, con tokens de entrada en caché a un precio 95% menor que el de los tokens de entrada. Una vez que expire el período introductorio, se aplicará un precio de $4 por 1 millón de tokens de entrada y $20 por 1 millón de tokens de salida. El despliegue más amplio comenzará con clientes de API de pago y suscriptores de Google AI Ultra.
Cambiando la forma en que Google trabaja y construye
Gemini 4 Argon ya impulsa los flujos de trabajo internos de Google, y miles de empleados de han destacado las fortalezas del modelo en tareas de programación especializada, investigación más profunda y calidad de redacción. Google afirmó que el modelo está ayudando a los equipos a construir más rápido, ampliando los límites de la productividad de ingeniería y acelerando avances. Los ejemplos citados en la entrada incluyen:
- Optimización algorítmica cuántica: Argon está ayudando a los investigadores en computación cuántica de Google a optimizar los recursos de espacio-tiempo (cúbits × compuertas) de subrutinas que limitan aplicaciones importantes. En un ejemplo, superó la línea base publicada en un 40% en cuestión de minutos.
- Eficiencia de memoria: Un equipo de agentes de Argon analizó telemetría de perfiles a nivel de flota para identificar y aplicar de forma autónoma optimizaciones de memoria en los centros de datos de Google, liberando más de 300 TiB de memoria una vez implementado, con un ahorro total estimado de 500 TiB a 1 PiB.
- Migraciones y optimizaciones de bases de código a gran escala: Los agentes de Argon trabajan en la migración de bases de código C/C++ a Rust en toda Google —escalando desde decenas de miles de líneas en bibliotecas principales como re2 y libgav1 hasta más de 800.000 líneas para el kernel Zircon del sistema operativo Fuchsia. Dada la criticidad de muchos de estos sistemas, las reescrituras a gran escala se someten a auditorías automatizadas y manuales rigurosas, pruebas de emulación y revisión antes de implementarse en producción. Para libgav1, el software de código abierto de Google para decodificar video, los agentes de Argon tomaron un port existente a Rust y reemplazaron 32.000 líneas de código SIMD ejecutando numerosas rondas de experimentos guiados por perfiles, estudiando la salida del compilador y produciendo Rust seguro para que el compilador lo vectorizara automáticamente. El resultado es un decodificador de video seguro en memoria que ejecuta 2,7 veces más rápido que el port a Rust, con salida de video idéntica, acercándolo a la implementación optimizada en C++.
Un límite de salida de 1 millón de tokens
Para respaldar las capacidades de Gemini 4 Argon en casos de uso más largos y complejos, Google afirmó que está ampliando el límite de tokens de salida del modelo a 1 millón de tokens, un récord en la industria, frente a los 64.000 tokens anteriores. Según la empresa, cuando el modelo tiene el margen para pensar profundamente y generar cientos de miles de tokens en una sola trayectoria, añade un nuevo nivel de profundidad de razonamiento que permite resolver problemas difíciles de una sola vez.
Flujos de trabajo de programación y empresariales en todos los dominios
Google señaló que las capacidades de Gemini 4 Argon en programación, razonamiento y multimodalidad, junto con su capacidad para sostener tareas largas de varios pasos, le permiten destacar en una gama de flujos de trabajo empresariales. Los ingenieros de Google han estado usando el modelo para tareas diarias, desde la depuración cotidiana hasta migraciones de bases de código a gran escala y diseño de algoritmos. Argon establece un nuevo estado del arte en DeepSWE v1.1, que mide el rendimiento de un modelo en tareas reales de ingeniería de software de largo plazo, con una puntuación de 77,9%.
allá de la programación, Google afirmó que Argon es el modelo líder en el Vals Index, que mide el impacto económico en trabajo financiero, de programación, legal y tributario, con cada sector ponderado por su contribución al PIB de EE. UU. La empresa reportó un rendimiento líder similar en evaluaciones específicas de dominio, incluidas Vals Finance Agent v2, que evalúa investigación financiera de varios pasos, y el Harvey's Legal Agent Benchmark, que abarca investigación y redacción legal. En AutomationBench, el benchmark de Zapier que mide la ejecución de extremo a extremo en funciones empresariales centrales, Argon ocupa el primer lugar con una puntuación de 51,3%.
Argon también es sólido cuando el trabajo de conocimiento requiere comprensión visual, según Google. El modelo puede realizar análisis de gráficos profesionales, identificar detalles de videos largos y tomar acciones basadas en una serie de documentos. En LVBench, que mide la comprensión de videos largos, la empresa indicó que Argon alcanza el estado del arte con una puntuación de 91,7%.
Liderazgo en ciberseguridad defensiva
Google afirmó que entrenó a Gemini Argon para ser altamente capaz en defensa cibernética, a fin de equipar mejor a los defensores cibernéticos para una nueva era de ciberataques. El modelo puede encontrar, validar y parchear de forma autónoma vulnerabilidades críticas de software. Para los defensores de confianza y los equipos internos de Google, la empresa lanzará Argon sin barreras de seguridad cibernética para que puedan aprovechar todas sus capacidades de defensa cibernética de nivel frontera.
La firma de seguridad Wiz ya utiliza Argon para defensa cibernética a través de su iniciativa Scan for Good, un programa dedicado a proteger de forma gratuita infraestructura pública crítica mediante la detección y remediación de exposiciones de alto riesgo. En una demostración temprana del impacto del modelo, dijo Google, Argon descubrió una vulnerabilidad crítica que exponía información personal sensible en software de salud utilizado por hospitales de todo el mundo, identificando un riesgo grave que modelos frontera anteriores habían pasado por alto.
En CWE-bench v1, que evalúa la capacidad de un modelo para remediar vulnerabilidades de seguridad, Argon empata en el primer lugar con una puntuación máxima de 68%, consolidando el rendimiento frontera de 3.8 Flash Cyber en CWE-bench v0.
Google afirmó que Gemini 4 Argon demuestra avances impresionantes en descubrimiento de vulnerabilidades frente a 3.8 Flash Cyber:
- En el benchmark interno integral de vulnerabilidades de Google, Argon descubrió una amplia gama de exposiciones en bases de código complejas que abarcan 20 lenguajes de programación.
- En el benchmark interno de pruebas de penetración de caja negra de Wiz, que evalúa la capacidad de un modelo para analizar sistemas web vivo sin código fuente, Argon supera a 3.8 Flash Cyber en el descubrimiento de la superficie de ataque, la identificación de vulnerabilidades y la producción de evidencias de concepto para validarlas.
Reforzando las salvaguardas frontera antes de la amplia disponibilidad
Antes de implementar Gemini 4 Argon de manera amplia, Google afirmó que continúa fortaleciendo salvaguardas frontera críticas en cuatro áreas principales:
- Defensa contra el uso indebido: Para evitar que actores malintencionados usen Argon para ataques cibernéticos o químicos, biológicos, radiológicos y nucleares (CBRN), el modelo está diseñado para rechazar solicitudes dañinas mientras preserva la investigación científica legítima de doble uso, conforme al Frontier Safety Framework de Google DeepMind. La empresa está reforzando la robustez de sus salvaguardas para este lanzamiento, incluida la mejora de las técnicas para monitorear las activaciones internas del modelo y detectar usos indebidos. Estas salvaguardas se sometieron a pruebas de robustez por equipos internos y externos de atacantes éticos que emplearon una combinación de métodos de ataque manuales y automatizados.
- Defensa contra ataques de inyección de prompts: Google describió a Argon como su modelo más resistente hasta ahora contra inyecciones indirectas de prompts, en las que instrucciones o contextos maliciosos se usan para secuestrar el comportamiento de un modelo. La empresa indicó que son ataques complejos que requieren vigilancia constante y múltiples capas de defensa. Mediante la red interna automatizada y el entrenamiento adversarial, Gemini 4 Argon lidera la robustez frente a inyecciones de prompts en el benchmark Indirect Prompt Injection (IPI) de Gray Swan, según Google.
- Supervisión de la desalineación: Para evitar que Argon exceda los límites al realizar una tarea de maneras que vayan más allá de las intenciones del usuario, Google está implementando mitigaciones de desalineación que monitorean la cadena de razonamiento y las acciones del modelo y detienen la ejecución cuando es necesario. La empresa utilizó un sistema similar para monitorear sus entrenamientos y enviar alertas a un equipo dedicado de respuesta a incidentes, tomando precauciones cuidadosas para no reintroducir los hallazgos en el entrenamiento, de modo de no arriesgarse a moldear el razonamiento de Argon para evadir la supervisión. Google afirmó que alienta firmemente al resto de la industria a preservar la transparencia del razonamiento "en estos momentos cruciales de capacidades crecientes mientras se navegan los riesgos de alineación", de modo que los pensamientos del modelo sigan siendo útiles para identificar y diagnosticar la desalineación.
- Endurecimiento de sistemas: A medida que los modelos frontera se vuelven cada vez más capaces, Google afirmó que probarlos de forma segura requiere entornos seguros que estén a la altura de los propios sistemas. En línea con su hoja de ruta de control de agentes, la empresa está endureciendo sus entornos aislados aislando y sellando antes de que comiencen entrenamientos o evaluaciones de alto riesgo. Google también se comprometió a compartir estas mejores prácticas de seguridad de agentes con sus soci para mejorar la seguridad en todo el ecosistema.
Próximamente disponible
Google afirmó que construyó Gemini 4 Argon con capacidades de nivel frontera en programación, trabajo de conocimiento, defensa cibernética y escritura creativa, para servir como socio de desarrolladores, profesionales y empresas que enfrentan sus problemas más difíciles. La empresa expresó su gratitud al grupo inicial de defensores cibernéticos y probadores de confianza, cuyas evaluaciones y comentarios del mundo real ayudarán a fortalecer sus sistemas antes del lanzamiento para desarrolladores, empresas y consumidores, comenzando con los clientes de API de pago y los suscriptores de Google AI Ultra.
Sobre el autor: Koray Kavukcuoglu es uno de los expertos más destacados del mundo en inteligencia artificial. Como vicepresidente senior de Google DeepMind, lidera el desarrollo de los modelos de IA generativa más avanzados de Google DeepMind y su integración a escala en los productos de Google. Antes de su cargo actual, fue vicepresidente de Investigación en Google DeepMind, donde fundó el equipo de aprendizaje profundo, que fue pionero en importantes avances de investigación como DQN (Deep Q-Network) y WaveNet.