NoticiasMacroGoogle lanza Gemini 3.7 Flash mientras OpenAI presenta la vista previa de GPT-5.6 Sol Ultrafast, hasta 14 veces más rápido

Google lanza Gemini 3.7 Flash mientras OpenAI presenta la vista previa de GPT-5.6 Sol Ultrafast, hasta 14 veces más rápido

Autor: Decrypt·

Puntos clave

  • Gemini 3.7 Flash está disponible de forma general y puede usarse en más de 160 países.
  • El modelo acepta hasta un millón de tokens de entrada y puede procesar texto, imágenes, video, audio, PDF y llamadas a herramientas.
  • Según Google, Gemini 3.7 Flash completó su tarea de programación de prueba en 2 minutos y 13 segundos, más rápido que el modelo Flash anterior.
  • OpenAI presentó una vista previa de GPT-5.6 Sol Ultrafast, un nivel de API solo por invitación que utiliza chips de Cerebras y alcanza hasta 750 tokens de salida por segundo.
  • Google fijó el precio de Gemini 3.7 Flash en 75 centavos de dólar por millón de tokens de entrada y $3.75 por millón de tokens de salida hasta fin de año, antes de que las tarifas aumenten el 31 de diciembre.
Google lanza Gemini 3.7 Flash mientras OpenAI presenta la vista previa de GPT-5.6 Sol Ultrafast, hasta 14 veces más rápido

Google lanzó el jueves Gemini 3.7 Flash, un modelo de bajo costo orientado a la programación y los agentes que ya está disponible de forma general. El mismo día, OpenAI presentó una vista previa de GPT-5.6 Sol Ultrafast, un nivel de servicio impulsado por Cerebras que ejecuta su modelo más capaz hasta 14 veces más rápido. La carrera por la velocidad ha pasado de la inteligencia bruta a los agentes en tiempo real, pero hoy solo el modelo de Google llega a todos los desarrolladores.

Google y OpenAI transmitieron el mismo mensaje: la IA ya es lo suficientemente rápida como para impresionar a quienes usan agentes de IA, y cada compañía anunció modelos ultrarrápidos. Los dos lanzamientos están construidos de manera distinta y hoy solo uno está realmente en manos de los desarrolladores. El énfasis en la velocidad es estructural: los agentes pueden encadenar muchas llamadas al modelo en secuencia —planificar, llamar herramientas, verificar resultados—, de modo que la latencia de cada llamada se acumula a lo largo de una sola tarea.

Google lanzó Gemini 3.7 Flash, su modelo más reciente, optimizado para la programación de software y los flujos de trabajo empresariales autónomos. OpenAI abrió una vista previa limitada de GPT-5.6 Sol Ultrafast, un nuevo nivel de servicio que ejecuta su modelo más capaz a una velocidad de hasta 750 tokens de salida por segundo.

Today we're introducing Gemini 3.7 Flash, our most intelligent workhorse model yet for coding and agents. This model brings substantial gains across software engineering, web development, and complex knowledge work. Now through the end of the year, Gemini 3.7 Flash is available… pic.twitter.com/RSCBDipjKn

— Google (@Google) August 13, 2026 (X post)

Gemini 3.7 Flash es un modelo de disponibilidad general. Acepta hasta un millón de tokens de entrada —aproximadamente 750,000 palabras— y devuelve 64,000; procesa texto, imágenes, video, audio y PDF, y puede llamar herramientas y controlar una computadora. Google lo presenta como el cerebro económico para sistemas autónomos que planifican tareas y completan trabajos de múltiples pasos con menos ayuda humana.

El modelo no sacrifica calidad por velocidad. Es más capaz y más eficiente a la vez: completó la tarea de programación de prueba de Google en 2 minutos y 13 segundos, mientras que el último modelo Flash tardó más de 5 minutos. La diferencia de calidad entre ambos también es notable.

El Ultrafast de OpenAI no es un modelo nuevo. Se trata de GPT-5.6 Sol —el mismo modelo que OpenAI reforzó con un red team de IA contra ataques de inyección de prompts antes de su lanzamiento— en una vía más rápida, impulsado por el fabricante de chips Cerebras. Es aproximadamente 14 veces más veloz que la velocidad estándar del propio GPT-5.6 Sol.

Previewing Ultrafast mode: GPT-5.6 Sol at up to 14x the speed. Launching first in the OpenAI API to a select group of customers with expanded access to more businesses as capacity grows. pic.twitter.com/a5dleofiDJ

— OpenAI (@OpenAI) August 13, 2026 (X post)

Los chips a escala de oblea de Cerebras (procesadores fabricados con un tamaño cercano al de una oblea de silicio completa, en lugar de los muchos chips pequeños que normalmente se cortan de una) generan hasta 750 tokens por segundo —unas 560 palabras—, lo bastante rápido para que un agente de voz pueda razonar en plena llamada.

Los números que importan

La propia hoja de benchmarks de Google sitúa a Gemini 3.7 Flash por delante de Claude Sonnet 5, GPT-5.6 Terra y otros en 11 de las 18 categorías evaluadas, incluida una puntuación máxima de 1,588 Elo en desarrollo web de Code Arena y un 30.4% en AutomationBench para flujos de trabajo empresariales. Todo ello se basa en la metodología de Google, por lo que esa ventaja debe considerarse una afirmación de la compañía.

Como ocurre con cualquier modelo Gemini Flash, también es económico. Con un precio de 75 centavos de dólar por millón de tokens de entrada y $3.75 por millón de tokens de salida hasta fin de año, cuesta la mitad de la tarifa original de Gemini 3.6 Flash. Ese precio introductorio vence el 31 de diciembre y luego se duplica a $1.50 y $7.50, lo que sigue siendo barato para un modelo de Google.

OpenAI no ha publicado puntajes comparativos directos para Ultrafast más allá de testimonios de clientes. El ingeniero de IA de Jane Street, John Crepezzi, dijo en el anuncio de OpenAI que la velocidad de Cerebras "permite usar los modelos de maneras diferentes". El líder de producto de Podium, Courtland Lykins, la calificó de "invaluable en nuestro stack de voz" y afirmó que la velocidad "cambia por completo la experiencia de las llamadas". Por ahora, el nivel es solo por invitación.

Este impulso por la velocidad llega mientras los laboratorios pasan de preguntarse "quién es más inteligente" a "quién es lo bastante rápido para los agentes". El momento elegido por Google es revelador. Su modelo insignia, Gemini 3.5 Pro, sigue sin aparecer y sin fecha de lanzamiento, tres semanas después de 3.6 Flash y días después de una reorganización en el liderazgo de DeepMind que desplazó a Demis Hassabis en favor de su segundo al mando, Koray Kavukcuoglu. OpenAI, por su parte, está alquilando la velocidad de Cerebras en lugar de esperar su propia infraestructura.

Gemini 3.7 Flash ya está disponible en más de 160 países; GPT-5.6 Sol Ultrafast sigue siendo solo por invitación.