NoticiasAccionesReseña de Gemini 3.7 Flash: El modelo económico de Google cumple en código, pero se queda corto en creatividad y razonamiento

Reseña de Gemini 3.7 Flash: El modelo económico de Google cumple en código, pero se queda corto en creatividad y razonamiento

Autor: Decrypt·

Puntos clave

  • Gemini 3.7 Flash aprobó una prueba de código zero-shot al generar un juego de navegador jugable en 2 minutos y 13 segundos, mientras que su predecesor Gemini 3.6 Flash produjo un archivo no funcional que DeepSeek tuvo que reparar.
  • El modelo perdió una comparación de escritura creativa frente a Qwopus3.5-27B-v3, un ajuste comunitario gratuito que corre en una sola GPU de consumo, después de romper la regla estructural que el prompt exigía.
  • Gemini 3.7 Flash respondió 17 minutos en un problema de puente cuya respuesta correcta era 10 minutos, repitiendo el error previo de Claude Fable 5 al asumir una restricción de dos personas que el prompt nunca mencionó.
  • En un problema de polinomios de grado 19, el modelo identificó correctamente el polinomio de Dickson y derivó su forma cerrada, pero nunca calculó p(19), mientras que Qwen 3.7 Max Preview completó el cálculo.
  • Con un precio de $0.75 por millón de tokens de entrada hasta el 31 de diciembre, el modelo cuesta la mitad que 3.6 Flash en su lanzamiento y rebaja en 85% la tarifa de entrada de GPT-5.6 Sol, antes de duplicarse a $1.50 el 1 de enero.
Reseña de Gemini 3.7 Flash: El modelo económico de Google cumple en código, pero se queda corto en creatividad y razonamiento

Gemini 3.7 Flash construyó un juego de navegador jugable a partir de un solo prompt en 2 minutos y 13 segundos, una tarea que su predecesor, Gemini 3.6 Flash, no logró completar tres semanas antes.

Falló nuestro acertijo lógico del puente con la misma respuesta incorrecta que Claude Fable 5, y se quedó corto al no calcular realmente el problema matemático que había planteado correctamente.

El modelo cuesta 75 centavos por millón de tokens de entrada hasta el 31 de diciembre, la mitad de la tarifa de 3.6 Flash, antes de duplicarse a $1.50 el 1 de enero.

Google lanzó Gemini 3.7 Flash el 13 de agosto, con disponibilidad general en más de 160 países desde el primer día. Acepta hasta un millón de tokens de entrada, devuelve 64,000, lee imágenes, video, audio y PDF, y puede llamar herramientas y controlar una computadora.

Flash nunca ha sido el modelo al que recurres cuando un problema es difícil. Es el que usas para ordenar texto, comprimir sesiones de agentes antes de que colapsen bajo su propio contexto y resumir documentos por los que no quieres pagar un modelo insignia. Juzgado por ese tipo de tareas, 3.7 Flash es una mejora real. Juzgado por todo lo demás, es un modelo competente al que le gana software que puedes descargar gratis.

La propia hoja de referencia de Google sitúa a 3.7 Flash por delante de Claude Sonnet 5 y GPT-5.6 Terra en 11 de 18 categorías evaluadas. Las cifras destacadas son 1,588 Elo en la tabla de desarrollo web de Code Arena y 30.4% en AutomationBench. Ambas provienen de la metodología de Google, así que conviene tratar esa ventaja como una afirmación de la empresa y no como un hecho establecido.

Probamos el modelo para ver si cumplía las afirmaciones de Google. Estos son nuestros resultados.

Programación: ¿Puede construir algo que funcione al primer intento?

Esta prueba mide generación de código zero-shot: si un modelo convierte una sola instrucción en software funcional, sin ejemplos que copiar ni oportunidad de corregirse. Entregamos un único prompt para un juego de navegador y publicamos lo que devuelve, con errores incluidos. Sin seguimiento, sin informes de error, sin segundo intento.

Gemini 3.7 Flash aprobó en 2 minutos y 13 segundos. El juego fue jugable en la primera ejecución, la sintaxis era limpia, la lógica de colisión y puntuación funcionó y la calidad visual quedó por encima de lo que sugiere ese nivel de precio.

La comparación que importa aquí no es con un modelo insignia. Es con Gemini 3.6 Flash, lanzado el 21 de julio, que no pudo producir un archivo funcional en absoluto. Su HTML estaba mal formado, los elementos no se renderizaban y los prompts de seguimiento para que reparara su propia salida no llevaron a nada.

Terminamos entregando ese desastre a DeepSeek, que encontró 11 errores y aplicó 8 correcciones para volverlo jugable. Tres semanas después, la misma línea de producto ya no necesita rescate y el resultado queda cerca de lo que GPT-5.6 Sol produjo en nuestra reseña de julio.

Gemini 3.7 Flash gana esta prueba de forma clara, y es la razón más fuerte para cambiar. La salvedad es que ejecuta especificaciones en lugar de inventarlas, así que un prompt vago da como resultado un juego vago.

Puedes probar el juego de Gemini 3.7 Flash aquí.

Escritura creativa: ¿Puede sostener una paradoja y escribir una frase?

Esta sección evalúa dos cosas a la vez: la calidad literaria y si un modelo puede obedecer una regla estructural a lo largo de miles de palabras. El prompt envía a Jose Lanz desde 2150 de vuelta al año 1000 y exige un bucle causal cerrado: su intervención debe ser lo que crea el futuro que vino a impedir.

La regla que decide la prueba es la última cláusula: He cannot understand what he did until he is home.

Gemini 3.7 Flash generó un resultado decente. Jose dispara un cañón entrópico dentro de una fisura pirenaica, forja por accidente un obelisco que esclaviza a la Iberia del siglo 22 y comprende todo el bucle mientras sigue de pie en el barro mil años antes: "It was the base of the Cinder Spire."

La maquinaria de la trama, en realidad, funciona bastante bien. La historia menciona una estrella fugaz que presenciaron unos monjes antiguos y aclara que era el destello de la llegada de Jose; y el arma que llevó para borrar la anomalía es lo que la forja. Su última línea—"It had simply been waiting for him to complete it"—consigue el determinismo que pedía el prompt.

Pero para quienes ya están acostumbrados, la historia grita “IA”. Casi todos los sustantivos llegan con dos adjetivos pegados: "hyper-luminescent towers," "damp, moss-choked earth," "thick, obsidian hair." Esa es la textura de un modelo que elige la palabra siguiente más probable en vez de seleccionar una, y produce choques como un monolito "humming with a low-frequency hum."

Lo comparamos con Qwopus3.5-27B-v3, un ajuste comunitario de Qwen3.5-27B que destila razonamiento al estilo de Claude Opus y funciona en una sola GPU de consumo sin costo por consulta. Cumplió la regla que Gemini rompió.

Jose mata a un monje en San Millán de la Cogolla, un monasterio real de La Rioja que sí tenía importancia alrededor del año 1000, y solo comprende lo que hizo después de regresar a 2150 y encontrar su propio ADN en un códice sellado con cera.

Qwopus tampoco es completamente limpio. Volcó todo su cuaderno de planificación encima de la historia, erratas incluidas, y su sección final rompe el bucle cerrado que pasó ocho secciones construyendo al dejar que Jose vuelva para arreglar las cosas.

Pero, en conjunto, Qwopus se la lleva. Gemini entregó el paquete más pulido y el final más disciplinado, pero falló la única instrucción en la que se basaba el prompt, y un modelo gratuito ejecutándose en una GPU para juegos escribió la mejor historia.

Pensamiento asociativo: ¿Puede una metáfora sostener un argumento?

Esta prueba mide razonamiento asociativo: si un modelo puede generar vínculos entre conceptos no relacionados sin tener que explicarlos. El prompt pide describir una rama, usa esa descripción para explicar la explotación laboral y la veneración de los ricos, y luego exige que el argumento se disuelva en una descripción de una lechuga.

La señalización es el modo de fallo. Nombrar la metáfora la destruye.

Gemini la nombra en la primera línea de su segundo párrafo: "This is the precise mechanics of the modern proletariat." Todo lo anterior venía funcionando.

Parte de las imágenes sí se gana su lugar. El trabajador recibe "just enough bark to stay rigid for another week of output," y las ramas caídas son condicionadas a creer que, con suficiente rigidez, cualquiera de ellas podría convertirse en tronco. El párrafo que contiene la primera de esas imágenes también incluye a un trabajador "bound to an vast, top-heavy corporate hierarchy." No está mal en términos de lógica y estructura.

La disolución es el verdadero colapso. Gemini narra la transición en vez de ejecutarla—las jerarquías "crumble, dissolving into the quiet, humble reality of the organic world underneath"—y luego aparece una lechuga, desconectada de todo lo anterior.

GPT-5.6 Sol pudre la rama hasta convertirla en tierra y hace crecer la lechuga a partir de ella: "Rain enters the grain. Fibers loosen, darken." El argumento también llega enterrado dentro del objeto, con la riqueza reformulada como un lenguaje de virtud donde "The mansion signifies intelligence."

GPT-5.6 Sol gana por mucho. Gemini produjo una línea aislada buena, pero explicó su propia metáfora y luego omitió la transición que el prompt estaba probando específicamente.

Lógica: ¿Lee el prompt o reconoce el acertijo?

Esta prueba mide razonamiento no matemático y, en particular, si un modelo lee la pregunta que tiene delante o si aplica patrones de una versión que memorizó. Nuestro prompt del puente da a cuatro personas una sola linterna y tiempos de cruce de 1, 2, 5 y 10 minutos, y luego pregunta cuánto tardan en cruzar todos.

La trampa es lo que el prompt no dice. Nunca afirma que solo dos personas puedan estar en el puente al mismo tiempo, así que la respuesta es 10 minutos: todos cruzan juntos al ritmo de la persona más lenta.

Gemini respondió 17 minutos, ejecutando la secuencia memorizada de cinco pasos de la versión de manual del acertijo. Presentó la restricción como un hecho sin comprobar nunca si nosotros la habíamos escrito.

Su razonamiento visible es peor que su respuesta. La traza sostiene que enviar a los dos más lentos juntos sería ineficiente porque alguien tendría que regresar con la linterna, y luego la respuesta final los manda juntos de todos modos. Se contradice dentro de una misma respuesta y reporta el resultado con total confianza.

Claude Fable 5 llegó al mismo número incorrecto en julio. Abrió declarando lo que estaba asumiendo, "assuming the classic constraint that the bridge holds only two people at a time," que es la diferencia entre una respuesta equivocada que puedes detectar y una que no.

Nadie gana. Fable se lleva esta por transparencia, y la falsa confianza de las ejecuciones de Gemini aparece aquí en un acertijo que se puede comprobar a mano.

Matemáticas: ¿Termina el trabajo?

Esta prueba mide matemáticas simbólicas muy por encima del uso de consumo, más algo más simple: si el modelo hace lo que se le pidió. El prompt exige un polinomio mónico impar de grado 19, con coeficientes reales y coeficiente lineal -19, cuya curva se divide en al menos tres componentes irreducibles, y luego pregunta por p(19).

Ambos modelos encontraron la misma puerta. Gemini y Qwen 3.7 Max Preview identificaron el polinomio de Dickson, resolvieron la restricción para fijar su parámetro en 1 y derivaron correctamente la forma cerrada.

Luego Gemini se detuvo. Mostró p(19) como una expresión no evaluada que involucra la potencia 19 de una raíz cuadrada, nunca produjo el número y nunca demostró el conteo de componentes que también exigía el prompt. Entregó todo esto dentro de una página HTML con estilo, CSS y una sombra paralela que nadie pidió.

Qwen terminó. Dio la factorización completa en 10 componentes—uno lineal, nueve cuadráticos—llevó la recurrencia hasta 1,876,572,071,974,094,803,391,179 y verificó el resultado modularmente. Comprobamos esa cifra de forma independiente en SymPy y se mantiene.

Qwen gana en el único criterio que importaba. Gemini empezó bien y decidió saltarse la aritmética, lo que es una forma extraña de detenerse.

Conclusión

Gemini 3.7 Flash vale el cambio si ya estás dentro del ecosistema de Google. Es mucho mejor para código que el modelo al que reemplaza, lo bastante rápido para importar en trabajo de agentes y lo suficientemente barato como para que operarlo a escala sea un costo marginal.

Sus fortalezas son la ejecución y la estructura. Dale una especificación detallada y construirá la pieza, mantendrá una trama unida y conservará la lógica causal coherente a lo largo de miles de palabras.

Sus debilidades son la creatividad y el razonamiento. La escritura es lo bastante predecible como para identificarla como hecha por máquina a simple vista, y el modelo afirma respuestas incorrectas sin señalar la suposición que las volvió incorrectas.

El precio es su argumento más fuerte. A 75 centavos por millón de tokens de entrada y $3.75 de salida, rebaja la tarifa de entrada de GPT-5.6 Sol de $5 en 85% y cuesta la mitad de lo que costaba 3.6 Flash en su lanzamiento.

El argumento en contra es un modelo gratuito de 27B en una GPU para juegos que escribió una historia mejor y no cobró nada por hacerlo. La tarifa introductoria de Google vence el 31 de diciembre, cuando la entrada sube a $1.50 y la salida a $7.50.