NoticiasAccionesGPT-6 Sol y Luna se lanzan con recortes de precio de API del 50% mientras pruebas independientes muestran un rendimiento mixto

GPT-6 Sol y Luna se lanzan con recortes de precio de API del 50% mientras pruebas independientes muestran un rendimiento mixto

Autor: Metaverse Post·

Puntos clave

  • GPT-6 Sol y GPT-6 Luna se lanzan con precios de API un 50% por debajo de las tarifas promocionales de GPT-5.6, fijados en $2 y $0.10 por millón de tokens de entrada respectivamente, lo que OpenAI atribuye a mejoras en caché e infraestructura de inferencia.
  • Los benchmarks de OpenAI muestran a Sol superando a Claude Opus 5 en AutomationBench (33.2% frente a 26.9%) con aproximadamente el 9% de su costo por tarea e igualándolo en OSWorld 2.0 con cerca de una quinta parte del costo.
  • Las pruebas independientes de Artificial Analysis confirmaron fuertes caídas de costo por tarea—Sol de $1.99 a $1.06 y Luna de $0.18 a $0.07—pero encontraron puntuaciones de capacidad aproximadamente estables, con regresiones en trabajo de conocimiento de unos 100 puntos Elo para Sol y 75 para Luna en GDPval-AA v2.1.
  • La tasa de alucinaciones de Sol en el benchmark AA-Omniscience cayó de 92% a 60%, aunque parte de la ganancia provino de que el modelo se abstuvo de responder más preguntas, lo que redujo su precisión en 5 puntos.
  • Ambos modelos están disponibles en ChatGPT Work y Codex para usuarios Plus, Pro, Business, Enterprise y Edu, y a través de la API como gpt-6-sol y gpt-6-luna, con Luna también accesible para usuarios Free y Go mediante la aplicación de escritorio.
GPT-6 Sol y Luna se lanzan con recortes de precio de API del 50% mientras pruebas independientes muestran un rendimiento mixto

OpenAI ha lanzado oficialmente dos nuevos modelos, GPT-6 Sol y GPT-6 Luna, ampliando la familia GPT-6 junto con el buque insignia GPT-6 Astra presentado a principios de este mes. Según la empresa, los nuevos modelos ofrecen un rendimiento cercano al nivel de Astra en trabajo profesional, veracidad, programación y uso de computadora, mientras recortan los precios de API en un 50% en comparación con los precios promocionales de la anterior generación GPT-5.6. La empresa atribuye la reducción de costos a mejoras en la infraestructura de caché e inferencia, cuyos ahorros, señala, se transfieren directamente a los usuarios.

Con los nuevos precios, GPT-6 Sol cuesta $2 por millón de tokens de entrada y $10 por millón de tokens de salida, frente a los $4 y $20 respectivamente, mientras que GPT-6 Luna tiene un precio de $0.10 por millón de tokens de entrada y $0.50 por millón de tokens de salida, frente a $0.20 y $1.20. Dado que la facturación de la API escala con el volumen de tokens, las tarifas por token son la principal palanca de costos para los desarrolladores, y reducirlos a la mitad se multiplica a lo largo de los grandes volúmenes de tokens que las cargas de trabajo de agentes pueden generar.

OpenAI posiciona a Astra como su mejor modelo sin concesiones para los proyectos más exigentes, mientras que Sol y Luna están diseñados para hacer que la IA avanzada sea práctica para cargas de trabajo cotidianas de mayor volumen.

GPT-6 Sol and Luna just landed in Astra’s orbit. Both launch today with API prices 50% lower than GPT-5.6. Build with Sol. Scale with Luna. To production and beyond. pic.twitter.com/ZCEFp4JdjV — OpenAI Developers (@OpenAIDevs) September 22, 2026

GPT-6 Sol and Luna just landed in Astra’s orbit. Both launch today with API prices 50% lower than GPT-5.6. Build with Sol. Scale with Luna. To production and beyond. pic.twitter.com/ZCEFp4JdjV

Resultados de benchmarks y mejoras técnicas

En AutomationBench, que evalúa agentes en 47 herramientas empresariales de ventas, marketing, operaciones, soporte, finanzas y recursos humanos, GPT-6 Sol con esfuerzo xhigh obtuvo 33.2% a un costo de $0.27 por tarea. En comparación, Claude Opus 5 con esfuerzo máximo obtuvo 26.9%, mientras que el costo por tarea de Sol fue aproximadamente el 9% del de Claude Opus 5. Las comparaciones de costo por tarea de este tipo se han convertido en un rasgo estándar de los lanzamientos de modelos frontera, junto a las puntuaciones principales de benchmark.

En Agents’ Last Exam, Sol con esfuerzo máximoó una puntuación de 56.4%, superando la mejor marca de Claude Opus 5 con aproximadamente un 60% menos de costo. En evaluaciones de programación, GPT-6 Sol obtuvo 68.8% en DeepSWE v1.1, a 1.1 puntos porcentuales del mejor resultado de Claude Fable 5 con aproximadamente un 80% menos de costo. Luna obtuvo 66.6%, comparable a Opus 5 y Fable 5 con esfuerzo medio, con un 93–96% menos de costo. En OSWorld 2.0, Sol igualó a Claude Opus 5, con 60.5% frente a 60.3%, a cerca de una quinta parte del costo.

OpenAI también informó que la tasa de errores factuales de Sol se redujo a la mitad respecto a su predecesor en una evaluación interna de conversaciones anonimizadas en las que los usuarios señalaron errores. Con mayor esfuerzo, Luna igualó la confiabilidad de GPT-5.6 Sol a aproximadamente una centésima parte del costo. Las evaluaciones de alineamiento mostraron que ambos modelos mejoran respecto a sus predecesores, incluidas tasas más bajas de engaño en escenarios de programación deliberadamente desafiantes.

OpenAI también mejoró el caché de prompts para aumentar las tasas de acierto de caché por defecto. El sistema ofrece un descuento del 90% en lecturas de tokens de entrada cacheados e incluye un panel de monitoreo, herramientas de diagnóstico y controles que permiten a los desarrolladores ajustar el esfuerzo de razonamiento y la disponibilidad de herramientas sin invalidar el contexto cacheado. GitHub informó que estos cambios redujeron la proporción de tokens de prompt que requieren procesamiento fresco en más del 50% a lo largo de miles de millones de solicitudes.

GPT-6 Sol y Luna están disponibles desde hoy en ChatGPT Work y Codex para usuarios Plus, Pro, Business, Enterprise y Edu. Luna también está disponible para usuarios Free y Go a través de la aplicación de escritorio. Ambos modelos se ofrecen en la API como gpt-6-sol y gpt-6-luna, con un despliegue gradual a lo largo del día.

Análisis independiente confirma ahorros de costos y resultados mixtos

Las pruebas de terceros de Artificial Analysis respaldaron en general las afirmaciones de eficiencia de OpenAI, pero ofrecieron una evaluación más matizada de las capacidades de los modelos. Usando su Intelligence Index, la firma encontró que GPT-6 Sol con esfuerzo máximo cuesta aproximadamente $1.06 por tarea, frente a $1.99 de su predecesor. El costo de Luna cayó de $0.18 a $0.07 por tarea. Artificial Analysis señaló que ambos modelos habían alcanzado la frontera de Pareto de eficiencia de costos.

La firma señaló que los ahorros provienen enteramente del recorte de precios, ya que ambos modelos consumen ligeramente más tokens de salida por tarea que sus predecesores.

GPT-6 Sol and Luna push the cost efficiency frontier by halving cost relative to GPT-5.6 Sol and Luna. Intelligence Index and Coding Agent Index scores remain level with GPT-5.6, with progress in some evaluations and regressions in others Pricing is approximately half that of… pic.twitter.com/eubnxPVsyN — Artificial Analysis (@ArtificialAnlys) September 22, 2026

GPT-6 Sol and Luna push the cost efficiency frontier by halving cost relative to GPT-5.6 Sol and Luna. Intelligence Index and Coding Agent Index scores remain level with GPT-5.6, with progress in some evaluations and regressions in others Pricing is approximately half that of… pic.twitter.com/eubnxPVsyN

Los resultados de rendimiento mostraron tanto mejoras como regresiones. La puntuación de Sol en el Coding Agent Index aumentó 2 puntos hasta 57, con avances en Terminal-Bench 4.0 y SWE-Atlas-QnA. La puntuación de Luna cayó 2 puntos, con retrocesos en SWE-Atlas-QnA y DeepSWE v1.1. El panorama divergente respecto a las cifras del día de lanzamiento de OpenAI refleja en parte diferencias en los conjuntos de benchmarks, niveles de esfuerzo y metodologías de puntu entre ambos conjuntos de resultados.

En el benchmark AA-Omniscience, la tasa de alucinaciones de Sol disminuyó de 92% a 60%. Artificial Analysis señaló que la mejora se debió en parte a que el modelo se abstuvo de responder más preguntas, lo que redujo su precisión en 5 puntos. Esa distinción—ganancias por una mejor base factual frente a ganancias por responder menos preguntas—es un matiz recurrente en la medición de alucinaciones.

Las mayores regresiones aparecieron en las evaluaciones de trabajo de conocimiento. Sol cayó aproximadamente 100 puntos Elo en GDPval-AA v2.1, mientras que Luna descendió unos 75 puntos. La inspección manual atribuyó las puntuaciones más bajas a entregables más cortos que omitían elementos requeridos por la rúbrica y a una menor calidad de presentación. Leídos junto a las cifras de OpenAI, los resultados independientes enmarcan este lanzamiento principalmente como una historia de costos: los precios bajaron en general, mientras que la evolución de capacidades varió según el benchmark y la categoría de tarea.