NoticiasAccionesOpenAI mejora el prompt caching de GPT-6 con descuentos de hasta 90% para agentes persistentes

OpenAI mejora el prompt caching de GPT-6 con descuentos de hasta 90% para agentes persistentes

Autor: CryptoBriefing·

Puntos clave

  • Los tokens de entrada en caché pueden recibir descuentos de hasta 90%, y los modelos GPT-5.6 y posteriores pueden reutilizar prefijos en caché elegibles durante al menos 30 minutos después de su uso más reciente.
  • OpenAI lanzó un Prompt Caching Dashboard y una herramienta de diagnóstico que permiten a los desarrolladores medir las tasas de aciertos de caché e identificar los cambios de modelo, herramienta, configuración o entrada que causaron fallos de caché.
  • Los nuevos controles para desarrolladores incluyen puntos de interrupción de caché explícitos, la posibilidad de ajustar el esfuerzo de razonamiento en los modelos GPT-6 sin invalidar el contexto en caché cuando se configura adecuadamente, y el precalentamiento de caché antes de que se envíen las solicitudes de los usuarios.
  • GitHub informó que la infraestructura de caching mejorada redujo en más de 50% la proporción de tokens de prompt que requieren procesamiento nuevo entre miles de millones de solicitudes a los modelos de OpenAI.
  • La actualización amplía la función de prompt caching que OpenAI introdujo en 2024 y apunta en particular a cargas de trabajo extensas de agentes, como agentes de programación que refactorizan bases de código y sistemas que generan documentos largos de investigación.
OpenAI mejora el prompt caching de GPT-6 con descuentos de hasta 90% para agentes persistentes

OpenAI ha lanzado una mejora del prompt caching en toda su familia de modelos GPT-6, introduciendo mayores tasas de aciertos de caché y nuevos controles para desarrolladores diseñados para que los agentes de IA persistentes sean más rápidos y menos costosos de operar. La compañía detalló los cambios en un anuncio oficial.

El prompt caching permite a las aplicaciones reutilizar cómputo siempre que múltiples solicitudes de API compartan las mismas instrucciones, herramientas o contexto. Bajo el sistema actualizado, los tokens de entrada en caché pueden calificar para descuentos de hasta 90%, y los modelos GPT-5.6 y posteriores pueden reutilizar prefijos en caché elegibles durante al menos 30 minutos después de su uso más reciente. Para aplicaciones de tipo agente, que tienden a reenviar las mismas instrucciones, definiciones de herramientas e historial de conversación en cada turno, cuánto de cada solicitud puede servirse desde la caché tiene un impacto directo tanto en el costo operativo como en el tiempo de respuesta.

Las mejoras están dirigidas en particular a agentes que trabajan durante períodos prolongados y transportan repetidamente grandes volúmenes de contexto entre solicitudes, como los agentes de programación que refactorizan una base de código o los sistemas que producen documentos extensos de investigación — cargas de trabajo donde el mismo contexto de otro modo podría reprocesarse muchas veces a lo largo de una sola tarea.

Junto con los cambios en el lado del modelo, OpenAI ha lanzado un Prompt Caching Dashboard que permite a los desarrolladores rastrear las tasas de aciertos de caché y comparar el uso de tokens en caché y fuera de caché. Una herramienta de diagnóstico independiente puede identificar cambios en modelos, herramientas, configuraciones o entradas que provocaron que una solicitud no acertara en la caché. En conjunto, estas herramientas ofrecen a los equipos una forma de medir cuánto de su tráfico real es realmente almacenable en caché, convirtiendo el comportamiento de la caché de un detalle de infraestructura invisible en algo que puede monitorearse y ajustarse.

Los desarrolladores también pueden ahora establecer puntos de interrupción de caché explícitos para controlar qué porciones de un prompt se reutilizan, lo que hace posible mantener en caché contenido estable como las instrucciones del sistema y las definiciones de herramientas mientras cambian los segmentos más volátiles del prompt. Los modelos GPT-6 además permiten que el esfuerzo de razonamiento cambie entre respuestas sin invalidar el contexto previamente almacenado en caché cuando se configura de manera adecuada.

Otra incorporación es el precalentamiento de caché, que permite a las aplicaciones procesar instrucciones compartidas, definiciones de herramientas o material de referencia antes de que un usuario envíe una solicitud, reduciendo la cantidad de procesamiento necesario antes de que el modelo comience a responder.

La escala de la oportunidad ya es visible en los datos de clientes: GitHub dijo que las mejoras en la infraestructura de caching de OpenAI redujeron en más de 50% la proporción de tokens de prompt que requieren procesamiento nuevo entre miles de millones de solicitudes a los modelos de OpenAI — una señal de lo grande que puede ser la porción almacenable en caché de las cargas de trabajo reales.

La actualización amplía la función de prompt caching que OpenAI introdujo en 2024, que inicialmente ofrecía descos automáticos para prefijos de prompt usados repetidamente. El sistema GPT-6 extiende esas capacidades con ventanas de reutilización más largas y un control más directo del desarrollador sobre el comportamiento de la caché. A medida que las sesiones de agentes pasan de intercambios únicos a tareas de varias horas, la porción de una carga de trabajo que puede servirse desde la caché se está convirtiendo en un factor práctico en la forma en que los equipos estructuran los prompts y gestionan los costos de API.