OpenAI améliore le prompt caching de GPT-6 avec des remises allant jusqu'à 90 % pour les agents IA persistants
Points clés
- •Des remises allant jusqu'à 90 % sont disponibles pour les tokens d'entrée mis en cache, et les modèles GPT-5.6 et versions ultérieures peuvent réutiliser les préfixes en cache éligibles pendant au moins 30 minutes après leur dernière utilisation.
- •OpenAI a lancé un Prompt Caching Dashboard et un outil de diagnostic permettant aux développeurs de mesurer les taux de succès du cache et d'identifier les modifications de modèle, d'outil, de paramètre ou d'entrée ayant causé les échecs de cache.
- •Les nouveaux contrôles pour les développeurs comprennent des points de rupture de cache explicites, la possibilité d'ajuster l'effort de raisonnement sur les modèles GPT-6 sans invalider le contexte en cache lorsque la configuration est appropriée, et le préchauffage du cache avant l'envoi des requêtes utilisateur.
- •GitHub a indiqué que l'infrastructure de cache améliorée a réduit de plus de 50 % la part des tokens de prompt nécessitant un traitement frais sur des milliards de requêtes vers les modèles d'OpenAI.
- •Cette mise à jour étend la fonctionnalité de prompt caching introduite par OpenAI en 2024 et cible particulièrement les charges de travail étendues d'agents, comme les agents de code refactorisant des bases de code et les systèmes générant de longs documents de recherche.

OpenAI a déployé une mise à niveau du prompt caching sur l'ensemble de sa famille de modèles GPT-6, introduisant des taux de succès du cache plus élevés et de nouveaux contrôles pour les développeurs conçus pour rendre les agents IA persistants plus rapides et moins coûteux à exploiter. La société a détaillé ces changements dans une annonce officielle.
Le prompt caching permet aux applications de réutiliser les calculs chaque fois que plusieurs requêtes API partagent les mêmes instructions, outils ou contexte. Dans le système mis à jour, les tokens d'entrée mis en cache peuvent bénéficier de remises allant jusqu'à 90 %, et les modèles GPT-5.6 et versions ultérieures peuvent réutiliser les préfixes en cache éligibles pendant au moins 30 minutes après leur dernière utilisation. Pour les applications de type agent, qui ont tendance à renvoyer les mêmes instructions, définitions d'outils et historique de conversation à chaque tour, la proportion de chaque requête pouvant être servie depuis le cache a une incidence directe sur les coûts d'exploitation et le temps de réponse.
Ces améliorations visent en particulier les agents qui travaillent sur de longues périodes et transportent de manière répétée de grands volumes de contexte entre les requêtes, comme les agents de code refactorisant une base de code ou les systèmes produisant de longs documents de recherche — des charges de travail où le même contexte pourrait autrement être retraité de nombreuses fois au cours d'une même tâche.
En plus des changements côté modèle, OpenAI a lancé un Prompt Caching Dashboard qui permet aux développeurs de suivre les taux de succès du cache et de comparer l'utilisation des tokens mis en cache et non mis en cache. Un outil de diagnostic distinct peut identifier les modifications de modèles, d'outils, de paramètres ou d'entrées qui ont causé l'échec du cache d'une requête. Ensemble, ces outils offrent aux équipes un moyen de mesurer la part de leur trafic réel réellement cachable, transformant le comportement du cache d'un détail d'infrastructure invisible en quelque chose de mesurable et d'optimisable.
Les développeurs peuvent désormais également définir des points de rupture de cache explicites pour contrôler quelles parties d'un prompt sont réutilisées, ce qui permet de garder en cache le contenu stable tel que les instructions système et les définitions d'outils pendant que les segments plus volatils du prompt changent. Les modèles GPT-6 permettent en outre de modifier l'effort de raisonnement entre les réponses sans invalider le contexte précédemment mis en cache, lorsque la configuration est appropriée.
Autre ajout : le préchauffage du cache (cache prewarming), qui permet aux applications de traiter les instructions partagées, les définitions d'outils ou le matériel de référence avant qu'un utilisateur n'envoie une requête, réduisant la quantité de traitement nécessaire avant que le modèle ne commence à répondre.
L'ampleur de l'opportunité déjà visible dans les données clients : GitHub a indiqué que les améliorations de l'infrastructure de cache d'OpenAI ont réduit de plus de 50 % la part des tokens de prompt nécessitant un traitement frais sur des milliards de requêtes vers les modèles d'OpenAI — un signe de l'ampleur que peut représenter la part cachable des charges de travail réelles.
Cette mise à jour s'appuie sur la fonctionnalité de prompt caching qu'OpenAI avait introduite en 2024, qui offrait initialement des remises automatiques pour les préfixes de prompt utilisés de manière répétée. Le système GPT-6 étend ces capacités avec des fenêtres de réutilisation plus longues et un contrôle plus direct du comportement du cache par les développeurs. À mesure que les sessions d'agents s'étendent d'échanges uniques à des tâches de plusieurs heures, la part d'une charge de travail pouvant être servie depuis le cache devient un facteur pratique dans la façon dont les équipes structurent leurs prompts et gèrent leurs coûts d'API.