OpenAI verbetert prompt caching in GPT-6 met kortingen tot 90% voor persistente AI-agenten
Belangrijkste punten
- •Voor gecachte inputtokens zijn kortingen tot 90% beschikbaar, en GPT-5.6 en nieuwere modellen kunnen in aanmerking komende gecachte prefixes minimaal 30 minuten na hun meest recente gebruik hergebruiken.
- •OpenAI lanceerde een Prompt Caching Dashboard en diagnostictool waarmee ontwikkelaars cache hit rates kunnen meten en vaststellen welke wijzigingen in modellen, tools, instellingen of invoer tot cache-misses leidden.
- •Nieuwe ontwikkelaarscontroles omvatten expliciete cache-breakpoints, de mogelijkheid om de redeneerinspanning op GPT-6-modellen aan te passen zonder gecachte context ongeldig te maken (mits correct geconfigureerd), en cache prewarming voordat gebruikersverzoeken worden verstuurd.
- •GitHub meldde dat de verbeterde cache-infrastructuur het aandeel prompttokens dat opnieuw verwerkt moest worden met meer dan 50% verminderde over miljarden verzoeken aan OpenAI-modellen.
- •De update breidt de prompt caching-functie uit die OpenAI in 2024 introduceerde en richt zich met name op langlopende agent-werkbelastingen, zoals coding-agenten die codebases refactoren en systemen die lange onderzoeksdocumenten genereren.

OpenAI heeft een upgrade uitgerold voor prompt caching in de GPT-6-modelfamilie, met hogere cache hit rates en nieuwe ontwikkelaarscontroles die persistente AI-agenten sneller en goedkoper in bedrijf moeten maken. Het bedrijf heeft de wijzigingen toegelicht in een officiële aankondiging.
Prompt caching maakt het mogelijk dat applicaties berekeningen hergebruiken wanneer meerdere API-verzoeken dezelfde instructies, tools of context delen. Onder het bijgewerkte systeem komen gecachte inputtokens in aanmerking voor kortingen tot 90%, en kunnen GPT-5.6 en nieuwere modellen in aanmerking komende gecachte prefixes minimaal 30 minuten na hun meest recente gebruik hergebruiken. Voor agent-achtige applicaties, die bij elke beurt doorgaans dezelfde instructies, tooldefinities en gespreksgeschiedenis opnieuw versturen, heeft de mate waarin een verzoek uit de cache kan worden bediend directe gevolgen voor zowel de bedrijfskosten als de reactietijd.
De verbeteringen zijn met name gericht op agenten die gedurende langere perioden werken en herhaaldelijk grote hoeveelheden context tussen verzoeken vervoeren, zoals coding-agenten die een codebase refactoren of systemen die lange onderzoeksdocumenten produceren — werkbelastingen waarbij dezelfde context anders mogelijk vele malen opnieuw wordt verwerkt binnen één taak.
Naast de modelaanpassingen heeft OpenAI een Prompt Caching Dashboard gelanceerd waarmee ontwikkelaars cache hit rates kunnen volgen en gecacht en ongecacht tokengebruik kunnen vergelijken. Een aparte diagnostictool kan vaststellen welke wijzigingen in modellen, tools, instellingen of invoer ertoe hebben geleid dat een verzoek de cache miste. Samen geven deze tools teams een manier om te meten hoeveel van hun echte verkeer daadwerkelijk cachebaar is, en maken ze cachegedrag van een onzichtbaar infrastructuurdetail tot iets dat gemonitord en geoptimaliseerd kan worden.
Ontwikkelaars kunnen nu ook expliciete cache-breakpoints instellen om te bepalen welke delen van een prompt worden hergebruikt, waardoor stabiele content zoals systeeminstructies en tooldefinities gecacht kan blijven terwijl wisselendere delen van een prompt veranderen. GPT-6-modellen maken het bovendien mogelijk om de redeneerinspanning tussen antwoorden te wijzigen zonder eerder gecachte context ongeldig te maken, mits correct geconfigureerd.
Een andere toevoeging is cache prew, waarmee applicaties gedeelde instructies, tooldefinities of referentiemateriaal kunnen verwerken voordat een gebruiker een verzoek verstuurt, waardoor de hoeveelheid verwerking die nodig is voordat het model begint te reageren afneemt.
De schaal van de kans is al zichtbaar in klantgegevens: GitHub meldde dat de verbeteringen aan de cache-infrastructuur van OpenAI het aandeel prompttokens dat opnieuw verwerkt moest worden met meer dan 50% verminderden over miljarden verzoeken aan OpenAI-modellen — een teken van hoe groot het cachebare deel van echte werkbelastingen kan zijn.
De update bouwt voort op de prompt caching-functie die OpenAI in 2024 introduceerde en die aanvankelijk automatische kortingen bood voor herhaaldelijk gebruikte prompt-prefixes. Het GPT-6-systeem breidt die mogelijkheden uit met langere hergebruiksvensters en directere controle voor ontwikkelaars over cachegedrag. Nu agent-sessies zich uitstrekken van losse interacties tot taken van meerdere uren, wordt het aandeel van een werkbelasting dat uit de cache kan worden bediend een praktische factor in de manier waarop teams prompts structureren en API-kosten beheren.