NotizieAzioniOpenAI potenzia il prompt caching di GPT-6 con sconti fino al 90% per gli agenti persistenti

OpenAI potenzia il prompt caching di GPT-6 con sconti fino al 90% per gli agenti persistenti

Autore: CryptoBriefing·

Punti chiave

  • Sono disponibili sconti fino al 90% per i token di input in cache, e i modelli GPT-5.6 e successivi possono riutilizzare i prefissi idonei in cache per almeno 30 minuti dopo il loro utilizzo più recente.
  • OpenAI ha lanciato una Prompt Caching Dashboard e uno strumento diagnostico che permettono agli sviluppatori di misurare i tassi di hit della cache e identificare le modifiche a modelli, strumenti, impostazioni o input che hanno causato i cache miss.
  • I nuovi controlli per gli sviluppatori includono breakpoint di cache espliciti, la possibilità di regolare lo sforzo di ragionamento sui modelli GPT-6 senza invalidare il contesto in cache quando configurati in modo appropriato, e il cache prewarming prima dell'invio delle richieste degli utenti.
  • GitHub ha riferito che l'infrastruttura di caching migliorata ha ridotto di oltre il 50% la quota di token di prompt che richiedono un'elaborazione ex novo su miliardi di richieste ai modelli OpenAI.
  • L'aggiornamento estende la funzionalità di prompt caching introdotta da OpenAI nel 2024 e si rivolge in particolare ai carichi di lavoro degli agenti a lunga durata, come gli agenti di coding che refattorizzano codebase e i sistemi che generano lunghi documenti di ricerca.
OpenAI potenzia il prompt caching di GPT-6 con sconti fino al 90% per gli agenti persistenti

OpenAI ha rilasciato un aggiornamento del prompt caching per l'intera famiglia di modelli GPT-6, introducendo tassi di hit della cache più elevati e nuovi controlli per gli sviluppatori progettati per rendere gli agenti AI persistenti più veloci ed economici da gestire. L'azienda ha illustrato le modifiche in un annuncio ufficiale.

Il prompt caching consente alle applicazioni di riutilizzare i calcoli quando più richieste API condividono le stesse istruzioni, strumenti o contesto. Con il sistema aggiornato, i token di input in cache possono beneficiare di sconti fino al 90%, e i modelli GPT-5.6 e successivi possono riutilizzare i prefissi idonei in cache per almeno 30 minuti dopo il loro utilizzo più recente. Per le applicazioni di tipo agente, che tendono a reinviare le stesse istruzioni, definizioni degli strumenti e cronologia della conversazione a ogni turno, la quota di ciascuna richiesta servibile dalla cache incide direttamente sia sui costi operativi sia sui tempi di risposta.

I miglioramenti sono rivolti in particolare agli agenti che lavorano per periodi prolungati e trasportano ripetutamente grandi volumi di contesto tra le richieste, come gli agenti di coding che refattorizzano una codebase o i sistemi che producono lunghi documenti di ricerca — carichi di lavoro in cui lo stesso contesto potrebbe altrimenti essere rielaborato molte volte nel corso di una singola attività.

Accanto alle modifiche lato modello, OpenAI ha lanciato una Prompt Caching Dashboard che permette agli sviluppatori di monitorare i tassi di hit della cache e confrontare l'utilizzo di token in cache e non in cache. Uno strumento diagnostico separato può identificare le modifiche a modelli, strumenti, impostazioni o input che hanno causato un cache miss. Insieme, questi strumenti offrono ai team un modo per misurare quanta parte del traffico reale sia effettivamente memorizzabile in cache, trasformando il comportamento della cache da un dettaglio infrastrutturale invisibile a qualcosa di monitorabile e ottimizzabile.

Gli sviluppatori possono ora impostare breakpoint di cache espliciti per controllare quali porzioni di un prompt vengono riutilizzate, rendendo possibile mantenere in cache contenuti stabili come le istruzioni di sistema e le definizioni degli strumenti, mentre cambiano le segmenti del prompt più volatili. I modelli GPT-6 consentono di modificare lo sforzo di ragionamento tra le risposte senza invalidare il contesto precedentemente in cache, quando configurati in modo appropriato.

Un'altra novità è il cache prewarming, che consente alle applicazioni di elaborare in anticipo istruzioni condivise, definizioni degli strumenti o materiale di riferimento prima che l'utente invii una richiesta, riducendo la quantità di elaborazione necessaria prima che il modello inizi a rispondere.

L'entità dell'opportunità è già visibile nei dati dei clienti: GitHub ha dichiarato che i miglioramenti dell'infrastruttura di caching di OpenAI hanno ridotto di oltre il 50% la quota di token di prompt che richiedono un'elaborazione ex novo su miliardi di richieste ai modelli OpenAI — un segno di quanto possa essere ampia la quota di cacheabile nei carichi di lavoro reali.

L'aggiornamento si basa sulla funzionalità di prompt caching introdotta da OpenAI nel 2024, che inizialmente offriva sconti automatici per i prefissi di prompt utilizzati ripetutamente. Il sistema GPT-6 estende queste capacità con finestre di riutilizzo più lunghe e un controllo più diretto degli sviluppatori sul comportamento della cache. Man mano che le sessioni degli agenti si estendono da singoli scambi ad attività di lunga durata, la quota di un carico di lavoro servibile dalla cache sta diventando un fattore pratico nel modo in cui i team strutturano i prompt e gestiscono i costi delle API.