NachrichtenAktienOpenAI rüstet GPT-6 Prompt Caching mit bis zu 90 % Rabatten für persistente KI-Agenten auf

OpenAI rüstet GPT-6 Prompt Caching mit bis zu 90 % Rabatten für persistente KI-Agenten auf

Autor: CryptoBriefing·

Wichtige Erkenntnisse

  • Gecachte Eingabe-Token erhalten Rabatte von bis zu 90 %, und Modelle ab GPT-5.6 können berechtigte gecachte Präfixe mindestens 30 Minuten nach ihrer letzten Verwendung wiederverwenden.
  • OpenAI hat ein Prompt-Caching-Dashboard und ein Diagnosetool eingeführt, mit denen Entwickler Cache-Trefferquoten messen und die Modell-, Tool-, Einstellungs- oder Eingabeänderungen identifizieren können, die zu Cache-Fehltreffern geführt haben.
  • Zu den neuen Entwicklerkontrollen gehören explizite Cache-Bruchpunkte, die Möglichkeit, den Reasoning-Aufwand bei GPT-6-Modellen ohne Invalidierung des gecachten Kontexts anzupassen (bei entsprechender Konfiguration), sowie Cache-Prewarming vor dem Senden von Nutzeranfragen.
  • GitHub meldete, dass die verbesserte Caching-Infrastruktur den Anteil der neu zu verarbeitenden Prompt-Token über Milliarden von Anfragen an OpenAI-Modelle um mehr als 50 % gesenkt hat.
  • Das Update erweitert die 2024 von OpenAI eingeführte Prompt-Caching-Funktion und richtet sich besonders an umfangreiche Agenten-Arbeitslasten wie Coding-Agenten, die Codebasen refaktorieren, und Systeme, die lange Forschungsdokumente erstellen.
OpenAI rüstet GPT-6 Prompt Caching mit bis zu 90 % Rabatten für persistente KI-Agenten auf

OpenAI hat ein Upgrade des Prompt Cachings über seine GPT-6-Modellfamilie ausgerollt, mit höheren Cache-Trefferquoten und neuen Entwicklerkontrollen, die persistente KI-Agenten schneller und kostengünstiger im Betrieb machen sollen. Das Unternehmen hat die Änderungen in einer offiziellen Ankündigung erläutert.

Prompt Caching ermöglicht es Anwendungen, Berechnungen wiederzuverwenden, wann immer mehrere API-Anfragen dieselben Anweisungen, Tools oder denselben Kontext teilen. Im aktualisierten System können gecachte Eingabe-Token Rabatte von bis zu 90 % erhalten, und Modelle ab GPT-5.6 können berechtigte gecachte Präfixe mindestens 30 Minuten nach ihrer letzten Verwendung wiederverwenden. Für Agenten-Anwendungen, die bei jedem Schritt dieselben Anweisungen, Tool-Definitionen und den Konversationsverlauf erneut senden, hat der Anteil der gecachten Anfragen direkte Auswirkungen sowohl auf die Betriebskosten als auch auf die Antwortzeiten.

Die Verbesserungen richten sich insbesondere an Agenten, die über längere Zeiträume arbeiten und wiederholt große Kontextmengen zwischen Anfragen transportieren, etwa Coding-Agenten, die eine Codebasis refaktorieren, oder Systeme, die lange Forschungsdokumente erstellen – Arbeitslasten, bei denen derselbe Kontext andernfalls im Verlauf einer einzigen Aufgabe vielfach neu verarbeitet würde.

Neben den modellseitigen Änderungen hat OpenAI ein Prompt-Caching-Dashboard eingeführt, mit dem Entwickler die Cache-Trefferquoten verfolgen und die Nutzung gecachter und nicht gecachter Token vergleichen können. Ein separates Diagnosetool kann Änderungen an Modellen, Tools, Einstellungen oder Eingaben identifizieren, die dazu geführt haben, dass eine Anfrage den Cache verfehlt hat. Zusammen geben diese Tools Teams die Möglichkeit zu messen, wie viel ihres realen Traffic tatsächlich cachebar ist, und verwandeln das Cache-Verhalten von einer unsichtbaren Infrastrukturdetails in etwas Überwachbares und Optimierbares.

Entwickler können nun außerdem explizite Cache-Bruchpunkte setzen, um zu steuern, welche Teile eines Promptserverwendet werden. So lässt sich stabilisierter Inhalt wie Systemanweisungen und Tool-Definitionen im Cache halten, während sich veränderliche Abschnitte eines Prompts ändern. GPT-6-Modelle ermöglichen zudem, dass sich der Reasoning-Aufwand zwischen Antworten ändert, ohne zuvor gecachten Kontext zu invalidieren – sofern entsprechend konfiguriert.

Eine weitere Neuerung ist das Cache-Prewarming, das es Anwendungen erlaubt, gemeinsame Anweisungen, Tool-Definitionen oder Referenzmaterial zu verarbeiten, bevor ein Nutzer eine Anfrage sendet, wodurch der Verarbeitungsaufwand reduziert wird, bevor das Modell mit der Antwort beginnt.

Das Ausmaß der Möglichkeiten zeigt sich bereits in Kundendaten: GitHub teilte mit, dass die Verbesserungen an OpenAIs Caching-Infrastruktur den Anteil der neu zu verarbeitenden Prompt-Token über Milliarden von Anfragen an OpenAI-Modelle um mehr als 50 % gesenkt haben – ein Zeichen dafür, wie groß der cachebare Anteil realer Arbeitslasten sein kann.

Das Update baut auf der Prompt-Caching-Funktion auf, die OpenAI 2024 eingeführt hatte und die zunächst automatische Rabatte für wiederholt genutzte Prompt-Präfixe bot. Das GPT-6-System erweitert diese Fähigkeiten um längere Wiederverwendungszeiträume und eine direktere Entwicklerkontrolle über das Cache-Verhalten. Während sich Agent-Sitzungen von einzelnen Austauschen zu stundenlangen Aufgaben ausdehnen, wird der cachebare Anteil einer Arbeitslast zu einem praktischen Faktor dafür, wie Teams Prompts strukturieren und API-Kosten verwalten.