OpenAI ulepsza cache promptów w GPT-6 ze zniżkami do 90% dla trwałych agentów AI
Najważniejsze informacje
- •Tokeny wejściowe objęte cache mogą korzystać ze zniżek do 90%, a modele GPT-5.6 i nowsze mogą ponownie wykorzystywać kwalifikujące się prefiksy z cache przez co najmniej 30 minut od ostatniego użycia.
- •OpenAI uruchomiło Prompt Caching Dashboard i narzędzie diagnostyczne, które pozwalają deweloperom mierzyć wskaźniki trafień w cache oraz identyfikować zmiany modeli, narzędzi, ustawień lub danych wejściowych, które spowodowały chybione trafienia.
- •Nowe funkcje kontroli dla deweloperów obejmują jawne punkty przerwania cache, możliwość zmiany poziomu wysiłku rozumowania w modelach GPT-6 bez unieważniania zapisanego kontekstu przy odpowiedniej konfiguracji oraz wstępne podgrzewanie cache przed wysłaniem zapytania przez użytkownika.
- •GitHub poinformował, że ulepszona infrastruktura cache zmniejszyła o ponad 50% odsetek tokenów promptów wymagających świeżego przetwarzania w miliardach zapytań do modeli OpenAI.
- •Aktualizacja rozwija funkcję cache promptów wprowadzoną przez OpenAI w 2024 roku i jest skierowana w szczególności do rozszerzonych obciążeń agentowych, takich jak agenty programistyczne refaktoryzujące bazy kodu i systemy generujące obszerne dokumenty badawcze.

OpenAI wdrożyło ulepszenie cache promptów w całej rodzinie modeli GPT-6, wprowadzając wyższe wskaźniki trafień w cache i nowe funkcje kontroli dla deweloperów, mające sprawić, że trwałe agenty AI będą działać szybciej i taniej. Firma opisała zmiany w oficjalnym ogłoszeniu.
Cache promptów pozwala aplikacjom ponownie wykorzystywać obliczenia, gdy wiele zapytań API współdzieli te same instrukcje, narzędzia lub kontekst. W zaktualizowanym systemie tokeny wejściowe objęte cache mogą kwalifikować się do zniżek do 90%, a modele GPT-5.6 i nowsze mogą ponownie wykorzystywać kwalifikujące się prefiksy z cache przez co najmniej 30 minut od ich ostatniego użycia. Dla aplikacji typu agentowego, które przy każdej turze ponownie wysyłają te same instrukcje, definicje narzędzi i historię rozmowy, to, jaka część każdego zapytania może być obsłużona z cache, ma bezpośredni wpływ zarówno na koszty operacyjne, jak i czas odpowiedzi.
Ulepszenia są skierowane w szczególności do agentów pracujących przez dłuższy czas i wielokrotnie przenoszących duże ilości kontekstu między zapytaniami, takich jak agenty programistyczne refaktoryzujące bazę kodu czy systemy tworzące obszerne dokumenty badawcze — czyli obciążenia, w których ten sam kontekst mógłby być w przeciwnym razie wielokrotnie przetwarzany w ramach jednego zadania.
Oprócz zmian po stronie modeli OpenAI uruchomiło Prompt Caching Dashboard, który pozwala deweloperom śledzić wskaźniki trafień w cache i porównywać użycie tokenów z cache i bez niego. Osobne narzędzie diagnostyczne może zidentyfikować zmiany modeli, narzędzi, ustawień lub danych wejściowych, które spowodowały, że zapytanie nie trafiło do cache. Razem narzędzia te dają zespołom sposób na zmierzenie, jaka część rzeczywistego ruchu nadaje się do cache'owania, przekształcającowanie cache z niewidocznego szczegółu infrastruktury w coś, co można monitorować i dostrajać.
Deweloperzy mogą teraz również ustawiać jawne punkty przerwania cache, aby kontrolować, które fragmenty promptu są ponownie wykorzystywane, co umożliwia utrzymywanie w cache stabilnej zawartości, takiej jak instrukcje systemowe i definicje narzędzi, podczas gdy bardziej zmienne segmenty promptu ulegają zmianie. Modele GPT-6 pozwalają dodatkowo zmieniać poziom wysiłku rozumowania między odpowiedziami bez unieważniania wcześniej zapisanego kontekstu, o ile są odpowiednio skonfigurowane.
Kolejną nowością jest wstępne podgrzewanie cache (cache prewarming), które pozwala aplikacjom przetwarzać wspólne instrukcje, definicje narzędzi lub materiały referencyjne, zanim użytkownik wyśle zapytanie, zmniejszając ilość przetwarzania wymaganego, zanim model zacznie odpowiadać.
Skalę możliwości widać już w danych klientów: GitHub poinformował, że ulepszenia infrastruktury cache OpenAI zmniejszyły o ponad 50% odsetek tokenów promptów wymagających świeżego przetwarzania w miliardach zapytań do modeli OpenAI — co pokazuje, jak duża część rzeczywistych obciążeń może podlegać cache'owaniu.
Aktualizacja rozwija funkcję cache promptów wprowadzoną przez OpenAI w 2024 roku, która początkowo oferowała automatyczne zniżki dla wielokrotnie używanych prefiksów promptów. System GPT-6 rozszerza te możliwości o dłuższe okna ponownego wykorzystania i bardziej bezpośrednią kontrolę deweloperów nad zachowaniem cache. W miarę jak sesje agentów wydłużają się z pojedynczych wymian do wielogodzinnych zadań, część obciążenia, którą można obsłużyć z cache, staje się praktycznym czynnikiem w tym, jak zespoły strukturują prompty i zarządzają kosztami API.