OpenAI улучшает кэширование промптов в GPT-6 со скидками до 90% для постоянных агентов
Ключевые выводы
- •Для кэшированных входных токенов доступны скидки до 90%, а модели GPT-5.6 и новее могут повторно использовать подходящие кэшированные префиксы как минимум 30 минут после последнего обращения.
- •OpenAI запустила панель Prompt Caching Dashboard и диагностический инструмент, позволяющие разработчикам измерять долю попаданий в кэш и выявлять изменения моделей, инструментов, настроек или входных данных, из-за которых запросы не попали в кэш.
- •Новые инструменты управления включают явные точки остановки кэша, возможность изменять уровень усилий рассуждений в моделях GPT-6 без инвалидации кэшированного контекста при соответствующей настройке, а также предварительный прогрев кэша до отправки пользовательских запросов.
- •GitHub сообщил, что улучшенная инфраструктура кэширования сократила долю токенов промптов, требующих свежей обработки, более чем на 50% на миллиардах запросов к моделям OpenAI.
- •Обновление развивает функцию кэширования промптов, представленную OpenAI в 2024 году, и ориентировано прежде всего на длительные рабочие нагрузки агентов, таких как агенты для программирования, рефакторящие кодовые базы, и системы, создающие объемные исследовательские документы.

OpenAI выпустила обновление кэширования промптов для всего семейства моделей GPT-6, повысив долю попаданий в кэш и добавив новые инструменты управления для разработчиков, призванные сделать постоянных ИИ-агентов быстрее и дешевле в эксплуатации. Компания подробно описала изменения в официальном анонсе.
Кэширование промптов позволяет приложениям повторно использовать вычисления, когда несколько API-запросов содержат одни и те же инструкции, инструменты или контекст. В обновленной системе кэшированные входные токены могут получать скидки до 90%, а модели GPT-5.6 и новее могут повторно использовать подходящие кэшированные префиксы как минимум 30 минут после последнего обращения. Для приложений агентского типа, которые при каждом шаге повторно отправляют одни и те же инструкции, определения инструментов и историю диалога, объем запроса, который можно обслужить из кэша, напрямую влияет как на стоимость эксплуатации, так и на время отклика.
Улучшения ориентированы прежде всего на агентов, работающих в течение длительного времени и многократно передающих большие объемы контекста между запросами, — например, на агентов для программирования, рефакторящих кодовую базу, или системы, создающие объемные исследовательские документы, где один и тот же контекст в противном случае может обрабатываться заново многократно в рамках одной задачи.
Наряду с изменениями на стороне моделей OpenAI запустила панель Prompt Caching Dashboard, позволяющую разработчикам отслеживать долю попаданий в кэш и сравнивать использование кэшированных и некэшированных токенов. Отдельный диагностический инструмент может выявлять изменения моделей, инструментов, настроек или входных данных, из-за которых запрос не попал в кэш. Вместе эти инструменты дают командам возможность оценивать, какая часть реального трафика действительно поддается кэшированию, превращая поведение кэша из невидимой инфраструктурной детали в измеримый и настраиваемый параметр.
Разработчики теперь также могут устанавливать явные точки остановки кэша, чтобы управлять тем, какие части промпта используются повторно, — это позволяет держать в кэше стабильный контент, такой как системные инструкции и определения инструментов, в то время как более изменчивые сегменты промпта обновляются. Модели GPT-6 дополнительно позволяют менять уровень усилий рассуждений между ответами без инвалидации ранее кэшированного контекста при соответствующей настройке.
Еще одно нововведение — предварительный прогрев кэша: приложения могут заранее обработать общие инструкции, определения инструментов или справочные материалы до того, как пользователь отправит запрос, сокращая объем обработки, необходимой до начала ответа модели.
Масштаб возможностей уже виден на данных клиентов: GitHub сообщил что улучшения инфраструктуры кэширования OpenAI сократили долю токенов промптов, требующих свежей обработки, более чем на 50% на миллиардах запросов к моделям OpenAI — это показатель того, насколько большой может быть поддающаяся кэшированию доля реальных рабочих нагрузок.
Обновление развивает функцию кэширования промптов, представленную OpenAI в 2024 году и изначально предлагавшую автоматические скидки для повторно используемых префиксов промптов. Система GPT-6 расширяет эти возможности более длительными окнами повторного использования и более прямым контролем разработчиков над поведением кэша. По мере того как сессии агентов растягиваются от отдельных обменов до многочасовых задач, доля рабочей нагрузки, которую можно обслужить из кэша, становится практическим фактором в том, как команды структурируют промпты и управляют расходами на API.