OpenAI 升级 GPT-6 提示词缓存,为持久化 AI 智能体提供最高 90% 折扣
要点速览
- •缓存的输入 Token 可享受最高 90% 的折扣,GPT-5.6 及之后的模型可在最近一次使用后的至少 30 分钟内重复使用符合条件的缓存前缀。
- •OpenAI 推出了 Prompt Caching Dashboard 和诊断工具,开发者可以借此测量缓存命中率,并识别导致请求未命中缓存的模型、工具、设置或输入变更。
- •新的开发者控制功能包括显式缓存断点、在适当配置下调整 GPT-6 模型推理力度而不使缓存上下文失效的能力,以及在用户请求发送前的缓存预热。
- •GitHub 表示,改进后的缓存基础设施使其对 OpenAI 模型的数十亿次请求中需要重新处理的提示词 比例下降了超过 50%。
- •此次更新扩展了 OpenAI 于 2024 年推出的提示词缓存功能,尤其面向长时间的智能体工作负载,例如重构代码库的编程智能体和生成长篇研究文档的系统。

OpenAI 对其 GPT-6 模型系列的提示词缓存进行了升级,带来更高的缓存命中率和新的开发者控制功能,旨在让持久化 AI 智能体运行得更快、成本更低。该公司在一份官方公告中详细介绍了这些变化。
提示词缓存允许应用程序在多个 API 请求共享相同指令、工具或上下文时复用计算。在更新后的系统中,缓存的输入 Token 可享受最高 90% 的折扣,GPT-5.6 及之后的模型可在最近一次使用后的至少 30 分钟内重复使用符合条件的缓存前缀。对于智能体类应用而言,这类应用往往在每一轮都会重复发送相同的指令、工具定义和对话历史,因此每个请求中能由缓存服务的比例直接影响运营成本和响应时间。
这些改进尤其面向需要长时间工作并在请求之间反复携带大量上下文的智能体,例如重构代码库的编程智能体或生成长篇研究文档的系统——在这类工作负载中,相同的上下文在单个任务过程中可能被反复处理多次。
除了模型侧的变化,OpenAI 还推出了 Prompt Caching Dashboard,让开发者可以追踪缓存命中率,并对比缓存与未缓存 Token 的使用情况。另一款独立的诊断工具可以识别导致请求未命中缓存的模型、工具、设置或输入方面的变更。这些工具共同为团队提供了一种衡量真实流量中实际可缓存比例的方法,使缓存行为从不可见的基础设施细节变成可以监控和调优的对象。
开发者现在还可以设置显式缓存断点,以控制提示词中哪些部分被复用,从而在提示词中易变部分发生变化时,保持系统指令和工具定义等稳定内容的缓存。GPT-6 模型还支持在适当配置的情况下,在不同响应之间调整推理力度,而不会使之前缓存的上下文失效。
另一项新功能是缓存预热,它允许应用程序在用户发送请求之前处理共享指令、工具定义或参考资料,从而减少模型开始响应前所需的处理量。
这一机会的规模已经从客户数据中显现:GitHub 表示,OpenAI 缓存基础设施的改进使其对 OpenAI 模型的数十亿次请求中需要重新处理的提示词 Token 比例下降了超过 50%——这表明真实工作负载中可缓存的部分可以达到多么大的规模。
此次更新是在 OpenAI 于 2024 年推出的提示词缓存功能基础上扩展的,该功能最初为重复使用的提示词前缀提供自动折扣。GPT-6 系统通过更长的复用时间窗口以及对缓存行为更直接的开发者控制,进一步扩展了这些能力。随着智能体会话从单次交互延伸至数小时级任务,工作负载中可由缓存服务的比例正成为团队组织提示词和管理 API 成本的实际考量因素。