OpenAI 升級 GPT-6 提示快取,為長時運行的 AI 代理提供最高 90% 折扣
重點速覽
- •快取輸入權杖可享最高 90% 的折扣,GPT-5.6 及更新模型可在最近使用後至少 30 分鐘內重複使用符合條件的快取前綴。
- •OpenAI 推出了提示快取儀表板與診斷工具,讓開發者衡量快取命中率,並識別導致請求未命中快取的模型、工具、設定或輸入變更。
- •新的開發者控制選項包括明確的快取斷點、在適當設定下於 GPT-6 模型上調整推理強度而不使快取上下文失效的能力,以及在使用者發送請求前的快取預熱。
- •GitHub 表示,改進後的快取基礎設施在數十億次對 OpenAI 模型的請求中,將需要重新處理的提示權杖比例降低了超過 50%。
- •此次更新擴展了 OpenAI 於 2024 年推出的提示快取功能,特別針對長時代理工作負載,例如重構程式碼庫的程式編寫代理,以及產出長篇研究文件的系統。

OpenAI 為其 GPT-6 模型系列推出提示快取升級,帶來更高的快取命中率,以及讓長時運行 AI 代理運作更快、成本更低的新開發者控制選項。該公司在官方公告中詳細說明了這些變更。
提示快取讓應用程式在多個 API 請求共用相同指令、工具或上下文時,能夠重複利用運算結果。在更新後的系統中,快取輸入權杖可享最高 90% 的折扣,GPT-5.6 及更新模型可在最近使用後至少 30 分鐘內重複使用符合條件的快取前綴。對於代理型應用程式而言,由於每一輪都會重新發送相同的指令、工具定義與對話歷史,每個請求中能由快取服務的比例,直接影響營運成本與回應時間。
這些改進特別針對長時間工作、並在請求之間反覆攜帶大量上下文的代理,例如重構程式碼庫的程式編寫代理,或產出長篇研究文件的系統——這類工作負載中,相同上下文在單一任務過程中可能會被重新處理多次。
除了模型端的變更,OpenAI 也推出了提示快取儀表板,讓開發者追蹤快取命中率,並比較快取與未快取權杖的使用情況。另一個獨立的診斷工具可以識別導致請求未命中快取的模型、工具、設定或輸入變更。這些工具讓團隊能夠衡量實際流量中有多少其實可以被快取,將快取行為從看不見的基礎設施細節,轉變為可監控與調校的項目。
開發者現在也可以設定明確的快取斷點,控制提示的哪些部分會被重複使用,讓系統指令與工具定義等穩定內容保持快取,而提示中變動較大的部分則可更改。GPT-6 模型進一步允許在適當設定下,於各回應之間調整推理強度,而不會使先前快取的上下文失效。
另一項新功能是快取預熱,讓應用程式可以在使用者發送請求之前,先處理共用指令、工具定義或參考資料,減少模型開始回應前所需的處理量。
機會的規模已從客戶數據中可見:GitHub 表示,OpenAI 快取基礎設施的改進,在數十億次對 OpenAI 模型的請求中,將需要重新處理的提示權杖比例降低了超過 50%——這顯示實際工作負載中可快取的比例可以有多大。
此次更新建立在 OpenAI 於 2024 年推出的提示快取功能之上,該功能最初為重複使用的提示前綴提供自動折扣。GPT-6 系統以更長的重複使用時間窗口,以及對快取行為更直接的開發者控制,擴展了這些能力。著代理工作階段從單次對話延長至數小時的任務,工作負載中可由快取服務的比例,正成為團隊設計提示結構與管理 API 成本時的實際考量因素。