OpenAI 为 GPT-6 推出改进的提示词缓存系统与诊断工具

OpenAI:官网动态(RSS · 排除企业/客户案例)·2026-09-23 05:00·27分钟后
AI 导读

OpenAI 为 GPT-6 系列推出改进的提示词缓存系统,默认提高缓存命中率,对 30 分钟窗口内复用的合格共享前缀提供最高 90% 的缓存输入 token 折扣。

OpenAI:官网动态(RSS · 排除企业/客户案例)
精选
63AI 编辑部评分,满分 100

OpenAI 为 GPT-6 推出改进的提示词缓存系统与诊断工具

2026-09-23 05:00· 27分钟后
AI 导读

OpenAI 为 GPT-6 系列推出改进的提示词缓存系统,默认提高缓存命中率,对 30 分钟窗口内复用的合格共享前缀提供最高 90% 的缓存输入 token 折扣。

推荐理由

原文给出缓存命中率、30 分钟窗口折扣上限和新监控诊断工具,读者可以据此优化长期运行智能体的成本和延迟。

正文 · AI 翻译

更高的缓存命中率,以及帮助持久化智能体运行更快、成本更低的新工具。

GPT‑6 让持久化智能体能够连续数小时处理复杂任务,从重构代码库到产出经过充分调研的文档和演示文稿。支撑这些智能体的应用会发起一系列相互依赖的 API 请求,往往会沿用早前轮次中的相同指令、工具定义和上下文。OpenAI 会缓存这些共享上下文,以便在多个请求之间复用计算,从而缩短响应时间,并为开发者提供最高 90% 的缓存输入 token 折扣。

借助 GPT‑6 系列,我们推出了改进的提示词缓存系统,默认即可实现更高的缓存命中率。我们现在对在 30 分钟窗口内复用的符合条件的共享前缀提供缓存折扣。我们还推出了新工具,帮助开发者监控缓存性能、诊断未命中情况,并选择要缓存提示词的多少部分。

媒体内容 · 前往原文查看
“OpenAI 的提示词缓存在帮助 GitHub Copilot 大规模提供快速、高效体验方面发挥着关键作用。在过去几个月里,相对于此前的基线,我们在向 OpenAI 模型发起的数十亿次请求中,将需要全新处理的提示词 token 占比降低了 50% 以上。其结果是更高效的推理栈,以及开发者获得首次响应的时间更快。”
——Mario Rodriguez,首席产品官

监控缓存并诊断缓存未命中

全新的 提示词缓存仪表盘⁠ 可展示你的应用输入中有多少来自缓存。你可以追踪一段时间内的命中率,并使用输入构成图表来对比已缓存和未缓存的 token。这些视图有助于你发现缓存命中的下降,并评估应用改动对缓存性能的影响。

Prompt caching dashboard showing cache hit rate, cache performance over time, and input token composition.

当你遇到意外的缓存未命中时,可使用 提示词缓存诊断工具⁠ 来了解发生了什么。将某个请求与近期的响应进行对比,以识别导致无法复用缓存的模型、工具、设置或输入变化。受影响的 token 估算数量可帮助你评估影响规模,并决定如何优化你的集成以最大化缓存命中率。

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

为你的应用优化缓存

选择要缓存的内容。 显式缓存断点让你可以选择要复用哪些提示词前缀。更新后的 提示词缓存指南⁠ 解释了如何使用它们、缓存前缀保持有效的时间,以及工具和输入的变化如何影响复用。

调整推理强度而不破坏缓存。 在 GPT‑6 模型上,你现在可以在多次响应之间 更改推理强度⁠ 而不破坏缓存。对于更难的任务可以提高强度,对于常规的后续跟进可以降低强度,只需追加一个 configuration_update,同时保持请求级别的推理强度不变。这让你可以调整任务所需的推理量,同时保留可复用的上下文。

在工具和指令发生变化时保留缓存。当你的智能体的工具使用需求发生变化时,保持工具定义、schema 和顺序稳定,以便较早的上下文保持可复用。使用 allowed_tools 让只有相关的工具可被调用,或者在不需要工具时将 tool_choice 设为 none,而不是移除定义。使用新的 developer 消息在上下文末尾追加新指令,以覆盖较早的指令。参见我们的关于管理工具变更的指南⁠

预热缓存以降低延迟。预热⁠会提前准备好已知上下文,这样当请求到达时,模型可以更快开始响应。例如,应用可以在启动期间预热共享指令、工具定义或参考资料,在用户提出第一个问题之前完成。这样就把处理过程移出了用户的等待时间。

这些可选控制项建立在引擎的默认性能之上,帮助你根据自身工作负载定制缓存。

媒体内容 · 前往原文查看
“OpenAI 的提示词缓存诊断和仪表盘帮助我们将缓存命中率提高了几个百分点,成本降低了 20%。现在当缓存意外失效时我们会收到告警,并使用 Codex 智能体来诊断根本原因。显式断点还让我们能够缓存稳定的上下文,同时将频繁变化的内容保留在提示词末尾。这使得为后台任务分叉对话、同时复用几乎全部共享上下文在经济上变得可行。”
—Arian Hanifi,首席技术官

来源:OpenAI:官网动态(RSS · 排除企业/客户案例)· openai.com