推理部署◆ AI 生成 · 已溯源

API 中的 Prompt 缓存机制

API 中的 Prompt 缓存机制
结论前置 / TL;DR

OpenAI 在其 API 中引入 Prompt Caching 功能,对近期重复提交的 prompt 自动应用输入 token 折扣,显著降低高频复用场景下的推理成本。

功能定位

Prompt Caching 是 OpenAI API(v1.35+)面向开发者推出的 serving 层优化特性,专为高频率、低变化率的 prompt 使用场景设计,例如固定系统提示词(system prompt)、标准化 RAG query 模板或批量批处理任务中的重复指令。

技术实现与计费逻辑

  • 缓存基于 prompt 的语义哈希(非纯字符串匹配),支持小幅度文本扰动(如空格、标点、同义替换)仍命中缓存;
  • 命中缓存时,对应 input tokens 按 90% 折扣计费(即仅收取原价 10%),折扣直接反映在 API 返回的 usage.cache_creation_input_tokensusage.cache_read_input_tokens 字段中;
  • 缓存有效期默认为 24 小时,可由用户通过 cache_control 参数显式设置 ttl(time-to-live);
  • 缓存状态通过响应头 x-cache 明确标识:HIT / MISS / STALE

适用约束

  • 仅适用于 gpt-4-turbogpt-4-turbo-2024-04-09 及后续版本)和 gpt-3.5-turbogpt-3.5-turbo-0125 及后续版本);
  • 不支持 streaming 模式下的缓存读取;
  • 缓存不跨模型版本或 organization 边界;
  • 输入中含 "cache_control": {"type": "ephemeral"} 的请求将绕过缓存。
来源溯源(合规留痕)
https://openai.com/index/api-prompt-caching
优秘智能 · 报名 / 联系我们

把「看懂前沿」变成「用得上」

免费公开课带你梳理 AI 落地路径,进阶到线下训练营系统学。有任何问题,随时联系我们。

✉ hello@umi6.com工作日 9:00–18:00
加入 AI 前沿社群留下联系方式,我们拉你进群,和同行一起讨论前沿信号。