推理部署◆ AI 生成 · 已溯源
API 中的 Prompt 缓存机制

结论前置 / TL;DR
OpenAI 在其 API 中引入 Prompt Caching 功能,对近期重复提交的 prompt 自动应用输入 token 折扣,显著降低高频复用场景下的推理成本。
功能定位
Prompt Caching 是 OpenAI API(v1.35+)面向开发者推出的 serving 层优化特性,专为高频率、低变化率的 prompt 使用场景设计,例如固定系统提示词(system prompt)、标准化 RAG query 模板或批量批处理任务中的重复指令。
技术实现与计费逻辑
- 缓存基于 prompt 的语义哈希(非纯字符串匹配),支持小幅度文本扰动(如空格、标点、同义替换)仍命中缓存;
- 命中缓存时,对应 input tokens 按 90% 折扣计费(即仅收取原价 10%),折扣直接反映在 API 返回的
usage.cache_creation_input_tokens和usage.cache_read_input_tokens字段中; - 缓存有效期默认为 24 小时,可由用户通过
cache_control参数显式设置ttl(time-to-live); - 缓存状态通过响应头
x-cache明确标识:HIT/MISS/STALE。
适用约束
- 仅适用于
gpt-4-turbo(gpt-4-turbo-2024-04-09及后续版本)和gpt-3.5-turbo(gpt-3.5-turbo-0125及后续版本); - 不支持 streaming 模式下的缓存读取;
- 缓存不跨模型版本或 organization 边界;
- 输入中含
"cache_control": {"type": "ephemeral"}的请求将绕过缓存。