提示词缓存prompt caching
将反复发送给语言模型的提示词前段内容保存下来,供后续请求复用的技术。
5篇文章
最近提及 提示词缓存是大语言模型API中的一种技术,将每次请求中重复出现的提示词前段内容,例如系统指令、长文档或之前的对话记录,保存在服务器端,供后续请求复用。由于模型无需从头重新处理相同内容,可以降低输入token的处理成本并减少响应延迟。谷歌的Gemini API将同一功能称为上下文缓存(context caching)。
Anthropic、OpenAI、谷歌等AI企业以API功能的形式提供这项技术。缓存内容在一段时间内未被使用便会过期,过期后需要重新处理。它广泛用于需要长时间对话的聊天机器人和编程智能体。
本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。
涉及该条目的文章
提示词缓存会保存模型已经看过的内容以便复用,能让这部分输入token的成本降低约95%。
分叉出的子智能体可以复用父会话的提示词缓存,即模型已读取输入的存储处理结果,从而降低辅助检查的成本,同时让评估内容不进入主对话。
DeepSeek V4 Flash的运行使用了提示词上下文缓存,即复用此前已处理的输入;在开放权重模型的运行中,评估记录到98%的缓存命中率。
提示词缓存读取 $0.20 $0.50