提示词缓存prompt caching

将反复发送给语言模型的提示词前段内容保存下来,供后续请求复用的技术。

5篇文章
最近提及

提示词缓存是大语言模型API中的一种技术,将每次请求中重复出现的提示词前段内容,例如系统指令、长文档或之前的对话记录,保存在服务器端,供后续请求复用。由于模型无需从头重新处理相同内容,可以降低输入token的处理成本并减少响应延迟。谷歌的Gemini API将同一功能称为上下文缓存(context caching)。

Anthropic、OpenAI、谷歌等AI企业以API功能的形式提供这项技术。缓存内容在一段时间内未被使用便会过期,过期后需要重新处理。它广泛用于需要长时间对话的聊天机器人和编程智能体。

本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。

涉及该条目的文章

粘性会话之所以重要,是因为对话在账户之间切换会导致提示词缓存未命中,即服务商无法复用此前已存储的提示词部分,同时还会打断模型思考记录的连续性。

提示词缓存会保存模型已经看过的内容以便复用,能让这部分输入token的成本降低约95%。

分叉出的子智能体可以复用父会话的提示词缓存,即模型已读取输入的存储处理结果,从而降低辅助检查的成本,同时让评估内容不进入主对话。

DeepSeek V4 Flash的运行使用了提示词上下文缓存,即复用此前已处理的输入;在开放权重模型的运行中,评估记录到98%的缓存命中率。

提示词缓存读取 $0.20 $0.50


© 2026 AIPOST. All rights reserved.

AIPOST是一家报道AI应用方法、AI安全、性能、创业、健康、伦理与行业资讯的AI专业媒体。无需注册即可使用,个人信息的处理方式请参阅隐私政策。