提示缓存(Prompt Caching)
也叫: Prompt Caching · 上下文缓存 · 前缀缓存 · Context Caching
提示缓存是模型服务商提供的功能:保存重复提示前缀的处理结果,之后以相同内容开头的请求就能更快、以更低的输入成本得到处理。
Agent 每一轮都要重发大量相同的文字:系统提示词、工具定义、项目说明,还有越来越长的对话历史。每次从头处理这些内容是在浪费算力。提示缓存让服务商保存某个前缀已算出的中间状态,当后续请求以完全相同的 token 开头时直接复用。
主流模型服务商都有某种形式的支持,叫法有 prompt caching、context caching 等。命中缓存的输入通常有折扣、处理也更快,但具体折扣、缓存有效期和最小长度因服务商而异且会变化,请以当前官方文档为准,不要凭印象假设数字。
对长时间运行的 Agent,这是最有效的成本与延迟杠杆之一,也改变了你组织提示词的方式:稳定的内容放前面,易变的内容放后面。
怎么运作
缓存按前缀工作:请求从头开始逐 token 与之前处理过的内容比对,第一个差异点之前的部分都可以复用。有的服务商自动缓存,有的需要你标记缓存断点。缓存条目在一段时间不被使用后过期。提示词靠前位置的任何改动,比如在开头插入时间戳、调整工具顺序,都会让其后的全部内容失效。
举个例子
某编程 Agent 的提示词排布是:系统指令、工具定义、仓库说明、然后是至今的对话。每一轮新消息都追加在末尾,所以开头几千个 token 完全相同,从缓存读取。如果之后有人把当前时间加到系统提示词的最前面,每个请求就都会未命中缓存。
常见误解
常见问题
提示缓存是什么?
怎么提高 Agent 的缓存命中率?
提示缓存会改变模型输出吗?
最近核实: 2026-09-20