prompt caching

4 篇文章

AI
Prompt Caching, End to End · 1

提示缓存(一):到底缓存了什么

prompt caching 省下的不是网络往返,而是 prefill 阶段的算力。本文讲清 KV cache 从哪来、前缀哈希为什么要求逐 token 一致、TTL 为什么必须存在,以及缓存写入为什么会比不缓存更贵。

AI
Prompt Caching, End to End · 2

提示缓存(二):五家厂商三家云的账单差异

AWS 文档说 Claude Sonnet 4.5 在 Bedrock 上要 4096 token 才能缓存,我实测是 1024——和一方 API 一样。本文对照五家模型厂商与三家云的当期倍率、TTL 档位、跨区域行为,并区分哪些数字是实测的、哪些只是文档值。

AI
Prompt Caching, End to End · 3

提示缓存(三):开了却没命中,怎么查

提示缓存失效几乎不报错——推理成功、日志干净、只有账单变贵。本文按出现频率拆四类元凶:前缀混进易变内容、序列化顺序抖动、工具顺序不稳、中间层静默吞掉缓存标记,并给出一个跨厂商的命中率自检脚本。

AI
Prompt Caching, End to End · 4

提示缓存(四):文档说 4096,实测 1024

AWS 文档给 Claude Sonnet 4.5 标的最小可缓存前缀是 4096 token。我在 Bedrock 上做了 20 多次夹逼调用,真实门槛是 1024——和 Anthropic 一方 API 一样。同时验证了另外三个模型,其中三个文档准确,只有 Sonnet 4.5 这一条错了 4 倍。