三个重要的概念, Prefill, KV cache, Prefix caching
例如,在文档+LLM 的办公场景:
A: 文档 +“帮我看看,有哪些风险?” B: 文档+“预算减半,帮我调整一下。” C:修改后文档+“再看看,现在的预算够不够?”
Prefill:处理 input。 KV cache:保存状态。 留下计算得到的 K/V,供后续生成使用。 Prefix caching:C 的输入方案已改变,只能复用首次 token 变化之前的共同 prefix。
https://x.com/i/article/2098863329817051136