Prefill、KV cache 与 Prefix caching 三概念解析

Dongxi 东锡 NLP · @dongxi_nlp · X·2026-09-13 17:21·58分钟前
AI 导读

马东锡 NLP 用文档+LLM 办公场景解释三个概念:Prefill 处理 input,KV cache 保存计算得到的 K/V 供后续生成使用,Prefix caching 在输入变化时只能复用首次 token 变化之前的共同 prefix。以 A、B、C 三轮文档问答为例,C 的输入方案已改变,因此无法完整复用前序缓存。

Dongxi 东锡 NLP@dongxi_nlp
32AI 编辑部评分,满分 100

Prefill、KV cache 与 Prefix caching 三概念解析

2026-09-13 17:21· 58分钟前
AI 导读

马东锡 NLP 用文档+LLM 办公场景解释三个概念:Prefill 处理 input,KV cache 保存计算得到的 K/V 供后续生成使用,Prefix caching 在输入变化时只能复用首次 token 变化之前的共同 prefix。以 A、B、C 三轮文档问答为例,C 的输入方案已改变,因此无法完整复用前序缓存。

三个重要的概念, Prefill, KV cache, Prefix caching

例如,在文档+LLM 的办公场景:

A: 文档 +“帮我看看,有哪些风险?” B: 文档+“预算减半,帮我调整一下。” C:修改后文档+“再看看,现在的预算够不够?”

Prefill:处理 input。 KV cache:保存状态。 留下计算得到的 K/V,供后续生成使用。 Prefix caching:C 的输入方案已改变,只能复用首次 token 变化之前的共同 prefix。

Dongxi 东锡 NLPhttps://x.com/i/article/2098863329817051136

来源:Dongxi 东锡 NLP· x.com