# vLLM 分层 KV Cache 卸载：跨主机内存、存储与远端节点复用 KV 数据

- 来源：vLLM 官方博客（RSS）
- 作者：Or Ozeri, Danny Harnik, Ronen Schaffer, Itay Etelis, Varun Sundar Rabindranath
- 发布时间：2026-09-10 08:00
- AIHOT 分数：49
- AIHOT 链接：https://aihot.news/items/cmtym20dc0003rovu9hywtkfe
- 原文链接：https://vllm.ai/blog/2026-09-10-tiered-kv-offloading

## AI 摘要

vLLM 推出分层 KV Cache 卸载框架，自 v0.22 起可用，将淘汰的 KV 数据保留在主机内存、文件系统、对象存储和远端节点中，避免重新计算。该设计让所有 KV 数据先经主机内存流转，加速器内存可在拷贝完成后立即释放，并支持跨节点共享 KV 数据、横向扩展缓存与分离式服务。

## 正文

按该来源的展示范围，站内仅提供摘要。

> 站内仅提供摘要，全文见原文。
