# vLLM 推出 Hybrid HiSparse 优化，让 GLM 5.3 在单节点 8× H200 上跑满 100 万上下文

- 来源：vLLM 官方博客（RSS）
- 作者：vLLM Team
- 发布时间：2026-09-08 08:00
- AIHOT 分数：54
- AIHOT 链接：https://aihot.news/items/cmtym20dc0004rovu0qx3k5y4
- 原文链接：https://vllm.ai/blog/2026-09-08-glm53-part1-hybrid-sparse-offloading

## AI 摘要

vLLM 团队为 GLM 5.3 引入 Hybrid HiSparse 混合稀疏卸载，在单个 8× H200 节点上首次实现 100 万完整上下文长度推理。该方法仅在 KV cache 压力出现时才将 top-K 之外的 KV 卸载到 CPU，热页与常驻页共享同一块池和张量，无需抢占或重新 prefill。

## 正文

按该来源的展示范围，站内仅提供摘要。

> 站内仅提供摘要，全文见原文。
