返回
AI 评分 54/100

vLLM 推出 Hybrid HiSparse 优化,让 GLM 5.3 在单节点 8× H200 上跑满 100 万上下文

vLLM 官方博客(RSS)·2026-09-08 08:00·4天前·vLLM Team
AI 导读

vLLM 团队为 GLM 5.3 引入 Hybrid HiSparse 混合稀疏卸载,在单个 8× H200 节点上首次实现 100 万完整上下文长度推理。该方法仅在 KV cache 压力出现时才将 top-K 之外的 KV 卸载到 CPU,热页与常驻页共享同一块池和张量,无需抢占或重新 prefill。

vLLM 官方博客(RSS)
54AI 编辑部评分,满分 100

vLLM 推出 Hybrid HiSparse 优化,让 GLM 5.3 在单节点 8× H200 上跑满 100 万上下文

2026-09-08 08:00· 4天前· vLLM Team
AI 导读

vLLM 团队为 GLM 5.3 引入 Hybrid HiSparse 混合稀疏卸载,在单个 8× H200 节点上首次实现 100 万完整上下文长度推理。该方法仅在 KV cache 压力出现时才将 top-K 之外的 KV 卸载到 CPU,热页与常驻页共享同一块池和张量,无需抢占或重新 prefill。

按该来源的展示范围,站内仅提供摘要。

前往原站阅读(在新标签页打开)

来源:vLLM 官方博客(RSS)· vllm.ai