返回
AI 评分 38/100

vLLM 在 GB300 NVL72 上 PD 部署 Qwen3.8-2.4T 的性能调优实录

vLLM 官方博客(RSS)·2026-09-21 08:00·15小时前·vLLM Team
AI 导读

vLLM 在 GB300 NVL72 集群上对 Qwen3.8-2.4T 做 PD 分离部署,8K/1K 负载下高吞吐场景达到每 GPU 5000 total token 吞吐,低延迟场景每用户 180 生成 token,并给出完整 pareto 前沿。

vLLM 官方博客(RSS)
38AI 编辑部评分,满分 100

vLLM 在 GB300 NVL72 上 PD 部署 Qwen3.8-2.4T 的性能调优实录

2026-09-21 08:00· 15小时前· vLLM Team
AI 导读

vLLM 在 GB300 NVL72 集群上对 Qwen3.8-2.4T 做 PD 分离部署,8K/1K 负载下高吞吐场景达到每 GPU 5000 total token 吞吐,低延迟场景每用户 180 生成 token,并给出完整 pareto 前沿。

按该来源的展示范围,站内仅提供摘要。

前往原站阅读(在新标签页打开)

来源:vLLM 官方博客(RSS)· vllm.ai