# vLLM 在 GB300 NVL72 上 PD 部署 Qwen3.8-2.4T 的性能调优实录

- 来源：vLLM 官方博客（RSS）
- 作者：vLLM Team
- 发布时间：2026-09-21 08:00
- AIHOT 分数：38
- AIHOT 链接：https://aihot.news/items/cmub8j2du0qftrolnri7pt2e1
- 原文链接：https://vllm.ai/blog/2026-09-21-qwen38-pd-serving

## AI 摘要

vLLM 在 GB300 NVL72 集群上对 Qwen3.8-2.4T 做 PD 分离部署，8K/1K 负载下高吞吐场景达到每 GPU 5000 total token 吞吐，低延迟场景每用户 180 生成 token，并给出完整 pareto 前沿。

## 正文

按该来源的展示范围，站内仅提供摘要。

> 站内仅提供摘要，全文见原文。
