vLLM 终于支持 DSpark 与流水线并行

SemiAnalysis · @SemiAnalysis_ · X·2026-09-09 06:01·1小时前
AI 导读

vLLM 现已支持 DSpark 推测解码与流水线并行(Pipeline Parallelism)协同工作。此前因权重无法单机容纳而需使用流水线并行的用户无法利用 DSpark,该功能由 yongqinwang-cmd 与 Inferact 实现,Kimi K3 的 2.8T 参数规模推动了这一更新。

SemiAnalysis@SemiAnalysis_
44AI 编辑部评分,满分 100

vLLM 终于支持 DSpark 与流水线并行

2026-09-09 06:01· 1小时前
AI 导读

vLLM 现已支持 DSpark 推测解码与流水线并行(Pipeline Parallelism)协同工作。此前因权重无法单机容纳而需使用流水线并行的用户无法利用 DSpark,该功能由 yongqinwang-cmd 与 Inferact 实现,Kimi K3 的 2.8T 参数规模推动了这一更新。

Spec Decoding (DSpark) finally works with Pipeline Parallelism in vLLM!! 🔥 A lot of the GPU poor/proletarian have been asking for this feature for a while now, but it took the recent Kimi K3's massive 2.8T parameters affecting the GPU middle class (B200) for it to be implemented!

Before this change, GPU poors that needed to use pipeline parallelism, as their weights didn't fully fit on 1 server, would not be able to take advantage of DSpark.

Shoutout to yongqinwang-cmd & Inferact for implementing it in vLLM!

来源:SemiAnalysis· x.com