热点事件 历史事件
vLLM在单卡H200实测FP8 DiffusionGemma达1,288 tokens/s(约6倍自回归基线、约3倍多token预测基线),H100上1,008 tokens/s(约5倍与约2.6倍)
先了解这件事
报道摘要vLLM 宣布原生支持 Google DeepMind 的 DiffusionGemma,一个基于 Gemma4 骨干、26B 参数的离散扩散语言模型,也是 vLLM 支持的首个 dLLM。
报道时间线
沿着报道,了解事件的不同侧面。
显示 1 篇全部报道,最新在前
- vLLM 原生支持 Google 首个扩散语言模型 DiffusionGemma
vLLM 宣布原生支持 Google DeepMind 的 DiffusionGemma,一个基于 Gemma4 骨干、26B 参数的离散扩散语言模型,也是 vLLM 支持的首个 dLLM。