热点事件 历史事件

vLLM在单卡H200实测FP8 DiffusionGemma达1,288 tokens/s(约6倍自回归基线、约3倍多token预测基线),H100上1,008 tokens/s(约5倍与约2.6倍)

1 篇报道1 个精选信源

先了解这件事

报道摘要

vLLM 宣布原生支持 Google DeepMind 的 DiffusionGemma,一个基于 Gemma4 骨干、26B 参数的离散扩散语言模型,也是 vLLM 支持的首个 dLLM。

摘自 vLLM 官方博客

报道时间线

沿着报道,了解事件的不同侧面。

显示 1全部报道最新在前
  1. vLLM 官方博客官方一手精选
    vLLM 原生支持 Google 首个扩散语言模型 DiffusionGemma

    vLLM 宣布原生支持 Google DeepMind 的 DiffusionGemma,一个基于 Gemma4 骨干、26B 参数的离散扩散语言模型,也是 vLLM 支持的首个 dLLM。