热点事件 历史事件

作者实测:在消费级硬件上用SGLang SSD Expert Pack运行DeepSeek-V4-Flash,相对Ollama基线Alpaca/MMLU prefill提升2.28x/3.39x、decode提升6.92x/6.55x,输出与Ollama语义等价,VRAM缓存命中率54.2%/46.4%

1 篇报道1 个精选信源

先了解这件事

报道摘要

SGLang 将 SSD-LLaMA 的思路引入 MoE 推理,把放不进显存和内存的路由专家放在 NVMe SSD 上,通过 Expert Pack 连续布局、O_DIRECT 直接 I/O 和带预算的 GPU LFU/LRU 缓存,只加载 router 选中的专家。

摘自 LMSYS:Blog(Chatbot Arena 团队)

报道时间线

沿着报道,了解事件的不同侧面。

显示 1全部报道最新在前
  1. LMSYS:Blog(Chatbot Arena 团队)官方一手精选
    SGLang 用 SSD Expert Pack 在消费级硬件上运行 DeepSeek-V4-Flash 和 Kimi-K3

    SGLang 将 SSD-LLaMA 的思路引入 MoE 推理,把放不进显存和内存的路由专家放在 NVMe SSD 上,通过 Expert Pack 连续布局、O_DIRECT 直接 I/O 和带预算的 GPU LFU/LRU 缓存,只加载 router 选中的专家。