热点事件 历史事件
作者实测:用SGLang SSD Expert Pack运行Kimi-K3,相对llama.cpp基线Alpaca/MMLU prefill提升6.96x/5.80x、decode提升3.30x/3.52x,92个路由层Top-16全部执行且io_errors=0,缓存命中率17.0%/22.7%
先了解这件事
报道摘要SGLang 将 SSD-LLaMA 的思路引入 MoE 推理,把放不进显存和内存的路由专家放在 NVMe SSD 上,通过 Expert Pack 连续布局、O_DIRECT 直接 I/O 和带预算的 GPU LFU/LRU 缓存,只加载 router 选中的专家。
报道时间线
沿着报道,了解事件的不同侧面。
显示 1 篇全部报道,最新在前
- SGLang 用 SSD Expert Pack 在消费级硬件上运行 DeepSeek-V4-Flash 和 Kimi-K3
SGLang 将 SSD-LLaMA 的思路引入 MoE 推理,把放不进显存和内存的路由专家放在 NVMe SSD 上,通过 Expert Pack 连续布局、O_DIRECT 直接 I/O 和带预算的 GPU LFU/LRU 缓存,只加载 router 选中的专家。