热点事件 观察中
Modal 分享将 Kimi K2.6 推理服务单副本性能提升 2.8 倍/用户、5.6 倍跨用户的优化工作
先了解这件事
事实说明Modal 介绍其为 Moonshot AI 的 Kimi K2.6 模型提供编码智能体推理服务时所做的性能优化:单副本每用户性能提升 2.8 倍、副本内跨用户提升 5.6 倍;采用 NVFP4 微缩放格式、SGLang 引擎并向上游提交补丁、DFlash 推测解码(微调后接受长度从 5.00 升至 5.84,增量加速 20%)、KV 缓存 BF16 转 FP8 及共享专家 FP8 转 NVFP4、HiCache 扩展缓存层级、KV 缓存感知路由等。优化后服务规模达每天数千亿 token,并已复用于包括 Kimi K3 在内的更多模型。
报道时间线
沿着报道,了解事件的不同侧面。
显示 1 篇全部报道,最新在前
- Modal 分享将 Kimi K2.6 推理服务单副本性能提升 2.8 倍/用户、5.6 倍跨用户的优化工作
Modal 介绍其为 Moonshot AI 的 Kimi K2.6 模型提供编码智能体推理服务时所做的性能优化:单副本每用户性能提升 2.8 倍、副本内跨用户提升 5.6 倍;采用 NVFP4 微缩放格式、SGLang 引擎并向上游提交补丁、DFlash 推测解码(微调后接受长度从 5.00 升至 5.84,增量加速 20%)、KV 缓存 BF16 转 FP8 及共享专家 FP8 转 NVFP4、HiCache 扩展缓存层级、KV 缓存感知路由等。优化后服务规模达每天数千亿 token,并已复用于包括 Kimi K3 在内的更多模型。
24 HOURS
本事件热度走势
当前热度 5可比范围峰值 5(9月24日 05:00)近24小时可比范围变化 —
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。