热点事件 历史事件

SGLang 推出 Weight Cache Daemon

2 篇报道2 个精选信源

事件全貌

AI 综述

SGLang 团队推出 Weight Cache Daemon,通过 CUDA IPC 零拷贝映射将模型权重加载时间从约 495 秒降至约 0.63 秒,加速约 785 倍,端到端启动时间减少 93.9%。

该守护进程在 GPU 内存中持久化后量化权重,支持多实例共享和亚秒级主备切换,是 Fast Engine Recovery Framework 的第一阶段。

蚂蚁百灵于 2026 年 8 月 22 日宣布为 SGLang 推出该守护进程,在 Ling-2.6-1T FP8 上权重加载时间约 0.63 秒,比磁盘加载快约 780 倍,引擎总启动时间从 8.8 分钟缩短至约 0.53 分钟。

AI 汇总报道生成 · 25天前更新。单篇报道保留其发布时的原貌。

最新进展

蚂蚁百灵宣布为 SGLang 推出权重缓存守护进程,启动时间缩短至 0.53 分钟。

报道时间线

沿着报道,了解事件的不同侧面。

显示 2全部报道最新在前
  1. X:蚂蚁百灵 (@AntLingAGI)官方一手精选
    蚂蚁百灵为SGLang推出权重缓存守护进程

    今天,我们为 SGLang 推出 Weight Cache Daemon。🚀 在 Ling-2.6-1T FP8 上,它将权重加载时间缩短至约 0.63 秒,比磁盘加载快约 780 倍,并将引擎总启动时间从 8.8 分钟缩短至约 0.53 分钟。其工作原理如下。

  2. LMSYS:Blog(Chatbot Arena 团队)官方一手
    SGLang 推出 Weight Cache Daemon,实现亚秒级引擎重启

    SGLang 团队推出 Weight Cache Daemon,通过 CUDA IPC 零拷贝映射将模型权重加载从约 495 秒降至约 0.63 秒(约 785 倍加速),端到端启动时间减少 93.9%。该守护进程在 GPU 内存中持久化后量化权重,支持多实例共享和亚秒级主备切换,是 Fast Engine Recovery Framework 的第一阶段。