跳到正文
热点事件持续更新

清华团队发布TokenRouter论文

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

清华大学团队发表论文,提出服务系统 TokenRouter,在 token 级别对大小模型进行路由,吞吐量最高可达现有方案的 64.15 倍。 论文称,现有 vLLM、SGLang 等框架一次请求只能运行一个模型,双模型协作时每一步都要等待较慢的模型。TokenRouter 的做法是让每个模型独立部署、来回传递半成品答案,同时保留 KV cache,并短暂挂起请求以凑出更大批次。 上述 64.15 倍吞吐量为论文给出的结果,尚未见独立验证。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月10日
  1. Rohan Paul
    清华 TokenRouter:token 级 LLM 路由服务系统

    清华论文提出 TokenRouter,一个在 token 级进行大小模型路由的服务系统,吞吐量最高达现有方案的 64.15 倍。针对 vLLM、SGLang 等框架一次请求只跑一个模型、双模型协作时每步都等慢模型的问题,TokenRouter 让每个模型独立部署并来回传递半成品答案,同时保留 KV cache,并短暂挂起请求以凑更大批次。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。