跳到正文
热点事件持续更新

Baseten分享GLM-5高性能推理优化实践

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月3日,Baseten 在工程博客发文,介绍其 Model API 在 GLM-5 上的推理栈优化实践。据该文,Artificial Analysis 当日对 Baseten 的 GLM-5 Model API 进行了基准测试,Baseten 称其在首 token 延迟(TTFT)和每秒 token 数(TPS)两项指标上均取得当前最佳结果,具体为 200+ TPS、约 200ms TTFT,成为该榜单上最快的 GLM-5 服务。文章同时分享了实现这一结果所采用的推理栈优化技术细节。上述性能数据与“最快”表述均来自 Baseten 一方,Artificial Analysis 榜单的具体口径与测试条件未在报道中展开。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月3日
  1. Baseten 工程博客
    Baseten 如何打造 Artificial Analysis 上最快的 GLM-5

    Baseten 的 Model API 在 Artificial Analysis 上跑出 200+ TPS、约 200ms TTFT,成为该榜单上最快的 GLM-5 服务。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。