LLM 速度体验:TTFT 与 ITL 解析

Dongxi 东锡 NLP · @dongxi_nlp · X·2026-09-15 15:31·20小时前
AI 导读

LLM 的速度体验分为等待首 token 和回答流畅度两方面,分别与 Prefill 和 Decode 密切相关。从发出请求到收到第一个 token 的等待叫 TTFT,模型在此期间进行 prefill 处理输入;开始回答后通过 decode 逐步生成后续 token,相邻 token 到达间隔叫 ITL。TTFT 越短反应越快,ITL 越短且越稳定回答越流畅。

Dongxi 东锡 NLP@dongxi_nlp
40AI 编辑部评分,满分 100

LLM 速度体验:TTFT 与 ITL 解析

2026-09-15 15:31· 20小时前
AI 导读

LLM 的速度体验分为等待首 token 和回答流畅度两方面,分别与 Prefill 和 Decode 密切相关。从发出请求到收到第一个 token 的等待叫 TTFT,模型在此期间进行 prefill 处理输入;开始回答后通过 decode 逐步生成后续 token,相邻 token 到达间隔叫 ITL。TTFT 越短反应越快,ITL 越短且越稳定回答越流畅。

LLM 的速度,有两种体验:等多久开始回答,回答时是否流畅。 两种体验,与 Prefill 和 Decode 密切相关。

从发出请求到收到第一个 token,这段等待叫 TTFT,首 token 反应时间。 模型在其中进行 prefill,处理输入内容

开始回答后,模型通过 decode 逐步生成后续 token,相邻两个 token 到达的间隔叫 ITL,token间延迟。

TTFT 越短,反应越快;ITL 越短且越稳定,回答就越流畅。

Dongxi 东锡 NLPhttps://x.com/i/article/2099600211739803648

来源:Dongxi 东锡 NLP· x.com