# NVIDIA Dynamo 何时该用 Encode-Prefill-Decode 分离加速多模态模型服务

- 来源：NVIDIA Technical Blog：Agentic AI / Generative AI
- 发布时间：2026-09-09 00:00
- AIHOT 分数：45
- AIHOT 链接：https://aihot.news/items/cmtym2ep40004rofbh84tslp7
- 原文链接：https://developer.nvidia.com/blog/when-to-use-encode-prefill-decode-disaggregation-to-accelerate-multimodal-model-serving

## AI 摘要

NVIDIA 详解在 Dynamo 推理框架中用 encode-prefill-decode（EPD）分离加速多模态模型服务：把视觉编码器与 prefill、decode 拆成可独立扩缩的 worker，图像密集提示词下 TTFT 最高快 5 倍、端到端响应最高快 7 倍。

## 正文

按该来源的展示范围，站内仅提供摘要。

> 站内仅提供摘要，全文见原文。
