# NVIDIA 发布 AIPerf 并演示如何在 vLLM 上规模化做 LLM 推理基准测试

- 来源：NVIDIA Technical Blog：Agentic AI / Generative AI
- 发布时间：2026-09-19 03:41
- AIHOT 分数：58
- AIHOT 链接：https://aihot.news/items/cmu7d73k1066frogrkrn93n1e
- 原文链接：https://developer.nvidia.com/blog/benchmarking-llm-inference-at-scale-with-aiperf

## AI 摘要

NVIDIA 技术博客介绍 AIPerf，它是 GenAI-Perf 的完全重写继任者，采用多进程加 ZMQ 协调的架构避免客户端成为瓶颈，支持 15+ 端点类型、ShareGPT 与 Mooncake 等 trace 回放，以及 constant、Poisson、gamma 到达模式。

## 正文

按该来源的展示范围，站内仅提供摘要。

> 站内仅提供摘要，全文见原文。
