按该来源的展示范围,站内仅提供摘要。
前往原站阅读(在新标签页打开)NVIDIA 全栈 NIM 优化如何在 Nemotron 3 Ultra 上支撑 2.5 倍并发用户
AI 导读
NVIDIA 在 4xB200 系统上对 Nemotron 3 Ultra NIM 2.0.12 优化后,系统输出吞吐从基线的 718 tok/s 提升至 1,997 tok/s,在 50 TPS/user 目标下并发用户数提升超 2.5 倍。
NVIDIA Technical Blog:Agentic AI / Generative AI
37
AI 编辑部评分,满分 100NVIDIA 全栈 NIM 优化如何在 Nemotron 3 Ultra 上支撑 2.5 倍并发用户
NVIDIA 在 4xB200 系统上对 Nemotron 3 Ultra NIM 2.0.12 优化后,系统输出吞吐从基线的 718 tok/s 提升至 1,997 tok/s,在 50 TPS/user 目标下并发用户数提升超 2.5 倍。
来源:NVIDIA Technical Blog:Agentic AI / Generative AI· developer.nvidia.com