# MLPerf Inference v6.1 发布：AMD 512 个 MI355X 刷新纪录，英伟达 Vera Rubin VR200 首次现身

- 来源：IT之家（RSS）
- 发布时间：2026-09-17 14:31
- AIHOT 分数：46
- AIHOT 链接：https://aihot.news/items/cmu57f4ke045wro4of7p7tocw
- 原文链接：https://www.ithome.com/1/003/575.htm

## AI 摘要

MLPerf Inference v6.1 结果公布，AMD 以 512 个 Instinct MI355X GPU 在 DeepSeek R1 测试中创下 575 万 token/秒的新纪录，离线成绩 2,901,950 tokens/s、服务器成绩 2,405,310 tokens/s。

## 正文

IT之家 9 月 17 日消息，科技媒体 Wccftech 昨日（9 月 16 日）发布博文，报道称在 MLPerf Inference v6.1 发布后，AMD、NVIDIA 等厂商同步提交结果。

IT之家注：MLPerf Inference 是由 MLCommons 维护的推理基准测试套件，用于衡量不同硬件在 AI 推理任务中的吞吐和延迟表现。最新 6.1 版重点集中在 AI 推理吞吐、扩展效率和不同 GPU 配置下的表现。

AMD 称以 575 万个 token / 秒的速度在 512 个 GPU 规模下创造了新的 MLPerf 记录，这是 AMD 迄今为止规模最大的提交，再次证明了 AMD 的性能、规模、软件成熟度和可复现性。

DeepSeek R1 测试中，AMD 以 512 个 Instinct MI355X GPU 参赛，离线（强调批量处理能力，通常用于衡量系统在非实时场景下的最大吞吐）成绩 2,901,950 tokens/s，服务器（强调在线服务场景中的吞吐与响应能力，更接近实际部署中的请求处理环境）成绩 2,405,310 tokens/s。

英伟达在同一项目中提交 GB300 和 GB200 的 288 GPU 配置，GB300 离线 2,705,130 tokens/s，服务器 2,028,030 tokens/s。由于配置存在差异，以上数据仅供参考。

此外英伟达的 Vera Rubin VR200 首次进入 MLPerf 推理基准，共出现了 36 GPU 和 72 GPU 两种配置。在相同 72 个 GPU 配置下，Vera Rubin (VR200) 要比 GB300 快 95%，此外 36 GPU 配置版本要比 72-GPU GB200 配置更快。
