# vLLM 发布 vllm-metal v0.28.0：在 Apple Silicon 上支持并发推理服务

- 来源：vLLM 官方博客（RSS）
- 作者：Ranran Haoran Zhang, Lik Xun Yuan, Chao Ju Chen, Eric Curtin, Michael Goin
- 发布时间：2026-09-22 08:00
- AIHOT 分数：73
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cmue9uxe20smtroghgwne9l3u
- 原文链接：https://vllm.ai/blog/2026-09-22-vllm-metal-v0-28-0

## 精选理由

官方首次发布 vllm-metal，用 packed varlen attention 和 paged KV 解决 Mac 上并发请求的服务问题，并给出可复现的并发基准数据。

## AI 摘要

vLLM 官方发布 vllm-metal v0.28.0，把 vLLM 的 V1 调度器、paged KV cache 和 OpenAI 兼容服务器带到 Apple Silicon，由 MLX 和 Metal 执行模型，版本号与上游 vLLM 对齐。

## 正文

按该来源的展示范围，站内仅提供摘要。

> 站内仅提供摘要，全文见原文。
