返回
精选AI 评分 73/100

vLLM 发布 vllm-metal v0.28.0:在 Apple Silicon 上支持并发推理服务

vLLM 官方博客(RSS)·2026-09-22 08:00·1天前·Ranran Haoran Zhang, Lik Xun Yuan, Chao Ju Chen, Eric Curtin, Michael Goin
AI 导读

vLLM 官方发布 vllm-metal v0.28.0,把 vLLM 的 V1 调度器、paged KV cache 和 OpenAI 兼容服务器带到 Apple Silicon,由 MLX 和 Metal 执行模型,版本号与上游 vLLM 对齐。

vLLM 官方博客(RSS)
精选
73AI 编辑部评分,满分 100

vLLM 发布 vllm-metal v0.28.0:在 Apple Silicon 上支持并发推理服务

2026-09-22 08:00· 1天前· Ranran Haoran Zhang, Lik Xun Yuan, Chao Ju Chen, Eric Curtin, Michael Goin
AI 导读

vLLM 官方发布 vllm-metal v0.28.0,把 vLLM 的 V1 调度器、paged KV cache 和 OpenAI 兼容服务器带到 Apple Silicon,由 MLX 和 Metal 执行模型,版本号与上游 vLLM 对齐。

推荐理由

官方首次发布 vllm-metal,用 packed varlen attention 和 paged KV 解决 Mac 上并发请求的服务问题,并给出可复现的并发基准数据。

按该来源的展示范围,站内仅提供摘要。

前往原站阅读(在新标签页打开)

来源:vLLM 官方博客(RSS)· vllm.ai