按该来源的展示范围,站内仅提供摘要。
前往原站阅读(在新标签页打开)vLLM 发布 vllm-metal v0.28.0:在 Apple Silicon 上支持并发推理服务
AI 导读
vLLM 官方发布 vllm-metal v0.28.0,把 vLLM 的 V1 调度器、paged KV cache 和 OpenAI 兼容服务器带到 Apple Silicon,由 MLX 和 Metal 执行模型,版本号与上游 vLLM 对齐。
vLLM 官方博客(RSS)
精选
73
AI 编辑部评分,满分 100vLLM 发布 vllm-metal v0.28.0:在 Apple Silicon 上支持并发推理服务
vLLM 官方发布 vllm-metal v0.28.0,把 vLLM 的 V1 调度器、paged KV cache 和 OpenAI 兼容服务器带到 Apple Silicon,由 MLX 和 Metal 执行模型,版本号与上游 vLLM 对齐。
推荐理由
官方首次发布 vllm-metal,用 packed varlen attention 和 paged KV 解决 Mac 上并发请求的服务问题,并给出可复现的并发基准数据。
来源:vLLM 官方博客(RSS)· vllm.ai