vllm-metal 发布首个正式版 v0.28.0,将 vLLM 调度器、分页 KV 与 OpenAI 兼容服务带到 Apple Silicon
先了解这件事
事实说明vllm-metal 的首个正式版本 v0.28.0 发布,版本号与上游 vLLM 对齐,引入批量多令牌预测(MTP)、GGUF 与混合模型支持,以及 M5 上更快的 prefill;它通过 MLX 与 Metal 把 vLLM 的 V1 调度器、分页 KV 块管理与 OpenAI 兼容前端带到 Apple Silicon。v0.28.0 还包含 LoRA 适配器、结构化输出、三种投机解码方法(Gemma 4 MTP、独立草稿模型、prompt-lookup n-gram)、GGUF 检查点、多机流水线并行、实验性视觉语言模型/文本嵌入与重排/语音转文字,以及仍属实验性、不能与投机解码组合的混合模型 align 模式前缀缓存(PR #634);M5 上自动启用 NAX attention 内核,较早机型沿用既有路径。
报道时间线
沿着报道,了解事件的不同侧面。
- vllm-metal 发布首个正式版 v0.28.0,将 vLLM 调度器、分页 KV 与 OpenAI 兼容服务带到 Apple Silicon
vllm-metal 的首个正式版本 v0.28.0 发布,版本号与上游 vLLM 对齐,引入批量多令牌预测(MTP)、GGUF 与混合模型支持,以及 M5 上更快的 prefill;它通过 MLX 与 Metal 把 vLLM 的 V1 调度器、分页 KV 块管理与 OpenAI 兼容前端带到 Apple Silicon。v0.28.0 还包含 LoRA 适配器、结构化输出、三种投机解码方法(Gemma 4 MTP、独立草稿模型、prompt-lookup n-gram)、GGUF 检查点、多机流水线并行、实验性视觉语言模型/文本嵌入与重排/语音转文字,以及仍属实验性、不能与投机解码组合的混合模型 align 模式前缀缓存(PR #634);M5 上自动启用 NAX attention 内核,较早机型沿用既有路径。
本事件热度走势
暂无可比热度趋势,待连续观测积累后展示。