Hugging Face宣布Transformers新增GGUF量化模型支持,经kernels库复用ggml Metal内核,初始面向Apple Silicon并支持Qwen3.5架构
先了解这件事
事实说明Hugging Face宣布Transformers库新增对GGUF量化模型的支持:用户可通过from_pretrained等标准API直接加载Hub上的GGUF检查点在本地生成(最新transformers版本暂需main分支)。为接近llama.cpp性能,团队通过kernels库复用ggml的Metal内核(量化、归一化、注意力、gated delta net及自研top-k路由内核),并对generate减少同步开销(惠及所有transformers模型);打包推理初始聚焦Apple Silicon,覆盖Qwen3.5密集与MoE架构及兼容的Qwen3.8检查点。官方在MacBook Pro M2 Max上的对比测量显示生成速度与llama.cpp接近(注明测量条件不完全相同);打包路径目前仅限MPS,填充批处理仍需改进。此前正文未给出该更新的具体日期。
报道时间线
沿着报道,了解事件的不同侧面。
- Hugging Face宣布Transformers新增GGUF量化模型支持,经kernels库复用ggml Metal内核,初始面向Apple Silicon并支持Qwen3.5架构
Hugging Face宣布Transformers库新增对GGUF量化模型的支持:用户可通过from_pretrained等标准API直接加载Hub上的GGUF检查点在本地生成(最新transformers版本暂需main分支)。为接近llama.cpp性能,团队通过kernels库复用ggml的Metal内核(量化、归一化、注意力、gated delta net及自研top-k路由内核),并对generate减少同步开销(惠及所有transformers模型);打包推理初始聚焦Apple Silicon,覆盖Qwen3.5密集与MoE架构及兼容的Qwen3.8检查点。官方在MacBook Pro M2 Max上的对比测量显示生成速度与llama.cpp接近(注明测量条件不完全相同);打包路径目前仅限MPS,填充批处理仍需改进。此前正文未给出该更新的具体日期。
本事件热度走势
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。