热点事件 观察中

Hugging Face宣布Transformers新增GGUF量化模型支持,经kernels库复用ggml Metal内核,初始面向Apple Silicon并支持Qwen3.5架构

1 篇报道1 个报道来源

先了解这件事

事实说明

Hugging Face宣布Transformers库新增对GGUF量化模型的支持:用户可通过from_pretrained等标准API直接加载Hub上的GGUF检查点在本地生成(最新transformers版本暂需main分支)。为接近llama.cpp性能,团队通过kernels库复用ggml的Metal内核(量化、归一化、注意力、gated delta net及自研top-k路由内核),并对generate减少同步开销(惠及所有transformers模型);打包推理初始聚焦Apple Silicon,覆盖Qwen3.5密集与MoE架构及兼容的Qwen3.8检查点。官方在MacBook Pro M2 Max上的对比测量显示生成速度与llama.cpp接近(注明测量条件不完全相同);打包路径目前仅限MPS,填充批处理仍需改进。此前正文未给出该更新的具体日期。

报道时间线

沿着报道,了解事件的不同侧面。

显示 1全部报道最新在前
  1. Hugging Face:Blog官方一手精选
    Hugging Face宣布Transformers新增GGUF量化模型支持,经kernels库复用ggml Metal内核,初始面向Apple Silicon并支持Qwen3.5架构

    Hugging Face宣布Transformers库新增对GGUF量化模型的支持:用户可通过from_pretrained等标准API直接加载Hub上的GGUF检查点在本地生成(最新transformers版本暂需main分支)。为接近llama.cpp性能,团队通过kernels库复用ggml的Metal内核(量化、归一化、注意力、gated delta net及自研top-k路由内核),并对generate减少同步开销(惠及所有transformers模型);打包推理初始聚焦Apple Silicon,覆盖Qwen3.5密集与MoE架构及兼容的Qwen3.8检查点。官方在MacBook Pro M2 Max上的对比测量显示生成速度与llama.cpp接近(注明测量条件不完全相同);打包路径目前仅限MPS,填充批处理仍需改进。此前正文未给出该更新的具体日期。

24 HOURS

本事件热度走势

当前热度 7可比范围峰值 79月22日 20:00近24小时可比范围变化

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。