Liquid AI 发布 LFM2.5 系列 QAD Q4_0 量化检查点,恢复 97% 精度损失

Hugging Face:Blog(RSS)·2026-08-19 21:48·32天前
AI 导读

Liquid AI 发布基于量化感知蒸馏(QAD)训练的 LFM2.5-230M、350M、1.2B-Instruct 和 2.6B 四款 Q4_0 GGUF 检查点,在保持原生 Q4_0 内存与速度的同时,恢复 BF16 平均精度损失的 97%。

Hugging Face:Blog(RSS)
精选
64AI 编辑部评分,满分 100

Liquid AI 发布 LFM2.5 系列 QAD Q4_0 量化检查点,恢复 97% 精度损失

2026-08-19 21:48· 32天前
AI 导读

Liquid AI 发布基于量化感知蒸馏(QAD)训练的 LFM2.5-230M、350M、1.2B-Instruct 和 2.6B 四款 Q4_0 GGUF 检查点,在保持原生 Q4_0 内存与速度的同时,恢复 BF16 平均精度损失的 97%。

推荐理由

QAD 量化蒸馏恢复 Q4_0 模型九成六以上 BF16 精度,对应树莓派和手机等边缘设备,在保持低内存与高吞吐的同时缩小与全精度模型的差距。

正文 · AI 翻译

今天,我们发布 QAD Q4_0 GGUF。这些是 LFM2.5-230M、LFM2.5-350M、LFM2.5-1.2B-Instruct 和 LFM2.5-2.6B 的更新版 4-bit checkpoint。它们让开发者能够在 Q4_0 的内存占用和速度下运行 LFM2.5 模型,而不必承受通常的质量下降:

  • 采用量化感知蒸馏(QAD)训练:将高精度教师模型蒸馏到量化学生模型中
  • 与原生 Q4_0 相同的内存占用和速度:它们保留了 Q4_0 GGUF 的低内存占用和高吞吐量
  • 恢复程度:量化所损失的 BF16 平均准确率恢复了 97%

基准测试结果

对于全部四个模型,我们在涵盖推理、指令遵循、工具使用和智能体能力的基准套件上,将采用训练后量化(PTQ)生成的已发布 GGUF 与经过训练的 QAD Q4_0 checkpoint 进行对比:GPQA Diamond、MMLU-Pro、IFEval、IFBench、Multi-IF 和 BFCLv4。

BF16 GGUF 作为同格式下的上限。我们还加入了一项与规模相称的数学评测:LFM2.5-230M 和 LFM2.5-350M 使用 GSM8K,LFM2.5-1.2B-Instruct 和 LFM2.5-2.6B 使用 AIME25。

我们报告五次重复的平均值。

Image 5: lfm25_gguf_eval_scores_2x2_liquid

在全部四个模型中,QAD 大幅提升了 Q4_0 checkpoint。QAD checkpoint 分别保留了各自 BF16 基线性能的 97.1%、96.5%、97.4% 和 96.6%。

真实边缘硬件上的速度与体积

我们测量了四款模型 LFM2.5-230M、LFM2.5-350M、LFM2.5-1.2B-Instruct 和 LFM2.5-2.6B 在四个目标平台上的解码吞吐量:MacBook Pro、NucBox EVO-X2、Samsung Galaxy S26 Ultra 和 Raspberry Pi 5。

MacBook Pro 和 NucBox 使用 GPU 推理,而 Samsung 和 Raspberry Pi 使用 Arm CPU 推理。在进行了性能分析的情况下,BF16 和 F16 作为全精度参考一并展示。

Image 6: lfm25_230m_decode_throughput_4panel_liquid

Image 7: lfm25_350m_decode_throughput_4panel_liquid

Image 8: lfm25_1p2b_decode_throughput_4panel_liquid

Image 9: lfm25_2p6b_decode_throughput_3panel_liquid

230M 和 350M 的 QAD Q4_0 checkpoint 在评估方差范围内达到了与 Q5_K_M 相当的质量,同时解码吞吐量高出 4-33%。1.2B 和 2.6B 的 QAD Q4_0 checkpoint 达到了与 Q4_K_M 相当的质量,吞吐量高出 3-14%。

QAD Q4_0 checkpoint 在适用情况下(即 230M 和 1.2B)也达到了与 Unsloth 的 UD-Q4_K_XL 相当的水平,后者是一个强大的外部训练后量化 checkpoint。

如何使用 QAD GGUF

将这些文件与 llama.cpp 或任何支持 GGUF Q4_0 产物的运行时配合使用。

llama-cli -hf LiquidAI/LFM2.5-350M \
  --hf-file LFM2.5-350M-QAD-Q4_0.gguf \
  -p "What is C. elegans?"

开始使用 QAD GGUF

QAD GGUF 现已在 Hugging Face 上线:LFM2.5-230MLFM2.5-350MLFM2.5-1.2B-InstructLFM2.5-2.6B

我们迫不及待想看到你构建的作品。

引用

如需引用,请使用以下参考文献或 BibTeX:

Liquid AI, "LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment", Liquid AI Blog, Aug 2026.

或使用 BibTeX 引用

@article{liquidAI2026Q40,
  author = {Liquid AI},
  title = {LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment},
  journal = {Liquid AI Blog},
  year = {2026},
  note = {www.liquid.ai/blog/qad},
}

来源:Hugging Face:Blog(RSS)· huggingface.co