正文 · AI 翻译
Qwen3.8-Flash 现在借助 MTP 在本地运行速度提升 1.7 倍!⚡️
GGUF 在 RTX PRO 6000 上可达 170 tokens/s。
MTP 让 Qwen3.8-Flash-Next 的推理速度提升约 1.3-1.7 倍,且精度不变。
GGUF:https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF 指南:https://unsloth.ai/docs/models/qwen3.8-next
Qwen3.8-Flash 现在可以在本地运行了!🔥 这个 125B 的 MoE 模型表现超过了 Claude-Opus-4.6(Max)。 通过 Unsloth GGUF 在 75GB 内存上运行。 Qwen3.8-Flash-Next 让 CPU 内存 / 统一内存配置也能达到接近 VRAM 的速度。 指南:ht...