Unsloth AI · @UnslothAI · X·2026-08-26 23:45·17天前
AI 导读

Unsloth 推出 Qwen3.8-Flash-Next 的 GGUF 量化版本,称该 125B MoE 多模态模型性能超过 Claude-Opus-4.6 (Max),可在 75GB RAM 上本地运行,无需 GPU VRAM。

Unsloth AI@UnslothAI
精选
81AI 编辑部评分,满分 100
2026-08-26 23:45· 17天前
AI 导读

Unsloth 推出 Qwen3.8-Flash-Next 的 GGUF 量化版本,称该 125B MoE 多模态模型性能超过 Claude-Opus-4.6 (Max),可在 75GB RAM 上本地运行,无需 GPU VRAM。

推荐理由

原文给出了本地运行所需的内存档位与量化精度权衡,读者可据此判断自己的设备能否跑动这个 MoE 模型。

正文 · AI 翻译

Qwen3.8-Flash 现在可以在本地运行了!🔥

这个 125B 的 MoE 模型表现超过了 Claude-Opus-4.6(Max)。

通过 Unsloth GGUF 在 75GB 内存上运行。

Qwen3.8-Flash-Next 让 CPU 内存 / 统一内存配置也能达到接近 VRAM 的速度。

指南:https://unsloth.ai/docs/models/qwen3.8-next GGUF:https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF

Qwen⚡认识一下 Qwen3.8-Flash,一个多模态 MoE,也是 Qwen4 架构的早期预览版,现已开放权重! 正式版 Qwen3.8-Flash 即将通过 QwenCloud API 上线,输入仅 $ 0.16/1M tokens,输出 $ 0.47/1M tokens。 125B 参数 + 51B N-gram 嵌...