正文 · AI 翻译
Qwen3.8-Flash 现在可以在本地运行了!🔥
这个 125B 的 MoE 模型表现超过了 Claude-Opus-4.6(Max)。
通过 Unsloth GGUF 在 75GB 内存上运行。
Qwen3.8-Flash-Next 让 CPU 内存 / 统一内存配置也能达到接近 VRAM 的速度。
指南:https://unsloth.ai/docs/models/qwen3.8-next GGUF:https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF
⚡认识一下 Qwen3.8-Flash,一个多模态 MoE,也是 Qwen4 架构的早期预览版,现已开放权重! 正式版 Qwen3.8-Flash 即将通过 QwenCloud API 上线,输入仅 $ 0.16/1M tokens,输出 $ 0.47/1M tokens。 125B 参数 + 51B N-gram 嵌...