DeepSeek V4.1 Flash 现已在 Huggingface 开放,552B 参数 MoE 模型,采用新编码器-解码器结构与原生视觉理解
事件全貌
AI 综述DeepSeek AI 发布了其新架构家族中的最小模型 DeepSeek-V4.1-Flash。该模型是一个多模态混合专家(MoE)模型,拥有 552B 主干参数和 196B 额外的 Engram 参数,具备原生视觉理解能力。
该模型针对长上下文和高效推理进行了优化。它支持 1M token 的上下文窗口,并采用了 FP4 KV 缓存和跨层注意力复用技术,使其全局 KV 缓存占用降至每 token 约 890 字节,约为 DeepSeek-V4-Flash 的四分之一。在预训练阶段,模型使用了 45T 多模态 token,并在 34T token 处将上下文扩展至 1M。
DeepSeek-V4.1-Flash 的权重以 MIT 许可证在 Hugging Face 上开放,并提供了 vLLM、SGLang 和 Transformers 的部署路径。官方描述了一个具有低、高和最大推理层级的公开 API。根据 MarkTechPost 引用的基准测试,该模型在多项任务上表现优于 DeepSeek-V4-Flash。
AI 汇总报道生成 · 49分钟前更新。单篇报道保留其发布时的原貌。
最新情况详见事件全貌。
报道时间线
沿着报道,了解事件的不同侧面。
- DeepSeek V4.1 Flash 发布,552B 参数带原生视觉
DeepSeek 推出 V4.1 Flash,是新家族中最小模型,552B 参数并原生支持视觉。Apple 发布首款折叠屏 iPhone Duo($1,999 起,10 月 23 日发货)及 iPhone 18 Pro 系列,A20 Pro 面向端侧模型,Siri AI 语音由本地模型驱动。
- DeepSeek AI 发布 DeepSeek-V4.1-Flash:1M 上下文、FP4 KV 缓存与跨层注意力复用
DeepSeek AI 发布多模态 MoE 模型 DeepSeek-V4.1-Flash,552B 主干加 196B Engram 参数,上下文窗口 1M,prefill 激活 8B 参数、decode 激活 16B,全局 KV 缓存降至每 token 890 字节,约为 DeepSeek-V4-Flash 的 1/4、DeepSeek-V1 的 1/437。
- DeepSeek-V4.1-Flash 上架 Hugging Face:552B 参数 MoE 模型,新架构家族最小款
DeepSeek 发布 DeepSeek-V4.1-Flash 并上架 Hugging Face,为 552B 参数 MoE 模型,采用新的 Encoder-Decoder 结构、新预训练方法和更大规模强化学习后训练。