DeepSeek 发布 V4.1 Flash:552B MoE 非对称架构、闲时 API 价格为高峰一半,官方称将承接旧版 Flash 与 V4 Pro 请求并开放权重与技术报告
事件全貌
AI 综述DeepSeek 发布 DeepSeek-V4.1-Flash,为公司宣称的新架构家族中最小模型,权重以 MIT 许可开放在 Hugging Face,并附技术报告。据官方及多方报道,其为 552B 参数 MoE(另有统计口径称总参数 763B、含 196B Engram 参数),采用新的 Causal Encoder–Decoder 架构并具原生视觉理解,上下文窗口达 1M token;处理输入时激活 8B 参数、生成输出时激活 16B 参数。训练方面,预训练覆盖 45T 多模态 token(文多模比约 7:1),稀疏注意力在 64K 序列长度从头训练,并在 34T token 处扩展至 1M 上下文。
AI 汇总报道生成 · 1小时前更新。单篇报道保留其发布时的原貌。
最新情况详见事件全貌。
报道时间线
沿着报道,了解事件的不同侧面。
- DeepSeek 发布 DeepSeek-V4.1-Flash:以 CED 架构压缩 KV cache
DeepSeek 发布 DeepSeek-V4.1-Flash,一款 552B 参数(每 token 激活 16B/预填充 8B)的多模态 MoE 模型,支持最长一百万 token 上下文。其 Causal Encoder-Decoder(CED)架构结合 CSA2 与 FP4 KV caching,将全局 KV cache 降至每 token 890 字节,约为 DeepSeek-V4-Flash 的 1/4、DeepSeek-V1 的 1/437,配合 SWA Bounded Replay 将持久 KV cache 降至约 1/8,性能仍优于基线。模型基于 45T token 多模态语料预训练,checkpoint 已在 https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash 开放。
- BestBlogs 周刊第112期:可托付的智能
BestBlogs 精选周刊第112期以"可托付的智能"为主题,讨论当模型能写代码、操作浏览器、拆解模糊任务后,如何让一次任务结果真正可放心交付。
- DeepSeek V4.1 Flash 发布,以 40 分超越 DeepSeek V4 Pro 0813 成为新旗舰
Artificial Analysis 评测显示,DeepSeek V4.1 Flash 在 Intelligence Index 得分 40,超过 DeepSeek V4 Pro 0813 成为 DeepSeek 新旗舰,输入激活参数 8B、输出激活参数 16B,支持 1M token 上下文,MIT 许可。
本事件热度走势
移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。