# DeepSeek-V4.1-Flash 发布：552B MoE 多模态模型主打 KV cache 压缩

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-09-17 08:00
- AIHOT 分数：85
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cmu6ds2t00kqarofjrwmdwjyh
- 原文链接：https://arxiv.org/abs/2609.19969

## 精选理由

论文给出了每 token KV cache 字节数等具体压缩指标，并与上一代模型直接对比，可评估长上下文 Agent 部署成本变化。

## AI 摘要

DeepSeek 发布 DeepSeek-V4.1-Flash，一个 552B 参数的多模态 MoE 模型，支持最长 100 万 token 上下文，模型权重已在 Hugging Face 开放。

## 正文

长时程智能体的广泛采用，使模型工作负载日益呈现输入密集型特征。尽管此前的工作已大幅降低了长上下文计算的成本，但预填充的计算开销依然高昂，而庞大的 KV cache 也持续对 HBM 和 SSD 容量以及数据传输带宽造成压力。这些计算、存储和带宽需求共同构成了进一步降低部署成本的主要瓶颈。为应对这一挑战，我们推出 DeepSeek-V4.1-Flash，这是一款多模态混合专家（MoE）模型，拥有 552B 骨干参数，并支持长达一百万个 token 的上下文。凭借其因果编码器-解码器（CED）架构，该模型在解码阶段每个 token 激活 16B 参数，而在预填充阶段仅激活 8B 参数，大幅提升了智能体工作负载的成本效率。为突破 KV cache 压缩的极限，DeepSeek-V4.1-Flash 将压缩稀疏注意力 2（CSA2）中的跨层 KV cache 复用与 FP4 KV 缓存相结合。这些设计将其全局 KV cache 占用（始终位于 HBM 中）降至每 token 890 字节，约为 DeepSeek-V4-Flash 相应占用的 1/4。此外，通过一项名为 SWA Bounded Replay 的专用部署优化，DeepSeek-V4.1-Flash 将其持久化 KV cache 占用（始终位于 SSD 或主机内存中）降至 DeepSeek-V4-Flash 的约 1/8。尽管 KV cache 占用大幅缩小，该模型的性能仍显著优于基线。此外，我们精简了 DeepSeek-V4 架构，并引入了若干高效的架构扩展。我们在包含 45T token 的多模态语料上对 DeepSeek-V4.1-Flash 进行预训练，并开展了全面的后训练，使其在多样化的纯文本和多模态智能体场景中均展现出强劲性能。模型检查点可在 https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash 获取。
