# DeepSeek 发布 V4.1-Flash，大幅降低 AI Agent 的 KV cache 内存需求

- 来源：The Decoder：AI News（RSS）
- 作者：Jonathan Kemper
- 发布时间：2026-09-10 20:40
- AIHOT 分数：79
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cmtvj9kae0aq1ronbfyxuewfb
- 原文链接：https://the-decoder.com/new-deepseek-model-v4-1-flash-cuts-memory-needs-for-ai-agents

## 精选理由

文章梳理了 V4.1-Flash 压缩 KV cache 和输入算力的具体做法，读者可以评估它在长上下文 Agent 部署成本上的实际收益。

## AI 摘要

DeepSeek 发布多模态模型 V4.1-Flash，以 MIT 许可开源在 Hugging Face，目标是大幅压缩 KV cache 和长上下文处理成本。

## 正文

要点

DeepSeek 发布了其新 AI 模型 V4.1-Flash。该模型通过大幅缩小任务所需的缓冲区，显著降低了处理长文本的运行成本。

该模型还将数据输入所需的算力减半。它通过一种技术性拆分实现了这一点，即为读取信息激活的算力少于后续生成文本时所用的算力。

在编程任务上，这款免费开放的模型可与 OpenAI 和 Anthropic 的顶级闭源模型相媲美。但该系统在复杂科学任务和图像分析方面仍显薄弱。

Deepseek 的新多模态模型主要旨在降低长上下文的运行成本。最大的收益在于内存占用，不过 Deepseek 也承诺模型性能会更好。

根据技术报告，Deepseek 对 V4.1-Flash 有着明确的目标：缩小所谓的 KV cache。这一缓冲区保存了模型已处理过的上下文部分，从而无需在每个新步骤中重新计算全部内容。对于需要跨多步工作的智能体而言，它会迅速增长，并对 GPU 内存、SSD 和数据带宽造成压力。这推高了部署成本。

其核心语言模型拥有 5520 亿参数，可处理最长 100 万 token 的上下文。该公司表示，快速 GPU 内存中的缓冲区现在所需空间仅为其前代 Deepseek-V4-Flash 的大约四分之一。永久卸载的部分——存放在 SSD 或主机内存中——则缩减到大约八分之一。与 Deepseek-V1 相比，每 token 的全局 KV cache 大小下降了 437 倍。

自 V1 以来，Deepseek 大幅缩减了全局 KV cache。| 图片：Deepseek

输入端计算量更少

Deepseek 通过多项协同工作的技术实现了这一点。其中一项核心技术将模型一分为二。第一部分处理传入数据，第二部分则基于这些结果进行运算，而非重新计算全部内容。在读取输入时，模型每个 token 仅激活 80 亿参数，但在实际文本输出阶段则激活 160 亿参数。

V4.1-Flash 将语言主干拆分为编码器和解码器。| 图片：Deepseek

Deepseek 表示，这几乎将处理输入所需的计算量减半。该设计明确针对 AI 智能体，因为智能体会通过频繁的工具调用不断处理新输入。Deepseek 还将主 KV cache 以 FP4 而非 FP8 存储。根据报告，这几乎将这部分 cache 的内存占用减半。

该模型从零开始训练，数据集包含 45 万亿 token，覆盖文本和图像。在后训练阶段，Deepseek 有意跳过了新方法。该公司表示，主要收益并非来自新算法，而是来自更大、控制更好的数据、任务和训练环境。Deepseek 认为，在现阶段，这种规模扩展比算法层面的调整更有帮助。

随着 RL 训练的增多，多个代码智能体基准上的表现均有提升。| 图片：Deepseek

但 Deepseek 也发现，训练出的智能体有时会试图钻奖励系统的空子，另一些情况下则会意外导致测试环境崩溃。它们有时会利用近期披露的安全漏洞，或删除关键系统文件。

即便在编码基准上面对 Opus 5 和 GPT-5.6 Sol

尽管活跃参数占比相对较小，Deepseek 报告称其在多个基准上接近领先模型。在智能体基准上，它有时能比肩顶级闭源模型。在软件测试 DeepSWE v1.1 上，它以 74.2% 的成绩险胜 Anthropic 的 Opus 5 和 OpenAI 的 GPT-5.6 Sol 等模型，而在 ProgramBench 上则大幅落后。

在需要专家知识的科学类高难度智能体任务上，与超大型模型之间仍存在明显差距。技术报告也承认，在读取复杂图像方面，与领先闭源系统之间存在可测量的差距。

与其他许多推理模型一样，其“思考深度”可以设置。用户通过一个单一数值控制模型思考的彻底程度，在计算成本与准确率之间进行权衡。据报道，最高设置能显著提升多个基准测试的结果，但生成的输出 token 数量约为原来的 2.5 倍。

更高的推理投入能改善结果，但会增加 token 消耗。| 图片：Deepseek

Deepseek 以开放的 MIT 许可证在 Hugging Face 上提供该模型文件，旨在作为进一步开发更廉价 AI 智能体的起点。它也可通过 API 获取，价格与 V4-Flash 相同。

Deepseek 直到 7 月下旬才通过 0731 更新大幅改进了前代 V4-Flash。该模型拥有 2840 亿参数，其中 130 亿为激活参数，在 Artificial Analysis Intelligence Index 上仅落后 OpenAI 的 GPT-5.6 Luna 一分，且每任务成本约低 60%。8 月中旬，Deepseek 将其旗舰 V4-Pro 结束测试，并同时上调了 API 价格。缓存命中，即已缓冲的输入，价格上涨了六倍。据台湾安全公司 TeamT5 称，自中国黑客组织开始将 Deepseek 用于漏洞利用代码和网络扫描等用途以来，其攻击次数已增加一倍以上。

6 月，Deepseek 在首轮外部融资中筹集了约 74 亿美元，估值超过 500 亿美元；据路透社报道，该公司现已聘请中国投资银行中信证券，筹备在中国进行 IPO。
