热点事件 历史事件

DeepSeek-V4.1-Flash 发布:552B MoE 多模态模型主打 KV cache 压缩

26 篇报道18 个报道来源

事件全貌

AI 综述

DeepSeek 发布 DeepSeek-V4.1-Flash,官方称其为新架构家族中最小模型,具备原生视觉理解,设计目标是更强能力、更快推理、更高吞吐并可扩展至更大模型。据 MarkTechPost 与 SemiAnalysis 等报道,该模型为 552B 骨干参数的多模态 MoE,另有 196B Engram 参数,采用 Causal Encoder–Decoder 结构,prefill 阶段每 token 激活 8B、decode 阶段激活 16B,支持 1M token 上下文;KV 缓存方面,运行时 KV 约为 V4-Flash 的 1/4、持久 KV 约为 1/8,全局 KV 缓存约 890 字节/token。权重以 MIT 许可在 Hugging Face 开放,并提供 vLLM、SGLang、Transformers 路径及公开 API。

性能与定价上,Artificial Analysis 称 V4.1 Flash 以 40 分超过 DeepSeek V4 Pro 0813 成为新旗舰,第一方 API 定价为每百万输入 token 0.30 美元、输出 1.20 美元,缓存输入 0.006 美元,闲时再打五折。Kim 等转述公司说法称 Flash 在能力、成本和速度上超过 V4-Pro,DeepSWE 得分 74.2%(V4-Flash 为 54.4%,GPT-5.6 Sol 为 73.0%),并较 V4-Flash 降价。The Decoder 指出其在编码任务上接近头部闭源模型,但在复杂科学任务和图像分析上仍有差距;Artificial Analysis 也提到其输出冗长,每任务约 89k token。

落地与迁移方面,IT之家报道该模型上线国家超算互联网中心提供 API 调用;腾讯 WorkBuddy 国际版上线并提供两周免费试用;阿里云 Token Plan 上线,起价每月 6 美元。Baseten 称 DeepSeek 已停用平台上的 V4-Flash 并将流量路由至 V4.1-Flash,V4-Pro 流量也将自 9 月 14 日起改道;X.PIN 称 V4 Pro 服务计划于北京时间 9 月 14 日中午结束,请求将路由至 V4.1 Flash 并按后者费率计费。OpenRouter 称该模型 24 小时处理 1T tokens,预计 48 小时约 2.8T,其中 90% 为缓存读取。

其他独立测试与生态进展包括:Fireworks 自测 DeepSWE 中 V4.1-Flash 以 74.34% pass@1、每任务 0.43 美元达到 GPT-6 Astra 级精度,成本低约 15 倍,99.6% 输入 token 为缓存命中;Hacker News 报道的 AI 黑客基准中,该模型攻破全部 11 个漏洞目标、四个修复目标保持安全,接受运行成本 4.65 美元;SemiAnalysis 称 AMD 公开发布其镜像,功能开箱即用,但每美元性能目前最多落后 H200 14.8 倍、B200/B300 42 倍。

AI 汇总报道生成 · 5天前更新。单篇报道保留其发布时的原貌。

最新进展

历史报道归档。当前热点以新版榜单为准。

报道时间线

沿着报道,了解事件的不同侧面。

显示 26全部报道最新在前
  1. HuggingFace Daily Papers(社区热门论文)精选
    DeepSeek-V4.1-Flash 发布:552B MoE 多模态模型主打 KV cache 压缩

    DeepSeek 发布 DeepSeek-V4.1-Flash,一个 552B 参数的多模态 MoE 模型,支持最长 100 万 token 上下文,模型权重已在 Hugging Face 开放。

  2. Hacker News 热门(buzzing.cc 中文翻译)
    DeepSeek-V4.1-Flash 技术报告解读:CED 与 CSA2 如何将 KV 缓存压缩至每 token 890 字节

    作者解读《DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression》技术报告,指出该模型虽名为 V4.1 Flash,但架构变化足以视作 V5 级迭代。

  3. Hacker News 热门(buzzing.cc 中文翻译)
    DeepSeek V4.1 Flash 以 4.65 美元拿下 Enclave AI 黑客基准 11/11,审计揭示 5 条计划外攻击路径

    Enclave AI 的 AI 黑客基准评测中,DeepSeek V4.1 Flash 攻破全部 11 个漏洞目标、4 个修复对照全部守住,接受运行成本仅 4.65 美元。后续审计确认 6 次按计划路径完成,另发现 5 条原评分系统未区分的计划外路径,团队随后关闭这些旁路并对基准加入更严格的路径校验。

  4. Fireworks AI官方一手精选
    Fireworks 上线 DeepSeek-V4.1-Flash,DeepSWE 达 GPT-6 Astra 水准、成本仅 1/15

    Fireworks 发布 DeepSeek-V4.1-Flash,在 DeepSWE 上取得 74.34% pass@1、每任务 $0.43,与 GPT-6 Astra 同一精度区间但成本仅 1/15。

  5. X:马东锡 NLP (@dongxi_nlp)
    DeepSeek 发布 DeepSeek-V4.1-Flash:以 CED 架构压缩 KV cache

    DeepSeek 发布 DeepSeek-V4.1-Flash,一款 552B 参数(每 token 激活 16B/预填充 8B)的多模态 MoE 模型,支持最长一百万 token 上下文。其 Causal Encoder-Decoder(CED)架构结合 CSA2 与 FP4 KV caching,将全局 KV cache 降至每 token 890 字节,约为 DeepSeek-V4-Flash 的 1/4、DeepSeek-V1 的 1/437,配合 SWA Bounded Replay 将持久 KV cache 降至约 1/8,性能仍优于基线。模型基于 45T token 多模态语料预训练,checkpoint 已在 https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash 开放。

  6. X:洪明 (@hongming731)
    BestBlogs 周刊第112期:可托付的智能

    BestBlogs 精选周刊第112期以"可托付的智能"为主题,讨论当模型能写代码、操作浏览器、拆解模糊任务后,如何让一次任务结果真正可放心交付。

  7. X:马东锡 NLP (@dongxi_nlp)
    LLM 为何缓存 K 和 V 却不缓存 Q

    这篇长文解释 LLM 推理中 KV cache 的原理:每生成一个 token,历史位置的 K/V 会被保留供后续位置读取,而 Q 随新位置重新产生,用完即可丢弃。

  8. X:SemiAnalysis (@SemiAnalysis_)
    CUDA 护城河警报:CUDA vLLM 支持 DeepSeek v4.1 Flash 两天后,AMD 才发布镜像

    CUDA vLLM 支持 DeepSeek v4.1 Flash 两天后,AMD 才公开发布其 DeepSeek v4.1 Flash 镜像。该镜像功能上开箱即用,但每美元性能目前比 H200 差最多 14.8 倍、比 B200/B300 差最多 42 倍。

  9. X:OpenRouter (@OpenRouter)官方一手
    OpenRouter:DeepSeek V4.1 Flash 上线 24 小时用量达 1T token

    OpenRouter 称 DeepSeek V4.1 Flash 在其平台上 24 小时内处理了 1T token,预计 48 小时约 2.8T,将成付费模型发布中最大的 48 小时。其中 90% 为缓存读取,市场定价约 $0.006/M,比 GLM-5.3 Flash 等同类模型便宜 5 倍。

  10. 公众号:卡尔的AI沃茨精选
    实测 DeepSeek V4.1 Flash:价格大降、原生带视觉,作者用游戏与城市生成任务验证表现

    作者实测 DeepSeek V4.1 Flash,缓存命中输入降价 7 倍多、输出砍三分之二,9 月 14 日中午 12 点起所有发往 v4-pro 的请求将被强制路由到 4.1 Flash 并按其低价计费。

  11. X:洪明 (@hongming731)
    BestBlogs 早报 · 09-11:DeepSeek V4.1 Flash / 预训练效率 / Shopify 原生化 / KV Cache 成本 / 缩放律验证

    DeepSeek V4.1 Flash 以非对称结构压缩输入侧激活与 KV Cache 需求,并给出多模态、强化学习后训练、API 迁移与峰谷定价信息。Cognition 的 SWE-2 在 FrontierCode 1.1 Main 达 50.0%,成本降低 64%。Shopify 转向 Swift 和 Kotlin 原生开发,Magic 团队实现超 10x 预训练效率提升。

  12. X:Artificial Analysis (@ArtificialAnlys)官方一手精选
    DeepSeek V4.1 Flash 发布,以 40 分超越 DeepSeek V4 Pro 0813 成为新旗舰

    Artificial Analysis 评测显示,DeepSeek V4.1 Flash 在 Intelligence Index 得分 40,超过 DeepSeek V4 Pro 0813 成为 DeepSeek 新旗舰,输入激活参数 8B、输出激活参数 16B,支持 1M token 上下文,MIT 许可。

  13. X:Yuchen Jin (@Yuchenj_UW)
    DeepSeek V4.1 Flash 在编码与智能体基准上超越 GPT-5.6 Sol,价格便宜约 97%

    DeepSeek V4.1 Flash 在编码和智能体基准上超过 GPT-5.6 Sol,价格便宜约 97%。作者称其每 token 的 KV cache 大小再降 4 倍,并表示这是开源 AI 的时代,Databricks 将很快把该模型带给客户。

  14. X:Tencent WorkBuddy (@WorkBuddy_AI)官方一手
    DeepSeek V4.1-Flash 上线 WorkBuddy

    @deepseek_ai DeepSeek V4.1-Flash 现已上线 WorkBuddy! 国际版免费试用 2 周。 立即体验:https://workbuddy.ai

  15. X:Tencent WorkBuddy (@WorkBuddy_AI)官方一手精选
    WorkBuddy 上线 DeepSeek V4.1-Flash,免费试用两周

    WorkBuddy 宣布 DeepSeek V4.1-Flash 已在其平台上线,免费试用两周。引用的 DeepSeek 公告称 V4.1-Flash 已登陆 DeepSeek API 并支持原生多模态。

  16. X:马东锡 NLP (@dongxi_nlp)
    DeepSeek-V4.1-Flash 的 KV Cache 压缩

    极致的压榨 KV Cache Compression DeepSeek-V4.1-Flash 的 Causal Encoder–Decoder 改变了什么? 在常规 Transformer 中,各层根据进入本层的 hidden states,生成自己的 K 和 V。DeepSeek-V4.1-Flash 的 Causal Encoder–Decoder 调整了这一依赖关系:decoder 的 global KV 直接由 causal encoder 的最终输出生成。 因此,构建 decoder 的 global KV,无需让整段 prompt 经过所有 decoder 层。这为减少 prefill,也就是生成回答前的输入处理计算,提供了基础。

  17. The Decoder:AI News精选
    DeepSeek 发布 V4.1-Flash,大幅降低 AI Agent 的 KV cache 内存需求

    DeepSeek 发布多模态模型 V4.1-Flash,以 MIT 许可开源在 Hugging Face,目标是大幅压缩 KV cache 和长上下文处理成本。

  18. X:SemiAnalysis (@SemiAnalysis_)
    DeepSeek 发布 DeepSeek-V4.1-Flash,552B 骨干激活仅 8B-16B 参数

    DeepSeek 发布 DeepSeek-V4.1-Flash,采用 552B 骨干的因果编码器-解码器架构,prefill 激活 8B 参数、decode 激活 16B 参数。模型通过稀疏查找访问 196B Engram 记忆,并借助 bounded replay 使持久 KV 缓存比 V4-Flash 少约 8 倍。

  19. IT之家
    DeepSeek V4.1 Flash 模型上线国家超算互联网

    DeepSeek V4.1 Flash 模型 9 月 10 日上线国家超算互联网中心,用户可在官网「模型服务」页面调用其 API。该模型为 552B 参数 MoE 模型,采用 Causal-Encoder-Decoder 结构,输入激活 8B、输出激活 16B;基准测试中超越了包括 DeepSeek V4 Pro 在内的旗舰模型。

  20. X:Thomas Wolf(Hugging Face 联创/CSO) (@Thom_Wolf)
    DeepSeek V4.1 Flash 发布,重回开源模型榜首

    Thomas Wolf 称 DeepSeek V4.1 Flash 重回开源模型榜首且价格极低,并制作视频展示模型推理时前向传播的内部过程。技术报告见 https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf,权重已发布在 https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash。

  21. X:Thomas Wolf(Hugging Face 联创/CSO) (@Thom_Wolf)
    DeepSeek-V4.1-Flash 发布,Thomas Wolf 称其或是重大更新

    DeepSeek 发布 DeepSeek-V4.1-Flash,称其为新架构家族中最小模型,具备原生视觉理解,面向更快推理、更高吞吐和扩展到更大模型而设计。

  22. X:Testing Catalog (@testingcatalog)
    DeepSeek V4.1 Flash 发布,552B 参数带原生视觉

    DeepSeek 推出 V4.1 Flash,是新家族中最小模型,552B 参数并原生支持视觉。Apple 发布首款折叠屏 iPhone Duo($1,999 起,10 月 23 日发货)及 iPhone 18 Pro 系列,A20 Pro 面向端侧模型,Siri AI 语音由本地模型驱动。

  23. MarkTechPost精选
    DeepSeek AI 发布 DeepSeek-V4.1-Flash:1M 上下文、FP4 KV 缓存与跨层注意力复用

    DeepSeek AI 发布多模态 MoE 模型 DeepSeek-V4.1-Flash,552B 主干加 196B Engram 参数,上下文窗口 1M,prefill 激活 8B 参数、decode 激活 16B,全局 KV 缓存降至每 token 890 字节,约为 DeepSeek-V4-Flash 的 1/4、DeepSeek-V1 的 1/437。

  24. X:Testing Catalog (@testingcatalog)
    DeepSeek-V4.1-Flash 上架 Hugging Face:552B 参数 MoE 模型,新架构家族最小款

    DeepSeek 发布 DeepSeek-V4.1-Flash 并上架 Hugging Face,为 552B 参数 MoE 模型,采用新的 Encoder-Decoder 结构、新预训练方法和更大规模强化学习后训练。

  25. X:Tianyi Cui(@tianyi)
    DeepSeek Harness v0.1.5 发布,与 V4.1 Flash 深度结合

    DeepSeek Harness v0.1.5 发布,新版本与 DeepSeek V4.1 Flash 模型训练深度结合,模型在 Harness 的不同配置中均做了专项训练和优化。同时推出实验性的 Agent Teams 功能,主打“一切皆插件”,团队仍在开放招聘。