作者使用后实测 DeepSeek-V4.1-Flash 速度接近 420 Tokens/s
事件全貌
AI 综述DeepSeek 发布 DeepSeek-V4.1-Flash,官方称其为新架构家族中最小模型,具备原生视觉理解,设计目标是更强能力、更快推理、更高吞吐并可扩展至更大模型。据 MarkTechPost 与 SemiAnalysis 等报道,该模型为 552B 骨干参数的多模态 MoE,另有 196B Engram 参数,采用 Causal Encoder–Decoder 结构,prefill 阶段每 token 激活 8B、decode 阶段激活 16B,支持 1M token 上下文;KV 缓存方面,运行时 KV 约为 V4-Flash 的 1/4、持久 KV 约为 1/8,全局 KV 缓存约 890 字节/token。权重以 MIT 许可在 Hugging Face 开放,并提供 vLLM、SGLang、Transformers 路径及公开 API。
性能与定价上,Artificial Analysis 称 V4.1 Flash 以 40 分超过 DeepSeek V4 Pro 0813 成为新旗舰,第一方 API 定价为每百万输入 token 0.30 美元、输出 1.20 美元,缓存输入 0.006 美元,闲时再打五折。Kim 等转述公司说法称 Flash 在能力、成本和速度上超过 V4-Pro,DeepSWE 得分 74.2%(V4-Flash 为 54.4%,GPT-5.6 Sol 为 73.0%),并较 V4-Flash 降价。The Decoder 指出其在编码任务上接近头部闭源模型,但在复杂科学任务和图像分析上仍有差距;Artificial Analysis 也提到其输出冗长,每任务约 89k token。
落地与迁移方面,IT之家报道该模型上线国家超算互联网中心提供 API 调用;腾讯 WorkBuddy 国际版上线并提供两周免费试用;阿里云 Token Plan 上线,起价每月 6 美元。Baseten 称 DeepSeek 已停用平台上的 V4-Flash 并将流量路由至 V4.1-Flash,V4-Pro 流量也将自 9 月 14 日起改道;X.PIN 称 V4 Pro 服务计划于北京时间 9 月 14 日中午结束,请求将路由至 V4.1 Flash 并按后者费率计费。OpenRouter 称该模型 24 小时处理 1T tokens,预计 48 小时约 2.8T,其中 90% 为缓存读取。
其他独立测试与生态进展包括:Fireworks 自测 DeepSWE 中 V4.1-Flash 以 74.34% pass@1、每任务 0.43 美元达到 GPT-6 Astra 级精度,成本低约 15 倍,99.6% 输入 token 为缓存命中;Hacker News 报道的 AI 黑客基准中,该模型攻破全部 11 个漏洞目标、四个修复目标保持安全,接受运行成本 4.65 美元;SemiAnalysis 称 AMD 公开发布其镜像,功能开箱即用,但每美元性能目前最多落后 H200 14.8 倍、B200/B300 42 倍。
AI 汇总报道生成 · 1小时前更新。单篇报道保留其发布时的原貌。
最新情况详见事件全貌。
报道时间线
沿着报道,了解事件的不同侧面。
- DeepSeek-V4.1-Flash 发布:552B MoE 多模态模型主打 KV cache 压缩
DeepSeek 发布 DeepSeek-V4.1-Flash,一个 552B 参数的多模态 MoE 模型,支持最长 100 万 token 上下文,模型权重已在 Hugging Face 开放。
- DeepSeek-V4.1-Flash 技术报告解读:CED 与 CSA2 如何将 KV 缓存压缩至每 token 890 字节
作者解读《DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression》技术报告,指出该模型虽名为 V4.1 Flash,但架构变化足以视作 V5 级迭代。