正文 · AI 翻译
DeepSeek 刚刚发布了 V4.1-Flash,采用全新架构,距离其 7 月的 V4-Flash 更新仅过去六周。
7 月的版本改进了后训练,但架构保持不变。(GLM-5.3/Flash 也是如此。)V4.1 引入了因果编码器-解码器(Causal Encoder-Decoder)架构,具备原生视觉理解能力。
DeepSeek 报告称: - 552B MoE 参数,输入处理时激活 8B,输出生成时激活 16B。 - 相比上一代,KV-cache 需求降至 HBM 的 1⁄4、SSD 存储的 1⁄8。 - API 价格更低。
在短短几周内,仅凭后训练就实现了这些*显著*的跃升。
这就是我们必须适应的新现实:每周发布,且带来显著改进。
该公司表示,Flash 目前在能力、成本和速度上均已超越 V4-Pro。自 9 月 14 日起,V4-Pro 的 API 请求将暂时路由至 V4.1-Flash,直至 V4.1-Pro 推出。
🚀 推出 DeepSeek-V4.1-Flash:更智能、更快速、更高效。 🔹 推出我们全新架构家族中规模最小的模型,具备原生视觉理解能力。 🔹 专为更强的能力、更快的推理、更高的吞吐量而设计,并可扩展至更大的模型。 1/6