热点事件 持续更新

DeepSeek 发布 V4.1 Flash:552B MoE 非对称架构、闲时 API 价格为高峰一半,官方称将承接旧版 Flash 与 V4 Pro 请求并开放权重与技术报告

3 篇报道3 个精选信源

事件全貌

AI 综述

DeepSeek 发布 DeepSeek-V4.1-Flash,为公司宣称的新架构家族中最小模型,权重以 MIT 许可开放在 Hugging Face,并附技术报告。据官方及多方报道,其为 552B 参数 MoE(另有统计口径称总参数 763B、含 196B Engram 参数),采用新的 Causal Encoder–Decoder 架构并具原生视觉理解,上下文窗口达 1M token;处理输入时激活 8B 参数、生成输出时激活 16B 参数。训练方面,预训练覆盖 45T 多模态 token(文多模比约 7:1),稀疏注意力在 64K 序列长度从头训练,并在 34T token 处扩展至 1M 上下文。

AI 汇总报道生成 · 1小时前更新。单篇报道保留其发布时的原貌。

最新进展

最新情况详见事件全貌。

报道时间线

沿着报道,了解事件的不同侧面。

显示 3全部报道最新在前
  1. X:马东锡 NLP (@dongxi_nlp)
    DeepSeek 发布 DeepSeek-V4.1-Flash:以 CED 架构压缩 KV cache

    DeepSeek 发布 DeepSeek-V4.1-Flash,一款 552B 参数(每 token 激活 16B/预填充 8B)的多模态 MoE 模型,支持最长一百万 token 上下文。其 Causal Encoder-Decoder(CED)架构结合 CSA2 与 FP4 KV caching,将全局 KV cache 降至每 token 890 字节,约为 DeepSeek-V4-Flash 的 1/4、DeepSeek-V1 的 1/437,配合 SWA Bounded Replay 将持久 KV cache 降至约 1/8,性能仍优于基线。模型基于 45T token 多模态语料预训练,checkpoint 已在 https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash 开放。

  2. X:洪明 (@hongming731)
    BestBlogs 周刊第112期:可托付的智能

    BestBlogs 精选周刊第112期以"可托付的智能"为主题,讨论当模型能写代码、操作浏览器、拆解模糊任务后,如何让一次任务结果真正可放心交付。

  3. X:Artificial Analysis (@ArtificialAnlys)官方一手精选
    DeepSeek V4.1 Flash 发布,以 40 分超越 DeepSeek V4 Pro 0813 成为新旗舰

    Artificial Analysis 评测显示,DeepSeek V4.1 Flash 在 Intelligence Index 得分 40,超过 DeepSeek V4 Pro 0813 成为 DeepSeek 新旗舰,输入激活参数 8B、输出激活参数 16B,支持 1M token 上下文,MIT 许可。

24 HOURS

本事件热度走势

当前热度 29峰值 309月15日 04:10近24小时变化

移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。