热点事件 持续更新

Fireworks 自测 DeepSWE:DeepSeek-V4.1-Flash 以 74.34% pass@1、每任务 $0.43 达到 GPT-6 Astra 同级准确率,成本低约 15 倍

1 篇报道1 个精选信源

事件全貌

AI 综述

DeepSeek 发布 DeepSeek-V4.1-Flash。据 DeepSeek 官方账号,这是其新架构家族中最小、具备原生视觉理解的模型,面向更强能力、更快推理、更高吞吐并支持向更大模型扩展。Testing Catalog 称其已在 Huggingface 开放,为 552B 参数 MoE 模型,采用新的编码器-解码器结构,并称其采用新预训练方法、经历更大规模强化学习后训练。MarkTechPost 报道其具备 1M 上下文、FP4 KV 缓存与跨层注意力复用,权重以 MIT 许可开放,提供 vLLM、SGLang、Transformers 路径,并描述有低、高、最高三档推理的公开 API。

技术细节方面,MarkTechPost 称该模型为多模态 MoE,552B 骨干参数、另有 196B Engram 参数,1M token 上下文,prefill 每 token 激活 8B、decode 激活 16B,全局 KV 缓存每 token 890 字节,约为 DeepSeek-V4-Flash 的 1/4、比 DeepSeek-V1 小约 437 倍;预训练覆盖 45T 多模态 token,文本与多模态比例 7:1。SemiAnalysis 称其 552B 骨干为因果编码器-解码器,196B Engram 记忆经稀疏查找访问,持久 KV 较 V4-Flash 减少约 8 倍。马东锡 NLP 解释其 Causal Encoder–Decoder 让 decoder 的 global KV 直接由 causal encoder 最终输出生成,从而无需整段 prompt 经过所有 decoder 层,为减少 prefill 计算提供基础;并称第 21 层利用 encoder output 生成一份 decoder global KV bank 供第 21–40 层使用。The Decoder 报道称其将主 KV 缓存存为 FP4 而非 FP8,输入计算近乎减半,HBM 缓存需求约为前代四分之一、常驻 SSD 或主机内存部分约为八分之一。

性能与价格方面,Artificial Analysis 称 V4.1 Flash 以 40 分超过 DeepSeek V4 Pro 0813 成为 DeepSeek 新旗舰,552B 参数下性能超过 1.6T 的 Pro 模型且每 token 成本约低 4 倍,但因输出冗长略低于智能-成本帕累托前沿;其第一方 API 定价为每 1M 输入 token 0.30 美元、每 1M 输出 token 1.20 美元,缓存命中输入每 1M 仅 0.006 美元(98% 折扣),闲时再打五折。Kim 称公司表示 Flash 在能力、成本和速度上超过 V4-Pro,并称自 9 月 14 日起 V4-Pro API 请求将临时路由至 V4.1-Flash,直至 V4.1-Pro 到来;X.PIN 称 V4 Pro 服务计划于北京时间 9 月 14 日中午结束,请求将路由至 V4.1 Flash 并按后者费率计费;Baseten 称 DeepSeek 已停用其平台上的 V4-Flash 模型并将流量路由至 V4.1-Flash,V4-Pro 流量也将自 9 月 14 日起改道。Kim 另称据 DeepSeek 自测,其在 DeepSWE 得 74.2%,高于 GPT-5.6 Sol 的 73.0%,并较 V4-Flash 降价:新输入 32%、缓存输入 57%、输出 9%。The Decoder 则指出其在 ProgramBench 上明显落后,在需要专家知识的科学智能体任务上与超大模型仍有明显差距,技术报告也承认在读取复杂图像上与领先闭源系统存在可测量差距。

后续独立进展方面,Fireworks 称上周发布 DeepSeek-V4.1-Flash,经其全套基准测试后在质量、速度、成本权衡上设定新帕累托前沿,现可经其无服务器或专用 API 使用,美国托管端点与训练支持即将推出;其自测 DeepSWE 中 V4.1-Flash 以 74.34% pass@1、每任务 0.43 美元达到 GPT-6 Astra 同级准确率,成本低约 15 倍;Terminal-Bench 2.1 准确率 86.5%,落后 GPT-6 Astra 1 分但综合成本低 12 倍;HLE 单独得 34.52%,落后 GPT-6 Astra 的 50.40%,二者 oracle router 组合上界达 54.80%。SemiAnalysis 称在 CUDA vLLM 支持 DeepSeek v4.1 Flash 两天后,AMD 才公开发布其 DeepSeek v4.1 Flash 镜像,功能开箱即用,但每美元性能目前最多落后 H200 14.8 倍、落后 B200/B300 42 倍。此外,Tianyi Cui 称 DeepSeek Harness v0.1.5 与 DeepSeek V4.1 Flash 模型训练深度结合并做专项优化,含实验性 Agent Teams 功能,并称 Harness 团队仍在开放招聘。

AI 汇总报道生成 · 1小时前更新。单篇报道保留其发布时的原貌。

最新进展

最新情况详见事件全貌。

报道时间线

沿着报道,了解事件的不同侧面。

显示 1全部报道最新在前
  1. Fireworks AI官方一手精选
    Fireworks 评测 DeepSeek-V4.1-Flash:DeepSWE 达 GPT-6 Astra 水准、成本仅 1/15

    Fireworks 发布 DeepSeek-V4.1-Flash 并公布完整基准结果:在 DeepSWE 上以 max 档取得 74.34% pass@1,与 GPT-6 Astra 同一水平,但每任务成本 $0.43,约为 Astra 的 1/15。

24 HOURS

本事件热度走势

当前热度 10峰值 109月15日 09:58近24小时变化

移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。