热点事件 持续更新

Fireworks 自测 DeepSWE:DeepSeek-V4.1-Flash 以 74.34% pass@1、$0.43/任务达到 GPT-6 Astra 级精度,成本低 15 倍,99.6% 输入 token 为缓存命中

1 篇报道1 个精选信源

事件全貌

AI 综述

DeepSeek 发布 DeepSeek-V4.1-Flash,官方称其为新架构家族中最小模型,具备原生视觉理解,面向更强能力、更快推理、更高吞吐并支持扩展至更大模型。据 MarkTechPost 与 The Decoder 报道,该模型为 552B 骨干参数的多模态 MoE,另有 196B Engram 参数,1M token 上下文,采用因果编码器-解码器结构,prefill 激活 8B、decode 激活 16B;KV 缓存每 token 约 890 字节,约为 V4-Flash 的 1/4,较 V4-V1 缩小约 437 倍,HBM 需求降至 1/4、SSD 需求降至 1/8。模型以 MIT 许可在 Hugging Face 开放权重,并提供 vLLM、SGLang、Transformers 路径及公开 API。

各方对性能与成本的评价多来自自测或官方口径。DeepSeek 自测显示 DeepSWE v1.1 达 74.2%,超过 GPT-5.6 Sol 的 73.0% 与 Opus 5;Artificial Analysis 测得 Intelligence Index 40 分,超过 DeepSeek V4 Pro 0813,但指出其输出冗长(每任务 89k tokens),成本约 $0.27/任务。Fireworks 自测 DeepSWE 74.34% pass@1、$0.43/任务,称与 GPT-6 Astra 同级精度但成本低 15 倍,99.6% 输入 token 为缓存命中。The Decoder 指出其在复杂科学任务与图像分析上仍与领先闭源系统存在差距。

API 与生态方面,DeepSeek 第一方 API 定价为输入 $0.30/百万 token、输出 $1.20/百万 token,缓存命中输入 $0.006/百万 token,闲时再打五折。公司称自 9 月 14 日起 V4-Pro API 请求将临时路由至 V4.1-Flash,直至 V4.1-Pro 到来;Baseten 称 DeepSeek 已停用平台上的 V4-Flash 并将流量路由至 V4.1-Flash。模型陆续上线国家超算互联网中心、腾讯 WorkBuddy、阿里云 Token Plan(起价 $6/月)等平台。OpenRouter 称其 24 小时处理 1T tokens,预计 48 小时约 2.8T,其中 90% 为缓存读取。SemiAnalysis 称 AMD 公开发布镜像,功能开箱即用,但每美元性能目前最多落后 H200 14.8 倍、B200/B300 42 倍。

技术解读方面,马东锡 NLP 介绍 Causal Encoder–Decoder 使 decoder 的 global KV 直接由 causal encoder 最终输出生成,第 21–40 层跨层共享 KV,从而减少 prefill 计算。DeepSeek Harness 团队同期发布 v0.1.5,称与 V4.1 Flash 模型训练深度结合并含实验性 Agent Teams 功能,团队仍在开放招聘。

AI 汇总报道生成 · 1小时前更新。单篇报道保留其发布时的原貌。

最新进展

腾讯 WorkBuddy 国际版将 DeepSeek-V4.1-Flash 标为「Free now」、倍率 0.00x,作者称限时免费两周,零门槛直连并开放全功能 Agent 权限。

报道时间线

沿着报道,了解事件的不同侧面。

显示 1全部报道最新在前
  1. Fireworks AI官方一手精选
    Fireworks 上线 DeepSeek-V4.1-Flash,DeepSWE 达 GPT-6 Astra 水准、成本仅 1/15

    Fireworks 发布 DeepSeek-V4.1-Flash,在 DeepSWE 上取得 74.34% pass@1、每任务 $0.43,与 GPT-6 Astra 同一精度区间但成本仅 1/15。