阶跃星辰的 Step 5 Preview 在 Artificial Analysis 智能指数上得分 44,与 Kimi K3(max)持平,而每任务成本约低 2.8 倍,但在智能体评测上落后于同类模型
Step 5 Preview 是 @StepFun_ai 的新旗舰模型,总参数量 600B、激活参数 27B,接替 Step 3.7 Flash(2026 年 5 月发布)。它在智能指数上得分 44,与 Kimi K3(max)持平,仅略低于 GLM-5.3(max,45)和 Qwen3.8 Max(45)
关键要点:
➤ Step 5 Preview 每完成一项智能指数任务的成本,比同分数模型低约 2.8 倍。它每任务成本约 $0.72,而同样得分 44 的 Kimi K3(max)约为 $2.00,得分 45 的 GLM-5.3(max)约为 $2.01。这源于其定价:每 1M 输入/输出 token 为 $1/$2.70,在输入和输出上都低于这两者。MiMo-V2.6-Pro 是唯一一个得分更高(46)而每任务成本更低($0.13)的模型
➤ 前沿推理是其突出强项,也是相较 Step 3.7 Flash 提升最大的地方。Step 5 Preview 在 Humanity's Last Exam 上得分 46%,与 Kimi K3(max,47%)相当;在 CritPt 上得分 21%,介于 Kimi K3(23%)和 GLM-5.3(max,19%)之间。两者相较 Step 3.7 Flash 均大幅提升:HLE 上 +25 分,CritPt 上 +19 分
➤ 在参数更少的情况下,AA-Omniscience 准确率高于 GLM-5.3,但幻觉更多。Step 5 Preview 总参数量为 600B,在 AA-Omniscience(我们衡量事实回忆与幻觉的基准)上达到 42% 的准确率,领先于 GLM-5.3(max,34%,753B),落后于 Kimi K3(max,48%,2.8T)。它尝试回答的问题比 GLM-5.3 更多(68% 对 55%),且作答时更常出现幻觉(43% 对 30%),最终在 AA-Omniscience Index 上得分为 16,介于 GLM-5.3(14)与 Kimi K3(20)之间
➤ 在智能体评测中,Step 5 Preview 落后于 Intelligence Index 得分相近的同类模型。它在我们衡量智能体表现的主要评测 GDPval-AA 上获得 1,566 Elo,落后于 Qwen3.8 Max(1,668)和 GLM-5.3(max,1,646)。这一差距在 Terminal-Bench 4.0(33% 对 39% 和 42%)、AA-Briefcase(1,432 Elo 对 1,640 和 1,525)以及 AutomationBench-AA(51% 对 56% 和 62%)上同样存在
模型关键细节:
➤ 模型规模:600B 总参数,27B 激活参数的 MoE 模型
➤ 上下文窗口:1M tokens
➤ 多模态:支持文本、图像和视频输入,文本输出
➤ 定价:每 1M 输入/输出 tokens 为 $1/$2.70,缓存输入为 $0.05/M
➤ 可用性:StepFun 第一方 API,并计划于 10 月 15 日发布开放权重
➤ 许可:目前为闭源权重,计划于 10 月 15 日发布权重