← 返回综合榜CAPABILITY PROFILE UNDERSTANDING THE RANK
查看 Qwen3.8 Flash Next 的完整证据 →
查看 DeepSeek V4.1 Flash 的完整证据 →
查看 Qwen3.8 Max 的完整证据 →
查看 Gemini 3.7 Flash 的完整证据 →
查看 Claude Opus 4.7 的完整证据 →BEHIND THE SCORE
Muse Spark 1.2
Meta · 2026-08-05 发布 · 09/16 02:00 更新
分类成绩2 / 4 项分类
已有成绩14 项评测
上下文窗口104.9万 Token
API 输入 / 输出 · 每百万 Token¥8.39 / ¥28.52厂商官方价格 ↗
各有所长,看得更清楚。
每项能力单独计算。没有足够的实测,就留空。
不同分类的分数反映各自参照组中的排序支持,不能直接相加或用来比较不同能力的绝对高低。
综合名次,有多稳定?
依次移除一项评测或一家机构、调整单项权重与误差处理,观察排名怎样变化。
重新检查资格后的名次16—18 名
已完成的对照中均具备参评资格。保持原候选不变时为 16—18 名。这个范围不是置信区间,也不包含从未公开的成绩。
查看与附近模型的共同证据
净支持只看双方共同参加的评测。全局排序还需处理其他模型间的冲突,因此非相邻名次可能与单独比较不同。
Qwen3.8 Flash Next5 项共同评测共同证据支持对方
双方共同拥有当前榜单 42.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| Arena WebDev ↗ | 1,534.4 | 1,635.3 | 2.4% |
| AA Index ↗ | 39.8 | 39.9 | 30.0% |
| LiveBench · 编程 ↗ | 67.6% | 67.1% | 2.4% |
| LiveBench · 推理 ↗ | 90.6% | 86.6% | 4.2% |
| LiveBench · 语言与指令 ↗ | 76.4% | 75.9% | 3.0% |
DeepSeek V4.1 Flash6 项共同评测共同证据支持本模型
双方共同拥有当前榜单 45.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| Arena WebDev ↗ | 1,534.4 | 1,614 | 2.4% |
| AA Index ↗ | 39.8 | 39.5 | 30.0% |
| LiveBench · 编程 ↗ | 67.6% | 78.7% | 2.4% |
| LiveBench · 推理 ↗ | 90.6% | 90.0% | 4.2% |
| LiveBench · 语言与指令 ↗ | 76.4% | 75.6% | 3.0% |
| Vals Finance Agent ↗ | 60.6% | 53.5% | 3.0% |
Qwen3.8 Max11 项共同评测共同证据支持对方
双方共同拥有当前榜单 68.6% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| Arena 创作盲选 ↗ | 1,452.4 | 1,471.5 | 5.0% |
| Arena Text ↗ | 1,499.6 | 1,480.6 | 5.0% |
| Arena Vision ↗ | 1,291.5 | 1,301.8 | 6.0% |
| Arena WebDev ↗ | 1,534.4 | 1,670.6 | 2.4% |
| AA Index ↗ | 39.8 | 40.3 | 30.0% |
| DeepSWE v1.1 ↗ | 54.9% | 57.5% | 3.6% |
| SimpleQA Verified ↗ | 60.3% | 45.8% | 4.0% |
| LiveBench · 编程 ↗ | 67.6% | 68.8% | 2.4% |
| LiveBench · 推理 ↗ | 90.6% | 89.8% | 4.2% |
| LiveBench · 语言与指令 ↗ | 76.4% | 76.9% | 3.0% |
| Vals Finance Agent ↗ | 60.6% | 50.6% | 3.0% |
Gemini 3.7 Flash12 项共同评测共同证据支持本模型
双方共同拥有当前榜单 70.2% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| Arena 创作盲选 ↗ | 1,452.4 | 1,494.8 | 5.0% |
| Arena Text ↗ | 1,499.6 | 1,489.8 | 5.0% |
| Arena WebDev ↗ | 1,534.4 | 1,587.3 | 2.4% |
| AA Index ↗ | 39.8 | 39.4 | 30.0% |
| DeepSWE v1.1 ↗ | 54.9% | 65.3% | 3.6% |
| SimpleQA Verified ↗ | 60.3% | 69.2% | 4.0% |
| Creative Writing v3 ↗ | 1,835.2 | 1,722 | 3.6% |
| LiveBench · 编程 ↗ | 67.6% | 68.6% | 2.4% |
| LiveBench · 推理 ↗ | 90.6% | 90.6% | 4.2% |
| LiveBench · 语言与指令 ↗ | 76.4% | 82.7% | 3.0% |
| APEX-Agents 1.1 ↗ | 36.4% | 67.8% | 4.0% |
| Vals Finance Agent ↗ | 60.6% | 59.0% | 3.0% |
Claude Opus 4.713 项共同评测共同证据支持对方
双方共同拥有当前榜单 75.0% 的名义票权。下表展示原始成绩,已知误差的软化处理会影响净支持,不只数赢了几项。
| 共同评测 | 本模型 | 对方 | 票权 |
|---|---|---|---|
| Arena 创作盲选 ↗ | 1,452.4 | 1,488.4 | 5.0% |
| Arena Text ↗ | 1,499.6 | 1,501.7 | 5.0% |
| Arena Vision ↗ | 1,291.5 | 1,300.9 | 6.0% |
| Arena WebDev ↗ | 1,534.4 | 1,555.2 | 2.4% |
| AA Index ↗ | 39.8 | 40.7 | 30.0% |
| SimpleQA Verified ↗ | 60.3% | 51.7% | 4.0% |
| Creative Writing v3 ↗ | 1,835.2 | 1,907.1 | 3.6% |
| Longform Writing ↗ | 81.5 | 81.8 | 2.4% |
| LiveBench · 编程 ↗ | 67.6% | 66.4% | 2.4% |
| LiveBench · 推理 ↗ | 90.6% | 90.0% | 4.2% |
| LiveBench · 语言与指令 ↗ | 76.4% | 72.3% | 3.0% |
| APEX-Agents 1.1 ↗ | 36.4% | 49.2% | 4.0% |
| Vals Finance Agent ↗ | 60.6% | 51.5% | 3.0% |
每一项成绩,都有来处。
下面是该模型的公开汇总成绩。展开可查看运行配置与采用方式。