Terminal-Bench 4.0(Vals AI 复跑)
Vals AI / 编程 · Vals 用同一套 Agent 流程给所有模型复跑 Terminal-Bench 4.0。
在 AIHOT 中参与排名
所属领域编程
上游数据时间10/01 08:00
最近成功同步10/04 20:24
它测什么,怎么测
取 Vals 专项页 Overall 通过率。同一型号按最高推理档位选代表配置,选择不看分数。
如何使用这份证据
计分:编程领域,与 AA 复跑的 Terminal-Bench 4.0 同属一类,两家合起来算一票。
评测成绩
按固定规则,每个公开模型采用一套代表配置;没有可采用配置的模型标为未计入并写明原因。匿名测试型号不展示,保留原榜名次,每项最多 30 个。
| 原榜名次 | 原榜型号 | 原始成绩 | 代表配置 |
|---|---|---|---|
| 1 | anthropic/claude-opus-5-5Anthropic | 65.2% | Max 推理 |
| 2 | anthropic/claude-sonnet-5-5Anthropic | 64.1% | Max 推理 |
| 3 | openai/gpt-6-astraOpenAI | 59.6% | Max 推理 |
| 4 | anthropic/claude-fable-5-1Anthropic | 58.1% | Max 推理 |
| 5 | google/gemini-4-argonGoogle | 57.6% | High 推理 |
| 6 | openai/gpt-6.1-solOpenAI | 55.1% | Max 推理 |
| 7 | anthropic/claude-opus-5Anthropic | 53.5% | Max 推理 |
| 8 | openai/gpt-6-solOpenAI | 44.4% | Max 推理 |
| 9 | anthropic/claude-fable-5Anthropic | 41.4% | Max 推理 |
| 10 | zai/glm-5.3Z.ai | 38.9% | Max 推理 |
| 11 | openai/gpt-5.6-solOpenAI | 37.9% | Max 推理 |
| 12 | alibaba/qwen3.8-maxAlibaba | 34.3% | 来源默认配置 |
| 13 | stepfun/step-5-previewStepFun | 31.8% | 来源默认配置 |
| 14 | xiaomi/mimo-v2.6-proXiaomi | 31.3% | 来源默认配置 |
| 15 | grok/grok-4.7xAI | 28.8% | xHigh 推理 |
| 16 | meta/muse_spark_1_3_maxMeta | 24.7% | Max 推理 |
| 17 | xiaomi/mimo-v2.6-flashXiaomi | 24.2% | 来源默认配置 |
| 18 | anthropic/claude-opus-4-8Anthropic | 23.2% | Max 推理 |
| 19 | openai/gpt-5.6-terraOpenAI | 22.7% | Max 推理 |
| 20 | deepseek/deepseek-v4.1-flashDeepSeek | 19.7% | High 推理 |
| 20 | fireworks/ember-1Fireworks AI | 19.7% | 来源默认配置 |
| 22 | google/gemini-3.8-flashGoogle | 19.2% | High 推理 |
| 23 | deepseek/deepseek-v4-flash-0731DeepSeek | 18.7% | High 推理 |
| 24 | kimi/kimi-k3Moonshot AI | 17.2% | Max 推理 |
| 24 | grok/grok-4.6xAI | 17.2% | High 推理 |
| 26 | deepseek/deepseek-v4-pro-0813DeepSeek | 14.1% | Max 推理 |
| 27 | openai/gpt-6-lunaOpenAI | 13.6% | Max 推理 |
| 28 | google/gemini-3.7-flashGoogle | 12.1% | High 推理 |
| 29 | openai/gpt-5.6-lunaOpenAI | 11.6% | Max 推理 |
| 30 | deepseek/deepseek-v4-proDeepSeek | 11.1% | Max 推理 |
评测局限与数据署名
Vals 公布每次运行有多少题被厂商接口转给了同厂商的旧型号:有回退的成绩照常计入并在模型页标注,受影响题目过半的不计。同属 Vals 的几项评测不能当作多家独立机构。
数据许可:官方公开结果;公开再展示保留官方署名,完整再分发授权仍以 Vals 条款为准
成绩由 Vals AI 发布。各项评测的原始分数尺度不同,不能直接相加;AIHOT 按公开规则把它们换算到同一条能力刻度上。