跳到正文

Terminal-Bench 4.0(Vals AI 复跑)

Vals AI / 编程 · Vals 用同一套 Agent 流程给所有模型复跑 Terminal-Bench 4.0。

官方评测
在 AIHOT 中参与排名
所属领域编程
上游数据时间10/01 08:00
最近成功同步10/04 20:24

它测什么,怎么测

取 Vals 专项页 Overall 通过率。同一型号按最高推理档位选代表配置,选择不看分数。

如何使用这份证据

计分:编程领域,与 AA 复跑的 Terminal-Bench 4.0 同属一类,两家合起来算一票。

评测成绩

按固定规则,每个公开模型采用一套代表配置;没有可采用配置的模型标为未计入并写明原因。匿名测试型号不展示,保留原榜名次,每项最多 30 个。

原榜名次原榜型号原始成绩代表配置
1anthropic/claude-opus-5-5Anthropic65.2%Max 推理
2anthropic/claude-sonnet-5-5Anthropic64.1%Max 推理
3openai/gpt-6-astraOpenAI59.6%Max 推理
4anthropic/claude-fable-5-1Anthropic58.1%Max 推理
5google/gemini-4-argonGoogle57.6%High 推理
6openai/gpt-6.1-solOpenAI55.1%Max 推理
7anthropic/claude-opus-5Anthropic53.5%Max 推理
8openai/gpt-6-solOpenAI44.4%Max 推理
9anthropic/claude-fable-5Anthropic41.4%Max 推理
10zai/glm-5.3Z.ai38.9%Max 推理
11openai/gpt-5.6-solOpenAI37.9%Max 推理
12alibaba/qwen3.8-maxAlibaba34.3%来源默认配置
13stepfun/step-5-previewStepFun31.8%来源默认配置
14xiaomi/mimo-v2.6-proXiaomi31.3%来源默认配置
15grok/grok-4.7xAI28.8%xHigh 推理
16meta/muse_spark_1_3_maxMeta24.7%Max 推理
17xiaomi/mimo-v2.6-flashXiaomi24.2%来源默认配置
18anthropic/claude-opus-4-8Anthropic23.2%Max 推理
19openai/gpt-5.6-terraOpenAI22.7%Max 推理
20deepseek/deepseek-v4.1-flashDeepSeek19.7%High 推理
20fireworks/ember-1Fireworks AI19.7%来源默认配置
22google/gemini-3.8-flashGoogle19.2%High 推理
23deepseek/deepseek-v4-flash-0731DeepSeek18.7%High 推理
24kimi/kimi-k3Moonshot AI17.2%Max 推理
24grok/grok-4.6xAI17.2%High 推理
26deepseek/deepseek-v4-pro-0813DeepSeek14.1%Max 推理
27openai/gpt-6-lunaOpenAI13.6%Max 推理
28google/gemini-3.7-flashGoogle12.1%High 推理
29openai/gpt-5.6-lunaOpenAI11.6%Max 推理
30deepseek/deepseek-v4-proDeepSeek11.1%Max 推理
评测局限与数据署名

Vals 公布每次运行有多少题被厂商接口转给了同厂商的旧型号:有回退的成绩照常计入并在模型页标注,受影响题目过半的不计。同属 Vals 的几项评测不能当作多家独立机构。

数据许可:官方公开结果;公开再展示保留官方署名,完整再分发授权仍以 Vals 条款为准

成绩由 Vals AI 发布。各项评测的原始分数尺度不同,不能直接相加;AIHOT 按公开规则把它们换算到同一条能力刻度上。