跳到正文

Terminal-Bench 4.0(Artificial Analysis 复跑)

Artificial Analysis / 编程 · 在命令行环境里独立完成一整件工程任务。

官方评测
在 AIHOT 中参与排名
所属领域编程
上游数据时间待核实
最近成功同步10/04 20:23

它测什么,怎么测

取 Artificial Analysis 智能指数中 Terminal-Bench 4.0 的通过率。同一型号按最高推理档位选代表配置,选择不看分数。

如何使用这份证据

计分:编程领域,与 Vals 复跑的 Terminal-Bench 4.0 同属一类,两家合起来算一票。

评测成绩

按固定规则,每个公开模型采用一套代表配置;没有可采用配置的模型标为未计入并写明原因。匿名测试型号不展示,保留原榜名次,每项最多 30 个。

原榜名次原榜型号原始成绩代表配置
1claude-sonnet-5-5Anthropic63.6%Max 推理 · 含来源回退
2claude-opus-5-5Anthropic59.6%Max 推理 · 含来源回退
5gpt-6-astraOpenAI59.1%Max 推理
6gemini-4-argonGoogle57.1%High 推理
9gpt-6-1-solOpenAI56.1%Max 推理
14claude-fable-5-1Anthropic52.0%Max 推理 · 含来源回退
18claude-opus-5Anthropic49.0%Max 推理
23gpt-6-solOpenAI43.9%Max 推理
25claude-fable-5Anthropic42.4%Max 推理 · 含来源回退
26glm-5-3Z.ai41.9%Max 推理
29gpt-5-6-solOpenAI39.9%Max 推理
30qwen3-8-maxAlibaba38.9%来源默认配置
31gpt-5-6-terraOpenAI35.4%Max 推理
32mimo-v2-6-proXiaomi34.8%来源默认配置
35muse-spark-1-3Meta33.3%Max 推理
35step-5StepFun33.3%来源默认配置
35ling-3-1-flashInclusionAI33.3%来源默认配置
38glm-5-3-flashZ.ai32.8%来源默认配置
43deepseek-v4-1-flashDeepSeek26.8%Max 推理
46grok-4-7xAI25.8%xHigh 推理
47qwen3-8-flash-nextAlibaba25.3%来源默认配置
50mimo-v2-6-flashXiaomi22.7%来源默认配置
51claude-opus-4-8Anthropic21.7%Max 推理
55gemini-3-8-flashGoogle19.7%High 推理
57qwen3-8-max-0803Alibaba18.7%来源默认配置
59grok-4-6-xhighxAI17.2%xHigh 推理
62gpt-5-5OpenAI14.6%xHigh 推理
62deepseek-v4-pro-0424DeepSeek14.6%Max 推理
65claude-sonnet-5Anthropic14.1%Max 推理
65deepseek-v4-proDeepSeek14.1%Max 推理
评测局限与数据署名

终端任务对运行环境和时限设置敏感;厂商接口回退的运行照常计入并标注(AA 不公布受影响比例)。

数据许可:Artificial Analysis 公开页面数据;展示须显著署名并链接来源,遵守其 Terms of Use

成绩由 Artificial Analysis 发布。各项评测的原始分数尺度不同,不能直接相加;AIHOT 按公开规则把它们换算到同一条能力刻度上。