跳到正文

τ³-Banking(Mercor 复跑)

Mercor / 专业工作 · 在统一工具环境里办理银行客服业务:查政策、找产品、改账户。

官方评测
在 AIHOT 中参与排名
所属领域专业工作
上游数据时间待核实
最近成功同步10/04 20:23

它测什么,怎么测

取 Mercor 给所有模型统一复跑的 pass@1。同一型号按最高推理档位选代表配置,选择不看分数。

如何使用这份证据

计分:专业工作领域的客服一类。

评测成绩

按固定规则,每个公开模型采用一套代表配置;没有可采用配置的模型标为未计入并写明原因。匿名测试型号不展示,保留原榜名次,每项最多 30 个。

原榜名次原榜型号原始成绩代表配置
1claude-opus-5-5Anthropic55.0%Max 推理
2claude-fable-5.1Anthropic54.0%Max 推理
2claude-sonnet-5-5Anthropic54.0%Max 推理
4gemini-3.8-flashGoogle48.8%High 推理
5gpt-6-astra-maxOpenAI46.7%Max 推理
5qwen-3-8-max-xhighAlibaba46.7%xHigh 推理
7grok-4-6-xhighxAI45.7%xHigh 推理
8claude-opus-5Anthropic44.0%Max 推理
9gpt-6-1-solOpenAI43.0%Max 推理
9gpt-5-6-sol-max-proOpenAI43.0%Max 推理未计入:Pro 系统多次采样后汇总作答,不是 GPT-5.6 Sol 本身。
9gpt-6-solOpenAI43.0%Max 推理
12glm-5-3Z.ai40.5%Max 推理
13gpt-6-lunaOpenAI40.2%Max 推理
13deepseek-v4-pro-08-13DeepSeek40.2%Max 推理
15gpt-5.6-terra-maxOpenAI38.8%Max 推理
16glm-5-3-flashZ.ai37.8%Max 推理
17deepseek-v4-1-flashDeepSeek37.5%Max 推理
18gpt-5.6-luna-maxOpenAI35.7%Max 推理
19kimi-k3Moonshot AI34.7%Max 推理
20grok-4.7xAI32.6%xHigh 推理
21minimax-m3MiniMax21.0%High 推理
22nemotron-3-ultra-nvfp4NVIDIA18.6%High 推理
22gemini-3-5-flash-liteGoogle18.6%High 推理
24inklingThinking Machines Lab15.5%High 推理
评测局限与数据署名

依赖模拟用户与工具协议,只代表银行客服场景;Sierra 官方榜单接受厂商自报成绩,不计分。

数据许可:官方公开结果;题目与评测框架来自 Sierra tau2-bench(MIT)

成绩由 Mercor 发布。各项评测的原始分数尺度不同,不能直接相加;AIHOT 按公开规则把它们换算到同一条能力刻度上。