τ³-Banking(Mercor 复跑)
Mercor / 专业工作 · 在统一工具环境里办理银行客服业务:查政策、找产品、改账户。
在 AIHOT 中参与排名
所属领域专业工作
上游数据时间待核实
最近成功同步10/04 20:23
它测什么,怎么测
取 Mercor 给所有模型统一复跑的 pass@1。同一型号按最高推理档位选代表配置,选择不看分数。
如何使用这份证据
计分:专业工作领域的客服一类。
评测成绩
按固定规则,每个公开模型采用一套代表配置;没有可采用配置的模型标为未计入并写明原因。匿名测试型号不展示,保留原榜名次,每项最多 30 个。
| 原榜名次 | 原榜型号 | 原始成绩 | 代表配置 |
|---|---|---|---|
| 1 | claude-opus-5-5Anthropic | 55.0% | Max 推理 |
| 2 | claude-fable-5.1Anthropic | 54.0% | Max 推理 |
| 2 | claude-sonnet-5-5Anthropic | 54.0% | Max 推理 |
| 4 | gemini-3.8-flashGoogle | 48.8% | High 推理 |
| 5 | gpt-6-astra-maxOpenAI | 46.7% | Max 推理 |
| 5 | qwen-3-8-max-xhighAlibaba | 46.7% | xHigh 推理 |
| 7 | grok-4-6-xhighxAI | 45.7% | xHigh 推理 |
| 8 | claude-opus-5Anthropic | 44.0% | Max 推理 |
| 9 | gpt-6-1-solOpenAI | 43.0% | Max 推理 |
| 9 | gpt-5-6-sol-max-proOpenAI | 43.0% | Max 推理未计入:Pro 系统多次采样后汇总作答,不是 GPT-5.6 Sol 本身。 |
| 9 | gpt-6-solOpenAI | 43.0% | Max 推理 |
| 12 | glm-5-3Z.ai | 40.5% | Max 推理 |
| 13 | gpt-6-lunaOpenAI | 40.2% | Max 推理 |
| 13 | deepseek-v4-pro-08-13DeepSeek | 40.2% | Max 推理 |
| 15 | gpt-5.6-terra-maxOpenAI | 38.8% | Max 推理 |
| 16 | glm-5-3-flashZ.ai | 37.8% | Max 推理 |
| 17 | deepseek-v4-1-flashDeepSeek | 37.5% | Max 推理 |
| 18 | gpt-5.6-luna-maxOpenAI | 35.7% | Max 推理 |
| 19 | kimi-k3Moonshot AI | 34.7% | Max 推理 |
| 20 | grok-4.7xAI | 32.6% | xHigh 推理 |
| 21 | minimax-m3MiniMax | 21.0% | High 推理 |
| 22 | nemotron-3-ultra-nvfp4NVIDIA | 18.6% | High 推理 |
| 22 | gemini-3-5-flash-liteGoogle | 18.6% | High 推理 |
| 24 | inklingThinking Machines Lab | 15.5% | High 推理 |
评测局限与数据署名
依赖模拟用户与工具协议,只代表银行客服场景;Sierra 官方榜单接受厂商自报成绩,不计分。
数据许可:官方公开结果;题目与评测框架来自 Sierra tau2-bench(MIT)
成绩由 Mercor 发布。各项评测的原始分数尺度不同,不能直接相加;AIHOT 按公开规则把它们换算到同一条能力刻度上。