好排名,从好评测开始。
每个来源测什么、怎样更新、是否进入排名,都可以在这里找到。
综合评测与体验17
跨能力的综合测试与真人盲选。
AA Index
把多项当前评测放到同一套环境里复跑,得到一个综合能力分。价格只作参考,不进总分。
LiveBench
题库持续更换,答案可以自动核对。用来看模型换题之后还能不能站住。
Arena Text
真人匿名两两比较回答,看大家更愿意读哪一个。补上选择题看不出的整体体验。
Arena WebDev
同样是真人盲选,比的是网页好不好用、能不能交付。
LiveBench · 语言与指令
理解语言、修正文字,并按要求完成改写、摘要与生成任务。
Arena 创作盲选
真人盲选故事、诗歌和其他创意表达,观察作品是否吸引读者。
Design Arena · 视觉设计
真人盲选网页、界面、图表和幻灯片的设计作品。
EQ-Bench 4 · 情绪与人际理解
在多轮交流中理解人物情绪、隐含需求与不同的沟通偏好。
Short-Story · 短篇小说
把固定人物、情节与风格要求自然写进一篇完整短篇小说。
ToneBench · 文风与脚本
按指定作者文风写视频脚本,考查开场、结构、表达与口播节奏。
TubeLab · 视频脚本
面向不同视频频道写脚本,比较故事组织、文风、节奏与清晰度。
NC Bench · 作家工作流
帮助作家改写、续写、总结、翻译和整理创作想法。
OpenVibeEval · 网页作品
对照网页作品、可访问性和盲选偏好,观察不同工具下的设计表现。
SVGBench · 矢量图盲选
按相同提示盲选 SVG,考查视觉清晰度与图形表现。
Rapidata SVG
真人比较模型生成的矢量图,直接评价视觉偏好。
Creative Writing v3
短篇创作与表达
Longform Writing
长篇故事的连贯性与完整性
编程13
从写代码到改仓库,看模型能不能把软件做出来。
DeepSWE v1.1
在统一的编程助手环境里改仓库、修缺陷,比较的是写代码的模型本身。
TapTap Maker
在真实游戏引擎里用 Lua 写出能跑起来的功能。分数由引擎执行判定,不用另一个模型打分。
LiveBench · 编程
持续换题的 Coding + Agentic Coding 专项。
Hyper-τ-bench
根据业务资料构建并测试能工作的客户服务代理。
SWE-rebench
持续收集真实仓库问题,比较模型在多种编程语言中的软件修复能力。
LHTB
在较长时间内持续使用终端,完成复杂工程与工具任务。
Terminal-Bench 4
保留模型搭配不同 Agent 在终端任务中的原始成绩,供交叉核对。
MirrorCode
长时间的软件复现
Code Migration
软件迁移与接口改造
ProgramBench
完整程序的实现与交付
FrontierCode
真实仓库任务的质量、测试与修改范围
FrontierSWE v2
长时间运行的工程实现与研究任务
WeirdML
在陌生数据上实现机器学习方案
推理11
数学、逻辑与陌生规则,看模型能不能想明白新问题。
LiveBench · 推理
持续换题的 Reasoning + Mathematics 专项。
SimpleBench
用日常常识和逻辑问题,检验模型能否识别问题中的实际约束。
FrontierMath v2 · Tiers 1–3
研究级数学推理
FrontierMath v2 · Tier 4
更高难度的数学研究题
Chess Puzzles
根据文字棋局寻找正确走法
Mystery Game Puzzles
从陌生规则推导正确行动
MathArena · ArXivLean
用 Lean 验证数学证明
MathArena · BrokenArXiv
发现和修复数学证明中的错误
MathArena · ArXivMath
从近期数学论文提炼的新题
ARC-AGI-2
从陌生规则中学习和泛化
ARC-AGI-3
从陌生规则中学习和泛化
知识5
事实问答与研究生级科学知识,看知识掌握与回答准确性。
专业办公19
金融分析、法律咨询与银行业务,看专业任务能否完成。
APEX-Agents 1.1
投行、咨询和法律里的长任务,看模型当助手能不能把一件完整的工作做完。
Vals Finance Agent
金融分析师的日常办公题,看研报、建模这类工作做得怎样。
OfficeQA Pro
从大量真实财务文件中检索、计算并回答问题。
Harvey Legal Agent Benchmark
处理法律资料并交付 Word、Excel、幻灯片等可审阅文件。
MCP Atlas
通过真实 MCP 服务检索资料、操作文档与数据库,完成跨软件任务。
FinanceBenchmark
完成金融定价、资本计算和风控任务,用数值与代码执行结果核验。
PRBench · Legal
回答真实法律工作中的复杂问题,检验专业判断和论证质量。
PRBench · Finance
回答真实金融决策问题,检验专业判断、推导和风险说明。
SpreadsheetBench 2
完成财务建模、修复工作簿和数据可视化的整套表格工作。
Vending-Bench 2
经营模拟商店一年,处理采购、谈判、库存与定价。
τ³-Banking
在统一工具环境中办理银行业务,检验规则理解、客户沟通与任务完成。
EBR-bench
在长任务中学习新规则并使用记忆
Excel · EMB
表格编辑与 Excel 办公
Legal Research
法律检索和论证
TaxAgentBench
税务专业问题
MedScribe
临床记录整理与撰写
BioMysteryBench
生物学研究推理
AutomationBench
跨办公软件完成自动化工作
Terminal-Bench Science
在终端里完成科研任务
视觉理解2
理解图片的证据继续保留在综合榜;读懂图片与设计美观是不同能力。
中文与多语言2
语言基础的补充证据,不把英文写作表现当作中文能力。
“观察中”表示仍在核对数据、运行条件或使用边界,不参与综合榜和分类榜。同一评测的重复抓取和展示切片不会增加票权;不同评测之间的题库重叠仍需持续核对。