mistral-large-4
Mistral AI · 发布日期待核实 · 10/09 14:06 更新
AIHOT 评分 · 综合55.9分暂不排名:科研评测还不到 2 类评分不是正确率 · 证据覆盖 29%
可比较分类0/ 4 项分类
已有成绩9项评测
上下文窗口52.4万Token
API 输入 / 输出 · 每百万 Token待核验尚未核到厂商官网价格
各有所长,看得更清楚。
每个领域单独评分,与综合评分在同一条刻度上。具体能力请看下面每项成绩。
编程AIHOT 评分57.4分暂不排名4 项评测 · 覆盖 43%科研AIHOT 评分—分这个领域测得还不够0 项评测 · 覆盖 0%专业办公AIHOT 评分58.2分暂不排名3 项评测 · 覆盖 38%知识问答AIHOT 评分—分这个领域测得还不够0 项评测 · 覆盖 0%
覆盖比例是这个领域里已有成绩的评测类别占比,不代表能力高低;没测的不补分,也不扣分。
每一项成绩,都有来处。
按领域列出每项公开成绩,以及它在同一条刻度上的读数。展开可查看运行配置与采用方式。
编程57.44 项
科研52.91 项
专业办公58.23 项
真人盲选50.41 项
尚无成绩的评测
这些评测尚无可采用的公开成绩,缺测不补分。
Terminal-Bench 4.0 · AALiveBench · 编程综合SciCode · AAProgramBenchCyberBench Patch v1.1HLE · AAFrontierMath v2 · Tiers 1–3LiveBench · 推理与数学CritPt · AAChess PuzzlesMystery Game PuzzlesTerminal-Bench Science · ValsTerminal-Bench Science · AAGDPval-AAAA-BriefcaseAutomationBench · AAAPEX-Agents 1.1τ³-Banking · MercorLiveBench · 数据分析AA-Analyst AgentAA-OmniscienceSimpleQA VerifiedAA-LCRMLCR-AALiveBench · 语言与指令BullshitBench · 错误前提
怎么看这些读数
每项成绩按这项评测的难度换算到同一条刻度上:难的评测考得一般也能读出高分,刷满的评测读不出更多。领域分是这些读数的平均,再向模型的整体水平收一点;同类评测只算一票。相差不到 1 分的两个模型,先后接近抛硬币。
还没有成绩的领域:知识问答,暂按整体水平计算。
了解计算方法 →