← 评测来源
SimpleBench / 推理

SimpleBench

用日常常识和逻辑问题,检验模型能否识别问题中的实际约束。

官方评测 ↗
在 AIHOT 中观察与参考
证据预算不计分
上游数据时间待核实
最近成功同步尚未开始采集

它测什么,怎么测

区分选择题与开放回答,固定 AVG@5、温度和提示协议;不把加入榜单日期当逐题评测时间。

如何使用这份证据

候选观察:新品覆盖及时,等待官网成绩复用边界与可冻结的数据版本说明;不套用代码许可,尚未自动采集或计分。

尚未纳入可比成绩

候选观察:新品覆盖及时,等待官网成绩复用边界与可冻结的数据版本说明;不套用代码许可,尚未自动采集或计分。

查看上游官方页面 ↗
评测局限与数据署名

日常常识题具有补充价值,但题目代表性与选择题/开放回答条件均影响解释。

数据许可:样题与评测代码仓库 MIT;官网独立发布的最新成绩脚本再展示边界尚未确认。

成绩由 SimpleBench 发布,原始分数与 AIHOT 共识分使用不同尺度,不能直接相加。