← 评测来源
EQ-Bench

Longform Writing

长篇故事的连贯性与完整性

官方评测 ↗
在 AIHOT 中参与排名
证据预算2.4%
上游数据时间09/07 12:49
最近成功同步09/10 06:31

它测什么,怎么测

采用 overall_score_100;八章长文的情节与表达评分,裁判偏好作为局限披露。

如何使用这份证据

正式计分;两张写作榜合计占 6%,不按题数或模型数增加权重。

评测成绩

按固定规则,每个公开模型采用一套代表配置。匿名测试型号不展示,保留原榜名次,每项最多 30 个。

原榜名次原榜型号原始成绩代表配置
1claude-opus-5Anthropic86.3来源默认配置
2claude-fable-5-1Anthropic85.3来源默认配置
3claude-fable-5Anthropic83来源默认配置
4gpt-6-astraOpenAI82.8来源默认配置
4muse-spark-1.3Meta82.8来源默认配置
6claude-opus-4-7Anthropic81.8来源默认配置
6GLM-5.3Z.ai81.8来源默认配置
8gpt-5.6-solOpenAI81.7来源默认配置
9muse-spark-1.2Meta81.5来源默认配置
10claude-opus-4-8Anthropic80.8来源默认配置
11claude-sonnet-4-6Anthropic79.9来源默认配置
13kimi-k3Moonshot AI79.6来源默认配置
14moonshotai/Kimi-K2.6Moonshot AI78.5来源默认配置
15claude-sonnet-5Anthropic78.3来源默认配置
15gpt-5.4OpenAI78.3来源默认配置
17gpt-5.5OpenAI78.2来源默认配置
18gpt-5.6-terraOpenAI78来源默认配置
19zai-org/GLM-5.2Z.ai77.9来源默认配置
20claude-opus-4-6Anthropic77.7来源默认配置
21gemini-3.8-flashGoogle76.8来源默认配置
22deepseek-ai/DeepSeek-V4-ProDeepSeek75.6来源默认配置
23gpt-5.6-lunaOpenAI75.5来源默认配置
24moonshotai/Kimi-K2.5Moonshot AI74.9来源默认配置
25XiaomiMiMo/MiMo-V2.5-ProXiaomi73.7来源默认配置
26zai-org/GLM-5.1Z.ai73.5来源默认配置
27claude-opus-4-5-20251101Anthropic73.1来源默认配置
29gpt-5.4-miniOpenAI73来源默认配置
30gpt-5-2025-08-07OpenAI72.8来源默认配置
31thinkingmachines/InklingThinking Machines Lab72.5来源默认配置
32gemini-3.5-flashGoogle71.8来源默认配置
评测局限与数据署名

以英文写作为主,依赖模型裁判;同一裁判和相关任务共用预算,不代表中文文笔。

数据许可:MIT · EQ-bench-site README 元数据声明

成绩由 EQ-Bench 发布,原始分数与 AIHOT 共识分使用不同尺度,不能直接相加。