← 评测来源
EQ-Bench
官方评测 ↗Longform Writing
长篇故事的连贯性与完整性
在 AIHOT 中参与排名
证据预算2.4%
上游数据时间09/07 12:49
最近成功同步09/10 06:31
它测什么,怎么测
采用 overall_score_100;八章长文的情节与表达评分,裁判偏好作为局限披露。
如何使用这份证据
正式计分;两张写作榜合计占 6%,不按题数或模型数增加权重。
评测成绩
按固定规则,每个公开模型采用一套代表配置。匿名测试型号不展示,保留原榜名次,每项最多 30 个。
| 原榜名次 | 原榜型号 | 原始成绩 | 代表配置 |
|---|---|---|---|
| 1 | claude-opus-5Anthropic | 86.3 | 来源默认配置 |
| 2 | claude-fable-5-1Anthropic | 85.3 | 来源默认配置 |
| 3 | claude-fable-5Anthropic | 83 | 来源默认配置 |
| 4 | gpt-6-astraOpenAI | 82.8 | 来源默认配置 |
| 4 | muse-spark-1.3Meta | 82.8 | 来源默认配置 |
| 6 | claude-opus-4-7Anthropic | 81.8 | 来源默认配置 |
| 6 | GLM-5.3Z.ai | 81.8 | 来源默认配置 |
| 8 | gpt-5.6-solOpenAI | 81.7 | 来源默认配置 |
| 9 | muse-spark-1.2Meta | 81.5 | 来源默认配置 |
| 10 | claude-opus-4-8Anthropic | 80.8 | 来源默认配置 |
| 11 | claude-sonnet-4-6Anthropic | 79.9 | 来源默认配置 |
| 13 | kimi-k3Moonshot AI | 79.6 | 来源默认配置 |
| 14 | moonshotai/Kimi-K2.6Moonshot AI | 78.5 | 来源默认配置 |
| 15 | claude-sonnet-5Anthropic | 78.3 | 来源默认配置 |
| 15 | gpt-5.4OpenAI | 78.3 | 来源默认配置 |
| 17 | gpt-5.5OpenAI | 78.2 | 来源默认配置 |
| 18 | gpt-5.6-terraOpenAI | 78 | 来源默认配置 |
| 19 | zai-org/GLM-5.2Z.ai | 77.9 | 来源默认配置 |
| 20 | claude-opus-4-6Anthropic | 77.7 | 来源默认配置 |
| 21 | gemini-3.8-flashGoogle | 76.8 | 来源默认配置 |
| 22 | deepseek-ai/DeepSeek-V4-ProDeepSeek | 75.6 | 来源默认配置 |
| 23 | gpt-5.6-lunaOpenAI | 75.5 | 来源默认配置 |
| 24 | moonshotai/Kimi-K2.5Moonshot AI | 74.9 | 来源默认配置 |
| 25 | XiaomiMiMo/MiMo-V2.5-ProXiaomi | 73.7 | 来源默认配置 |
| 26 | zai-org/GLM-5.1Z.ai | 73.5 | 来源默认配置 |
| 27 | claude-opus-4-5-20251101Anthropic | 73.1 | 来源默认配置 |
| 29 | gpt-5.4-miniOpenAI | 73 | 来源默认配置 |
| 30 | gpt-5-2025-08-07OpenAI | 72.8 | 来源默认配置 |
| 31 | thinkingmachines/InklingThinking Machines Lab | 72.5 | 来源默认配置 |
| 32 | gemini-3.5-flashGoogle | 71.8 | 来源默认配置 |
评测局限与数据署名
以英文写作为主,依赖模型裁判;同一裁判和相关任务共用预算,不代表中文文笔。
数据许可:MIT · EQ-bench-site README 元数据声明
成绩由 EQ-Bench 发布,原始分数与 AIHOT 共识分使用不同尺度,不能直接相加。