← 评测来源
EQ-Bench
官方评测 ↗Creative Writing v3
短篇创作与表达
在 AIHOT 中参与排名
证据预算3.6%
上游数据时间09/07 12:49
最近成功同步09/10 06:31
它测什么,怎么测
官方 CSV 内嵌于数据脚本,采用 Elo;Sonnet 4.6 判胜负,风格、重复率和 rubric 不重复计票。
如何使用这份证据
正式计分;两张写作榜合计占 6%,不按题数或模型数增加权重。
评测成绩
按固定规则,每个公开模型采用一套代表配置。匿名测试型号不展示,保留原榜名次,每项最多 30 个。
| 原榜名次 | 原榜型号 | 原始成绩 | 代表配置 |
|---|---|---|---|
| 1 | gpt-6-astraOpenAI | 2,163.9 | 来源默认配置 |
| 2 | claude-fable-5-1Anthropic | 2,152.7 | 来源默认配置 |
| 3 | claude-opus-5Anthropic | 2,120.6 | 来源默认配置 |
| 4 | kimi-k3Moonshot AI | 2,070.6 | 来源默认配置 |
| 5 | GLM-5.3Z.ai | 2,064.1 | 来源默认配置 |
| 6 | gpt-5.6-solOpenAI | 1,963.4 | 来源默认配置 |
| 8 | claude-fable-5Anthropic | 1,934.6 | 来源默认配置 |
| 9 | muse-spark-1.1Meta | 1,916.1 | 来源默认配置 |
| 10 | claude-opus-4-7Anthropic | 1,907.1 | 来源默认配置 |
| 11 | muse-spark-1.3Meta | 1,905.5 | 来源默认配置 |
| 12 | gpt-5.6-terraOpenAI | 1,850.3 | 来源默认配置 |
| 13 | gpt-5.5OpenAI | 1,843.5 | 来源默认配置 |
| 14 | Qwen/Qwen3.8-2.4T-A95BAlibaba | 1,840.9 | 来源默认配置 |
| 15 | gpt-5.4OpenAI | 1,835.6 | 来源默认配置 |
| 16 | claude-opus-4-8Anthropic | 1,835.2 | 来源默认配置 |
| 16 | muse-spark-1.2Meta | 1,835.2 | 来源默认配置 |
| 18 | gpt-5.6-lunaOpenAI | 1,825.8 | 来源默认配置 |
| 19 | claude-sonnet-4-6Anthropic | 1,804.2 | 来源默认配置 |
| 20 | claude-opus-4-6Anthropic | 1,804.1 | 来源默认配置 |
| 21 | claude-sonnet-5Anthropic | 1,790.5 | 来源默认配置 |
| 22 | meta-models/Muse-Glimmer-30BMeta | 1,789.7 | 来源默认配置 |
| 23 | zai-org/GLM-5.2Z.ai | 1,752.8 | 来源默认配置 |
| 24 | gemini-3.8-flashGoogle | 1,749.7 | 来源默认配置 |
| 25 | gemini-3.7-flashGoogle | 1,722 | 来源默认配置 |
| 26 | moonshotai/Kimi-K2.6Moonshot AI | 1,721.3 | 来源默认配置 |
| 27 | gpt-5.2OpenAI | 1,699.8 | 来源默认配置 |
| 28 | nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4其他 | 1,689.3 | 来源默认配置 |
| 29 | gpt-5.3-chatOpenAI | 1,686.6 | 来源默认配置 |
| 30 | claude-opus-4-5-20251101Anthropic | 1,683.2 | 来源默认配置 |
| 31 | claude-sonnet-4.5Anthropic | 1,674.4 | 来源默认配置 |
评测局限与数据署名
以英文写作为主,依赖模型裁判;同一裁判和相关任务共用预算,不代表中文文笔。
数据许可:MIT · EQ-bench-site README 元数据声明
成绩由 EQ-Bench 发布,原始分数与 AIHOT 共识分使用不同尺度,不能直接相加。