← 评测来源
EQ-Bench

Creative Writing v3

短篇创作与表达

官方评测 ↗
在 AIHOT 中参与排名
证据预算3.6%
上游数据时间09/07 12:49
最近成功同步09/10 06:31

它测什么,怎么测

官方 CSV 内嵌于数据脚本,采用 Elo;Sonnet 4.6 判胜负,风格、重复率和 rubric 不重复计票。

如何使用这份证据

正式计分;两张写作榜合计占 6%,不按题数或模型数增加权重。

评测成绩

按固定规则,每个公开模型采用一套代表配置。匿名测试型号不展示,保留原榜名次,每项最多 30 个。

原榜名次原榜型号原始成绩代表配置
1gpt-6-astraOpenAI2,163.9来源默认配置
2claude-fable-5-1Anthropic2,152.7来源默认配置
3claude-opus-5Anthropic2,120.6来源默认配置
4kimi-k3Moonshot AI2,070.6来源默认配置
5GLM-5.3Z.ai2,064.1来源默认配置
6gpt-5.6-solOpenAI1,963.4来源默认配置
8claude-fable-5Anthropic1,934.6来源默认配置
9muse-spark-1.1Meta1,916.1来源默认配置
10claude-opus-4-7Anthropic1,907.1来源默认配置
11muse-spark-1.3Meta1,905.5来源默认配置
12gpt-5.6-terraOpenAI1,850.3来源默认配置
13gpt-5.5OpenAI1,843.5来源默认配置
14Qwen/Qwen3.8-2.4T-A95BAlibaba1,840.9来源默认配置
15gpt-5.4OpenAI1,835.6来源默认配置
16claude-opus-4-8Anthropic1,835.2来源默认配置
16muse-spark-1.2Meta1,835.2来源默认配置
18gpt-5.6-lunaOpenAI1,825.8来源默认配置
19claude-sonnet-4-6Anthropic1,804.2来源默认配置
20claude-opus-4-6Anthropic1,804.1来源默认配置
21claude-sonnet-5Anthropic1,790.5来源默认配置
22meta-models/Muse-Glimmer-30BMeta1,789.7来源默认配置
23zai-org/GLM-5.2Z.ai1,752.8来源默认配置
24gemini-3.8-flashGoogle1,749.7来源默认配置
25gemini-3.7-flashGoogle1,722来源默认配置
26moonshotai/Kimi-K2.6Moonshot AI1,721.3来源默认配置
27gpt-5.2OpenAI1,699.8来源默认配置
28nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4其他1,689.3来源默认配置
29gpt-5.3-chatOpenAI1,686.6来源默认配置
30claude-opus-4-5-20251101Anthropic1,683.2来源默认配置
31claude-sonnet-4.5Anthropic1,674.4来源默认配置
评测局限与数据署名

以英文写作为主,依赖模型裁判;同一裁判和相关任务共用预算,不代表中文文笔。

数据许可:MIT · EQ-bench-site README 元数据声明

成绩由 EQ-Bench 发布,原始分数与 AIHOT 共识分使用不同尺度,不能直接相加。