← 评测来源
LMArena

Arena WebDev

同样是真人盲选,比的是网页好不好用、能不能交付。

官方评测 ↗
在 AIHOT 中参与排名
证据预算2.4%
上游数据时间09/08 08:00
最近成功同步09/10 06:31

它测什么,怎么测

只取官方发布快照中的 WebDev 总榜,不抓取 arena.ai 实时页面;与 Text 共同构成一张 Arena 家族票。

如何使用这份证据

编程与设计预算中的 2.4%;在审美分类衡量网页作品偏好,不等同代码正确率。仍与 Arena 其他任务共用证据家族。

评测成绩

按固定规则,每个公开模型采用一套代表配置。匿名测试型号不展示,保留原榜名次,每项最多 30 个。

原榜名次原榜型号原始成绩代表配置
1gpt-6-astra-maxOpenAI1,796.2Max 推理
2claude-fable-5.1-maxAnthropic1,764Max 推理
3claude-opus-5-maxAnthropic1,687.9Max 推理
4qwen3.8-max-0902Alibaba1,685.2来源默认配置
5kimi-k3-maxMoonshot AI1,674.2来源默认配置
6qwen3.8-maxAlibaba1,669.8来源默认配置
8muse-spark-1.3-maxMeta1,650Max 推理
9qwen3.8-flash-nextAlibaba1,630.5来源默认配置
10claude-fable-5Anthropic1,628.3来源默认配置
12grok-4.6-highxAI1,623.5High 推理
13hy4-previewTencent1,623来源默认配置
14gpt-5.6-sol-xhigh (codex-harness)OpenAI1,617.2xHigh 推理 · codex-harness
15glm-5.3-maxZ.ai1,612.5来源默认配置
16glm-5.3-flashZ.ai1,604.5来源默认配置
17qwen3.8-27bAlibaba1,591.5来源默认配置
18glm-5.2-maxZ.ai1,589.2来源默认配置
19gemini-3.7-flash-highGoogle1,587High 推理
20deepseek-v4-flash-highDeepSeek1,581.8来源默认配置
21deepseek-v4-pro-high-20260813DeepSeek1,580.3来源默认配置
22gemini-3.8-flash-highGoogle1,568.2High 推理
23claude-opus-4-8-highAnthropic1,561High 推理
25grok-4.5xAI1,555.5来源默认配置
26claude-opus-4-7-highAnthropic1,555.1High 推理
27claude-opus-4-6-highAnthropic1,546.4High 推理
28muse-spark-1.1Meta1,541.4来源默认配置
30claude-sonnet-5-highAnthropic1,537.8High 推理
32gemini-3.6-flash-highGoogle1,536.8High 推理
33muse-spark-1.2 (xHigh)Meta1,534.3xHigh 推理
34claude-sonnet-4-6Anthropic1,521来源默认配置
35gpt-5.6-terra-xhigh (codex-harness)OpenAI1,520.8xHigh 推理 · codex-harness
评测局限与数据署名

与 Text 存在偏好构念相关性。

数据许可:CC BY 4.0

成绩由 LMArena 发布,原始分数与 AIHOT 共识分使用不同尺度,不能直接相加。