Vibe Code Bench 1–100
Vals AI / 编程 · 在已有应用上连续开发,同时保持旧功能。
在 AIHOT 中参与排名
所属领域编程
上游数据时间10/06 08:00
最近成功同步10/08 02:05
它测什么,怎么测
50 个连续开发测试场景;统一 OpenHands、每场景 10 小时预算,浏览器验证新增功能与回归。
如何使用这份证据
计分:应用开发;与 Vibe Code Bench 共用一类评测。 固定十个对照型号至少测到六个,才参与计算。
评测成绩
按固定规则,每个公开模型采用一套代表配置;没有可采用配置的模型标为未计入并写明原因。匿名测试型号不展示,保留原榜名次,每项最多 30 个。
| 原榜名次 | 原榜型号 | 原始成绩 | 代表配置 |
|---|---|---|---|
| 1 | anthropic/claude-opus-5-5Anthropic | 30.4% | xHigh 推理 |
| 2 | anthropic/claude-opus-5Anthropic | 28.5% | Max 推理 |
| 3 | anthropic/claude-fable-5-1Anthropic | 28.0% | Max 推理 |
| 4 | openai/gpt-6-astraOpenAI | 27.6% | Max 推理 |
| 5 | openai/gpt-5.6-lunaOpenAI | 22.6% | Max 推理 |
| 6 | meta/muse_spark_1_3_maxMeta | 20.5% | Max 推理 |
| 7 | openai/gpt-5.6-solOpenAI | 20.0% | Max 推理 |
| 8 | zai/glm-5.3Z.ai | 20.0% | Max 推理 |
| 9 | google/gemini-3.8-flashGoogle | 18.8% | High 推理 |
| 10 | kimi/kimi-k3Moonshot AI | 18.2% | Max 推理 |
| 11 | deepseek/deepseek-v4-pro-0813DeepSeek | 17.5% | Max 推理 |
| 12 | deepseek/deepseek-v4.1-flashDeepSeek | 16.4% | High 推理 |
| 13 | zai/glm-5.3-flashZ.ai | 16.0% | Max 推理 |
| 14 | openai/gpt-5.6-terraOpenAI | 14.8% | Max 推理 |
| 15 | grok/grok-4.6xAI | 14.8% | High 推理 |
| 16 | mistralai/mistral-large-4Mistral AI | 14.3% | High 推理 |
| 17 | anthropic/claude-sonnet-5Anthropic | 13.8% | Max 推理 |
| 18 | alibaba/qwen3.8-maxAlibaba | 12.8% | 来源默认配置 |
| 19 | minimax/MiniMax-M3MiniMax | 9.2% | 来源默认配置 |
| 20 | thinkingmachines/inklingThinking Machines Lab | 7.3% | 来源默认配置 |
| 21 | google/gemini-3.1-pro-previewGoogle | 6.7% | High 推理 |
评测局限与数据署名
版本 1.0;连续开发总体成绩。 缺测留空;回退成绩计入并标注,受影响题目过半不计。
数据许可:官方公开结果;公开再展示保留官方署名,完整再分发授权仍以 Vals 条款为准
成绩由 Vals AI 发布。各项评测的原始分数尺度不同,不能直接相加;AIHOT 按公开规则把它们换算到同一条能力刻度上。