← 评测来源
TapTap Maker / 编程
官方评测 ↗TapTap Maker Benchmark
在真实游戏引擎里用 Lua 写出能跑起来的功能。分数由引擎执行判定,不用另一个模型打分。
在 AIHOT 中参与排名
证据预算3.6%
上游数据时间09/07 08:00
最近成功同步09/10 06:31
它测什么,怎么测
只取官方 main_board 的 L2 通过率;成本、速度、Held-out 和分类分不再次投票。同一基础模型按固定推理档位优先级选代表行,选择不看分数。
如何使用这份证据
编程与设计预算中的 3.6%;固定引擎和 L2 指标。
评测成绩
按固定规则,每个公开模型采用一套代表配置。匿名测试型号不展示,保留原榜名次,每项最多 30 个。
| 原榜名次 | 原榜型号 | 原始成绩 | 代表配置 |
|---|---|---|---|
| 1 | claude-fable-5-1Anthropic | 90.5% | High 推理 |
| 2 | claude-fable-5Anthropic | 89.0% | High 推理 |
| 3 | gpt-6-astraOpenAI | 88.9% | xHigh 推理 |
| 4 | claude-opus-5Anthropic | 88.9% | xHigh 推理 |
| 6 | grok-4.6@xhighxAI | 87.3% | xHigh 推理 |
| 7 | gemini-3.8-flashGoogle | 86.8% | High 推理 |
| 8 | gpt-5.6-solOpenAI | 86.5% | xHigh 推理 |
| 11 | glm-5.3Z.ai | 83.6% | Max 推理 |
| 12 | qwen3.8-max-0902Alibaba | 83.3% | xHigh 推理 |
| 13 | claude-opus-4-8Anthropic | 82.8% | xHigh 推理 |
| 14 | qwen3.8-maxAlibaba | 82.5% | xHigh 推理 |
| 15 | qwen3.8-flashAlibaba | 82.5% | xHigh 推理 |
| 16 | gpt-5.6-terraOpenAI | 81.8% | xHigh 推理 |
| 17 | glm-5.3-flashZ.ai | 81.5% | Max 推理 |
| 18 | hy4-previewTencent | 81.0% | High 推理 |
| 19 | kimi-k3Moonshot AI | 79.7% | 来源默认配置 |
| 20 | grok-4.5xAI | 78.3% | High 推理 |
| 21 | gpt-5.6-lunaOpenAI | 77.8% | xHigh 推理 |
| 22 | deepseek-v4-proDeepSeek | 77.8% | 来源默认配置 |
| 23 | claude-sonnet-5Anthropic | 76.2% | xHigh 推理 |
| 25 | deepseek-v4-flashDeepSeek | 74.6% | Max 推理 |
| 26 | doubao-seed-evolvingByteDance | 72.8% | High 推理 |
| 27 | qwen3.8-27bAlibaba | 68.3% | xHigh 推理 |
| 28 | gemini-3.1-pro-previewGoogle | 64.7% | 来源默认配置 |
| 29 | MiniMax-M3MiniMax | 60.1% | 来源默认配置 |
| 30 | claude-haiku-4-5Anthropic | 43.6% | High 推理 |
评测局限与数据署名
单引擎、单语言,不能推广到其他技术栈;不同模型可能使用不同 agent 驱动;闭源 harness 不能逐题复算。
数据许可:官方公开结果;公开再展示保留官方署名,完整再分发授权仍以易玩/TapTap 条款为准
成绩由 TapTap Maker 发布,原始分数与 AIHOT 共识分使用不同尺度,不能直接相加。