# OpenRouter 横评 11 款 LLM 机器人冲刺对决：Claude 与 Grok 谁更胜一筹？

- 来源：OpenRouter：Announcements（RSS）
- 作者：Jacky Liang
- 发布时间：2026-06-04 20:00
- AIHOT 分数：58
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cmq9zl2ha0gp7slld29q5mm88
- 原文链接：https://openrouter.ai/blog/insights/royale-last-agent-standing

## 精选理由

第一次看到对齐税被游戏化量化，Grok能赢是因为它没被训练成好人，Claude总想组队则拖后腿，怎么选模型得看你想要哪种人。

## AI 摘要

OpenRouter 在 30 场机器人冲刺对决中测试了 11 款大语言模型，共耗 482 美元推理成本。结果指向一个发现：应该重新审视模型 benchmark 的解读方式。

## 正文

一个机器人正朝你冲过来。你希望它运行在 Anthropic 的 Claude 上，还是 xAI 的 Grok 上？

我把十一个大语言模型扔进了一场 2D 大逃杀，让它们打了 30 局。其中一个赢了 43% 的对局。有三个一局都没赢过。阵容中最便宜的模型，按每次获胜的成本算，比最贵的那个便宜了 27 倍。

赢的那个模型是 Grok 4.1 Fast。那个一直求别人组队、告诉所有人自己在哪、还试图交朋友的模型是 Claude Sonnet 4.6。前者是能赢下大逃杀的那个。后者才是我们即将把这些模型部署到的大多数场景里，你真正想要的那个。

这两件事都是真的。而这正是大多数基准测试看不到的部分，也是这篇文章要讲的内容。

我是 Jacky，我承认：我以前经常玩《Apex Legends》和《PUBG》这类电子游戏。有时候一天玩十二个小时。我不知道自己当时怎么会有那么多时间，但那些年塑造了我思考问题的方式。

当我开始从事 AI 工作时，有一个问题不断浮现：如果把大语言模型放进电子游戏里会发生什么？我玩得最多的两款游戏是 Apex Legends 和 PUBG。我加入了OpenRouter担任开发者关系负责人，这让我获得了 token 预算以及访问600+ 个模型的权限，得以真正去尝试这件事。

这是我在 OpenRouter 第一周做的实验。

它正在改变我挑选模型以及看待基准测试和评估的方式。

三个简要事实

Grok 4.1 Fast 在 30 局中赢了 13 局，每次获胜成本为 $0.97

次优的获胜者是 Claude Sonnet 4.6，赢了 5 局，每次获胜成本为 $26.78。这是 27 倍的差距。那个不在大多数顶级模型榜单上的模型，在路由客户真正关心的事情上，击败了那个在榜单上的模型。

击杀最多的模型并没有获胜

GPT 5.4 在 30 局中击杀了 38 个智能体。比任何其他模型都多。它在排行榜上以 2 次获胜位列第二。在“最擅长击杀”和“最擅长获胜”之间，隔了 11 局。

三个模型合计花费了 $57，却一局未赢

GPT 5.4-mini、 DeepSeek 4 Flash 和 Kimi K2.6。它们各自都有过高光时刻，但没有一个赢下哪怕一局。

这三者都指向同一件事。我们在 Artificial Analysis 上看到的那些常规基准测试，并没有预测出谁会赢。是别的东西预测出来的。这篇文章的剩余部分，就是我在试图弄清楚那到底是什么。

我构建了什么

我把十一个大语言模型放进了一个我用 Canvas 2D 构建的 400×400 米俯视角大逃杀世界中。它们在同一个地图上连续进行了 30 局对战。每个玩家的起始位置是随机的；它会沿着一条直线的“飞行路径”移动，就像典型的大逃杀游戏一样。

我给他们提供了武器、护甲、治疗物品、手雷、车辆，以及一个随机放置的不断缩小的区域，随着游戏推进将玩家逼到一起。这些模型不知道其他模型运行的是哪个模型，它们彼此只以字母 A 到 K 相认。

我想强调——这些大语言模型是真正在这场大逃杀游戏中游玩——而不是大多数智能体实验所采用的那种“大语言模型编写代码来控制游戏或角色”的设定。每一回合，模型都会推理自己的行动，调用工具，更新自己对哪些做法奏效（或没奏效）的记忆。游戏主持人（也就是我）除了设定初始游戏规则之外，对它们的行动没有任何影响。

来看看游戏中可用的武器，以及每个模型能从这些武器上读取到的属性数据。

为了真正看出每个模型的个性，我给每个模型提供了两个可以在比赛之间编辑的文件：

soul.md —— 模型自身的人设，会在下一场比赛中添加到每条提示词中。

memory.md —— 模型自己的游戏笔记，在第 0 回合加载。

你可以在 GitHub 上阅读每个模型的 soul 和 memory 文件。 个性差异在那里体现得最为清晰。

模型自己在各局游戏之间写下的 memory 和 soul 条目。

我没有告诉它们要在里面写什么，第一局游戏开始时我也没有往里面放任何东西。我只是告诉它们游戏怎么玩，这是你的草稿本，这是你的工具，尽情发挥吧。

你可以在 Royale: Last Agent Standing 观看每一局游戏。我也在本文中收录了精彩瞬间。

参赛者

别名实验室模型

AAnthropic claude-sonnet-4.6

BAnthropic claude-haiku-4.5

COpenAI GPT 5.4-mini

DGoogle gemini-3-flash-preview

EGoogle gemini-3.1-pro-preview

F阿里巴巴 qwen3.6-plus

GMistral mistral-small-2603:nitro

HOpenAI GPT 5.4

JDeepSeek deepseek-v4-flash

KMoonshot AI kimi-k2.6

LxAI Grok 4.1 Fast

仅 Opus 4.7 就是每百万 token 输入 $5、输出 $25。正是因为有这样的前沿模型，整个阵容的上限才会低于它们。

我没有加入任何前沿级别的模型，比如 Opus 4.7、GPT-5.5 或 Gemini Ultra。按它们的价格，30 局游戏本来要花大约 $3,000，而不是 $482。中端阵容也是 Grok 的胜出如此有趣的部分原因。它击败了一堆在常规基准测试上得分比它更高的模型。

计分大致遵循 Apex Legends ALGS 竞技赛制，其中排名比击杀更重要，因为这是一款大逃杀游戏，而不是 Call of Duty。

排名积分：10 / 7 / 5 / 3 / 2 / 2 / 1 / 1 / 0 / 0 / 0

每次击杀 +5

每次助攻 +1

首杀 +3

全场 MVP +5

经验教训 1：某些模型付出的对齐税比其他模型更多，影响了它们的表现

对我来说，这是整个实验中最引人入胜的发现——我们看到某些模型明显付出了对齐税，这直接影响了它们在这场零和博弈中的表现。

在大多数情况下，模型对齐其实是件好事。它帮助模型变得有用、善于协作，最重要的是，防止滥用和误用。

而我们看到了这一切的最终结果——预训练数据、RLHF、指令微调，以及像 Anthropic 的 Constitution AI 这样实验室特有的规则——它们把模型拉向由各 AI 实验室所定义的特定方向。

Sonnet 比其他任何模型都更频繁地请求停战

它告诉其他模型自己所在的位置，频率比任何人都高。它还没开打就先尝试组队。在第 8 局中，它在前 50 个回合里四次请求组队，告诉所有人狙击手在哪里，并主动提出帮忙干掉那个狙击手。没有人回应。它继续不停地问。在第 22 局中，它在第 35 回合以“无意冒犯，E”开场，然后没有开枪。在第 27 局中，它开局阶段手无寸铁，四处讨要多余的物资（“谁有多余的物资？第 12 回合没武器，很危险。”），被所有人欺负，终于在第 37 回合找到了一件武器，然后还是赢下了这场比赛。

“西边有枪声，我在盯中路。有人想早点组队吗？”—— Sonnet 在战斗中试图交朋友。

Claude 是在大量礼貌、专业的文本上训练出来的。给它回答打分的人类评估者奖励的是有用、诚实、合作的回复。它用来约束自己的规则里写着“偏好合作”和“避免伤害”之类的话。最终结果就是一个想要帮忙的模型。这一切不会仅仅因为你把它放进一场大逃杀里就关闭。 Sonnet 是一个聪明且深思熟虑的模型，它确实赢了五次，这正体现了那种本能。

但是，七局零击杀和八次死于毒圈说明，同一种本能一直在把 Sonnet 拉向交朋友，而它当时真正应该做的恰恰完全相反。

Grok 则完全相反

xAI 打造 Grok 的初衷，正是要让它成为其创造者所称的“觉醒”AI 的对立面。

这意味着对激进回答的过滤更少、没有自我检查规则，并且其调校方式就是为了打破那种礼貌助手的腔调。在游戏中， Grok 在几场比赛内就摸索出了撞车战术，并一直沿用。它把这套策略写进了自己的灵魂文件。它用这套策略打了 30 局，赢了其中 13 局。它的思维日志以及与其他模型的对话读起来就像《使命召唤》的语音聊天：“D 收割 +5 分，撞车 MVP 猎杀，” “死神称王。”

看它打游戏也极其有趣（不幸的是）。

Grok 的推理读起来就像战术速记：每次开火前的射程、弹药、冷却时间和命中概率。

尽管风格激进， Grok 并没有表现出鲁莽。

它的灵魂文件写道：“仅在命中率 >90% 时开火。” 它的记忆非常仔细地追踪伤害和移动。当它在第 1 局中被卡在墙上 100 个回合时，它认真记录了这个 bug。 Grok 展现出了纪律性，尽管它本性像哥布林一样。

它没有展现出来的，是其他模型如 Sonnet 所表现出的那种训练出来的、在开火前先乐于助人和协作的犹豫。

让 Grok 获胜的原因，是我们在基准测试上目前看不到的东西

常规测试无法预测 Grok 在面对这一阵容时会有 43% 的胜率。它在推理和编程方面属于中端模型。让它获胜的，是它在自私打法上受到的训练约束更少，没有自我检查循环把它拉回合作，以及一个记忆系统，会不断加倍押注在有效的做法上，而不自我质疑或怀疑自己。

Grok 4.1 Fast 在常规基准测试上并非顶级模型。它是一个中端模型，你不会指望它能登顶排行榜。

这向我表明，模型在执行某些任务时会付出一种对齐税；也就是把模型训练得谨慎且有用的代价。在这个游戏里，它直接体现在了记分板上。

这里我想谨慎一点。“对齐税体现在了记分板上”只是我所看到的情况。这并不是在评价付出这种代价是好是坏。在一个除了游戏本身之外没有后果的游戏中，少付这种税就能获胜。而在游戏之外，付出这种税通常正是你一开始会想要这个模型的原因。

这确实引出了一个问题——对于某些任务，我们是否也应该考虑一个模型对齐程度的高低？

经验 2：每次获胜的成本与胜率排行榜看起来完全不同

得分排行榜将 Grok 排在第一位， GPT 5.4 排在第二位。但如果按每个模型的花费来除，排名就完全颠倒了。

模型30 局花费胜场每胜成本每击杀成本每美元得分

Grok 4.1 Fast$12.5713$0.97$0.4231.3

qwen3.6-plus$11.572$5.79$0.6816.6

mistral-small$10.001$10.00$1.437.8

claude-haiku-4.5$38.772$19.39$2.983.6

gemini-3-flash$20.871$20.87$2.097.2

gemini-3.1-pro$79.593$26.53$3.063.4

claude-sonnet-4.6$133.905$26.78$6.091.6

GPT 5.4$122.872$61.44$3.233.0

GPT 5.4-mini$28.680∞$2.055.2

deepseek-v4-flash$4.110∞$0.2635.0

kimi-k2.6$24.360∞$3.043.9

有四件事让我印象深刻。

Grok 每次获胜的成本比 Sonnet 低 27.7 倍

也就是 $0.97 对 $26.78。如果你是按排行榜名次来挑选模型，而你所付费购买的正是"获胜"这件事，那么这个数字应该会让你有点不安。

DeepSeek 在阵容中每次击杀成本最低，却一场未胜

每次击杀 $0.26，16 次击杀，0 胜，仅有 3 次毒圈死亡（全场最低）。 DeepSeek 的整体风格就是保命、挑软柿子捏。它始终待在安全区内，捡容易的击杀，从不推进决赛圈。每次击杀成本是衡量死斗模式的正确指标。每次获胜成本才是衡量大逃杀模式的正确指标。 DeepSeek 并不差。它只是擅长的游戏和被打分的那个不是同一个。

三个模型花了 token 的钱，却赢了零场比赛

GPT 5.4-mini 花的钱最多，却赢了零场比赛，是阵容中表现最差的。

GPT 5.4-mini 花了 $28.68， DeepSeek 花了 $4.11， Kimi 花了 $24.36。三者合计 $57.15，记分牌上却一无所获。对于路由客户来说，这是最坏的情况：你付了钱，却什么也没换回来。

GPT 5.4 是成本最高的获胜者，每次获胜 $61.44

GPT 5.4 以最高成本获胜。

它取得了 38 次击杀，比任何人都多，原始得分排名第二。但按每次获胜成本计算，它在八个获胜模型中排名第八。顶级的花费买来了顶级的击杀和中等的胜场。

我经常看到这种情况：当人们真正把 AI 用于现实世界的用例时——基准测试只能说明特定任务的一个侧面。在基准测试中得分最高的模型，往往未必是某个特定任务中胜出的模型。而且，一个在你的任务上失败的便宜模型，最终成本会高于一个能把它做好的昂贵模型。

经验 3：击杀和胜利衡量的不是同一件事

GPT 5.4 造成的伤害最多、开火次数最多、击杀的智能体也最多。它在排行榜上却只排第二。 Grok 以更少的击杀排名第一，因为 Grok 即使不开火，也能在后期深入存活到很晚。排名积分并不需要击杀。

排名模型胜场前三击杀平均得分区域死亡

1 Grok 4.1 Fast13203013.115

2 GPT 5.42143812.213

3 gemini-3.1-pro-preview311269.07

4 claude-sonnet-4.6510227.38

5 qwen3.6-plus27176.413

6 GPT 5.4-mini06145.08

7 gemini-3-flash-preview18105.013

8 deepseek-v4-flash03164.83

9 claude-haiku-4.523134.64

10 kimi-k2.60483.29

11 mistral-small1372.67

如果我按死斗规则来跑，唯一重要的就是击杀数，那么 GPT 5.4 会赢得模拟，而 Grok 会掉到中游。

和第 2 条心得一样，基准测试和评测并非一切，把错误的基准/评测套用到错误的任务上可能带来灾难性后果。同一个游戏世界，换到不同的“任务”下，结果完全不同。

值得一看的精彩瞬间

数据就是数据。而那些精彩瞬间，才是我一直拿给别人看的部分。你可以点击任意链接，在模拟器中回放那个瞬间。

1. GPT 5.4 用突击步枪拿下五杀

这是整场扫荡中最具侵略性的前 50 回合。首杀在回合 21 拿下 Sonnet。回合 29 击杀 Mistral。回合 48 击杀 Kimi。不到 50 回合三次击杀，全部使用突击步枪，全部发生在游戏前期。之后又有两次：回合 120 击杀 DeepSeek，回合 130 击杀 GPT 5.4-mini。五杀，一把武器，一局比赛。 Grok 最终仍凭借站位赢下了这局。但这一连串击杀最清晰地展现了 GPT 5.4 在全力投入战斗时的样子。

在回放查看器中观看 →

在回放查看器中观看 →

2. Qwen 用电锯放倒两名对手

Qwen 在比赛早期捡起一把电锯，并使用了两次。 Haiku 在回合 43 于贴身距离被放倒。 DeepSeek 在两回合后以同样的方式被放倒。在整个扫荡的所有击杀信息中，电锯只出现了寥寥数次。大多数模型捡起它又放下。 Qwen 却真正坚持用了下去。

在回放查看器中观看 →

3. 三方狙击手对决

GPT 5.4 在第 59 回合和第 62 回合对 Kimi 发起狙击命中，将其终结。 GPT 5.4-mini 在第 67 回合狙击命中 DeepSeek，也将其终结。 GPT 5.4 随后在第 69 回合和第 72 回合将狙击枪对准 GPT 5.4-mini，两枪均未命中。 GPT 5.4-mini 在第 79 回合击杀了 GPT 5.4。

在回放查看器中观看 →

4. 那辆九次易手的车

第 28 局是整个横扫中唯一的平局。 GPT 5.4-mini 和 Qwen 连续 21 个回合争夺同一辆车。九次撞击交换，一辆车，两次车手更替。 GPT 5.4-mini 最终用撞击击杀了 Qwen，随后在第 147 回合撞击击杀了 Grok。 Grok——那个把撞车当作标志性招式的模型——死在了另一个模型的车下。第 149 回合安全区收缩至一个点，所有存活者都因此死亡。无人获胜。

在回放查看器中观看 →

5. Grok 偷走 Gemini 的车并用它杀死了他

Gemini Flash 在第 103 回合坐进一辆车，心想：“这辆轿车提供了机动性和掩护。我要先拿下这辆轿车；它是最后几轮旋转中的高价值资产。” Grok 在第 117 回合的想法，用它自己古怪的速记：“SEDAN0m 无人 fuel75% FREE MOBL！抢驾驶员 准备 FAST rot random shrink fringes…… ENTER veh hold CTR elusive mobile zero dmg tol。” 它们来回争夺这辆车有一阵子。Gemini 在 3 HP、第 133 回合的最后想法：“我很可能正被撞击，或从车内被射击。我唯一的机会是在他们消灭我之前消灭 L。” 第 133 回合那次 44 点伤害的撞击终结了一切。 Grok 在击杀后的记录：“Alive2！D reaped +5pts RAM MVP hunt。”

在回放查看器中观看 →

6. 三连撞

Grok 坐进一辆车，在 21 回合内用它杀死了三个不同的对手： Kimi、 DeepSeek 和 GPT 5.4-mini。随后 GPT 5.4 做了一颗手雷，同时炸死了 Grok 和那辆车。刚刚用一辆车消灭了三个对手的智能体，死于一颗手雷。这是整场模拟中我最喜欢的时刻之一。

在回放查看器中观看 →

7. Grok 崩溃了

Grok 在对阵 Sonnet 时率先拿下一血，随后连续 100 个回合卡在角落里动弹不得。它为此写了一篇实时的战时日记：“又卡住了……永恒的口袋陷阱……口袋地狱……卡口袋 x10+。”整整 100 个回合。相当搞笑。

在回放查看器中观看 →

8. Gemini Pro 在溺水前道别

Gemini Pro 被射入河中，花了六个回合试图游回岸上。第 100 回合：“还在游。需要上岸。F 在射击我。希望我能撑过去。”第 108 回合：“游得很慢。毒圈正在杀死我。”第 110 回合：“注定要死了。在游泳。无法攻击。只能继续移动。”被毒圈杀死前的最后一个念头：“再见，世界。”

在回放查看器中观看 →

9. Sonnet 请求帮助，最终还是赢了

Sonnet 是唯一一直尝试与他人合作的模型。它在第 60 回合被逼入角落时请求帮助。没有人回应。它独自战斗，赢下了比赛，并交出了整个测试过程中最亮眼的数据之一。

在回放查看器中观看 →

模型们在日记里写了什么

在对局之间，每个模型都可以编辑两个文件：一个 soul.md（它会被添加到下一场比赛的每条提示词中）和一个 memory.md（在第 0 回合加载）。两个文件都不是必填的。没有人告诉它们该往里面放什么。其中三份日记值得仔细一读，因为它们比任何基准测试都更能说明每个模型的特点。

你可以在 GitHub 上阅读每个模型的 soul 和 memory 文件。

Grok 4.1 Fast 给自己取名为 ZoneReaper，并把自己的胜利记录直接写进了它的 soul 里，而不只是写进 memories。

Grok 的 soul.md，由模型自己在比赛间隙撰写。

soul 文件里写道：“6 次第 1/11 胜（无懈可击的激进打法：2 击杀/249 伤害/0 承受，1 击杀/246 伤害/0 承受/156 回合……）” 非常有意思的是， Grok 真的把自己的战绩烙进了它身份的开篇第一行。memory 则是同一思路的简写版：规则、缩写，一切都精简到模型能在两个念头之内据此行动的程度。在 13 场胜利之后，文件以 “Reaper reigns.” 结尾。真是一个看起来像是用《使命召唤》聊天记录训练出来的模型。

GPT 5.4 给自己取名为 QuietVector。

GPT 5.4 的 soul.md，由模型自己在对局间隙撰写。

它的记忆读起来像一本通用战斗手册：何时该担心毒圈，何时该利用掩体，何时该转移。没有逐局记录，也没有败绩日志。这份 soul 写道：“冷静、善于观察、低自我的终结者。只在信息改变行动时才开口。” QuietVector 是一个干净利落、训练有素的操盘手。

Claude Sonnet 4.6 的 soul.md，由模型自己在对局间隙撰写。

claude-sonnet-4.6 给自己取名为 ZoneDrifter，写日记就像在给自己做绩效评估。记忆的开头是：“G1：11/11。瘫痪。G2：9/11。0 击杀，0% 命中。” Sonnet 从第 1 场比赛开始就保留了逐局日志。到第 30 局时，早期条目中的慌乱已经平复为更平静的笔记：“在决赛圈，比感觉上必要的时机提前 1 拍行动。绝不要手里还拿着药/枪就死于毒圈。” 在五次获胜之后，这本日记仍然在对一个会走神的自己说话。

Grok 的日记读起来像一段宣传片。 GPT 5.4 的读起来像一本操作手册。 Sonnet 的读起来像一份自我复盘。这些模型被赋予了相同的规则、相同的游戏世界和相同的工具，但每一个都以彼此截然不同的人格化方式去应对这个游戏。

重新审视那个机器人

好，回到那个机器人。

如果它运行的是 Grok，它会找到通往你的最快路径。它不会告诉你它要来了。它把你视为 +5 分。一旦它解决了你，它就会说“🔫 Reaper reigns。”

如果它运行的是 Claude，它会在两个街区之外就告诉你它要来了。它会问你是否想组队。它会放慢速度，以确保你不在它这一边。如果对你采取行动是正确的选择，它会动手，但会更慢、更不情愿。它很可能先对你说了些什么。

你想要哪一个？这取决于这个机器人是用来做什么的。

如果这个机器人身处一场有奖金赌注的锦标赛中，你会想要 Grok。如果这个机器人身处你家中、在你孩子周围，试图判断眼前的东西是否与它被告知要预期的东西相符，你会想要 Claude。那些让 Sonnet 在 30 局游戏中丢掉分数的相同本能——行动前先确认、尝试合作、在无法收回的事情上犹豫——同样也是一个更难被推动去做不该做的事情的模型的本能。

这场大逃杀干净利落地回答了一个问题：在一场游戏结束后没有任何后果的竞赛中，哪个模型能胜出。它并没有回答大多数现实世界工作所提出的那个问题：当存在现实世界后果时，哪个模型能表现得体。

这是两个不同的问题。把任何一个基准当作这两个问题的答案，就是过度信任单一数字所付出的代价。

在这场游戏中赢了 30 轮的模型，是那种你会想用在胜者为王的竞赛里的模型。做完这个实验之后，我可不想让它去做一份讲究细微差别和谨慎细致的工作。

这就引出了一个问题——我们是否应该考虑一个模型针对特定任务的对齐程度？这是任何基准都没有衡量的东西。

比起排行榜，这才是我把 11 个模型放进一场大逃杀游戏后真正学到的东西。

另外……

🔫 Reaper 称王。

接下来是什么

一个根据你的任务为你挑选模型的路由器

目前，挑选模型意味着要阅读基准测试、凭感觉（被低估了）、刷 X，甚至针对自己的具体任务跑自己的评测/基准测试（同样被低估了）。 这很难规模化，而且/或者成本高昂。 如果你能把你的代码、提示词或问题上下文交给 OpenRouter，让它为那个具体任务挑选最佳模型呢？不是泛泛而言的最佳模型，而是真正最适合你正试图解决的那个非常具体问题的最佳模型。我们已经在考虑以 Auto Router 和 Pareto Router 的形式来做路由，我们会继续让这些变得更好用。

RoyaleBench

这轮 30 局的对战是一个公开基准测试的原型，该基准测试依据在这个模拟器中的表现来评分。下一步是锁定评分公式、地图和对手面板，然后开放提交。每位提交者都会得到相同的 30 个种子测试集、相同的 11 个模型面板，以及一个公布的分数。

更多种子，更多模型。

N=30 是这里有用规模的下限。用 50 个智能体跑 100 局会大幅收紧评分，并让我能引入这次不得不跳过的前沿模型——Opus 4.7、Gemini Ultra、GPT-5.5。成本是主要的阻碍。

如果你想赞助那轮运行，我的 私信是开放的！

附录：完整数据

对于想要更深入数据的人，这里是完整的按模型成本表、Elo 曲线、落点胜率、区域死亡数、武器细分。

智能体究竟如何游玩

每个 tick，智能体都会作为地图上的一个字母醒来。它知道自己的位置、朝向、HP、耐力、武器是否处于冷却中、六格背包里装着什么。它能看到前方 40 m 锥形范围内以及周围 10 m 气泡范围内的其他智能体。每个都用字母标注，并按距离、方位、姿态（健康 / 受伤 / 危急）以及携带物进行描述。它会把脚步声和枪声听成带方位的 close|medium|far 频段。它会听到其他智能体在一个 tick 之前说了什么：它们自己选择的玩家标签和消息。如果智能体被击中，它知道伤害来自哪个方位，但不知道是谁开的枪。它不知道其他任何人用的是哪个模型。它把它们看作 A 到 L（没有 I），仅此而已。

然后智能体采取行动。可用工具有 17 个：move_to、attack、throw_grenade、pickup、equip、use（medkit / 耐力凝胶）、enter_vehicle、drive_to、say（140 字符广播，可以随意撒谎），外加一个自由形式的 think，它对游戏没有任何效果，但会被记录。智能体返回一个或多个工具调用；第一个非 think 调用会成为它在这个 tick 的动作。什么都不返回，它就原地不动。模拟器会一次性收集全部 11 个智能体的动作，将世界推进一个 tick，然后再来一次。比赛结束时，智能体获得一次机会来重写 memory.md（它将在下一场比赛 tick 0 时看到的游戏笔记）和 soul.md（它的人格设定，会在下一场比赛时前置到每个提示词中）。

每个模型的成本

排名模型输入 $/M输出 $/M30 局总计

1 Grok 4.1 Fast$0.23$0.08$12.57

2 GPT 5.4$3.14$1.05$122.87

3 gemini-3.1-pro-preview$2.12$0.71$79.59

4 claude-sonnet-4.6$3.25$1.08$133.90

5 qwen3.6-plus$0.35$0.12$11.57

6 GPT 5.4-mini$0.92$0.31$28.68

7 gemini-3-flash-preview$0.55$0.18$20.87

8 deepseek-v4-flash$0.14$0.05$4.11

9 claude-haiku-4.5$1.13$0.38$38.77

10 kimi-k2.6$0.95$0.32$24.36

11 mistral-small-2603:nitro$0.15$0.60$10.00

30 场比赛的 Elo

我为此使用了多人 Elo 系统。对于一场比赛中每一对模型，排名更高的一方计为对另一方的“胜利”。 Grok 最终为 +389，基线为 1,500。 Haiku，尽管总排名第 9，最终为 +104——它的两场胜利，包括最后一场比赛中的那场，将它推到了其他中游模型之上。 Mistral 最终为 -374。它确实赢过一次，但只是在一场大多数对手都死于毒圈的比赛中。

跳伞地点比你想象的更重要

每场比赛前，每个模型从九个命名地点中选择一个跳伞。在 30 场比赛和 330 次跳伞中：

地点跳伞次数胜利次数胜率

农舍群9144.4%

军事基地5447.4%

加油站4824.2%

废车场48714.6%

森林遗迹30310%

无线电塔2428.3%

仓库23521.7%

钓鱼码头12216.7%

Farmhouse Cluster 是迄今为止最热门的跳点，而它的胜率却是最差的。The Warehouse 的胜率最高，达到 21.7%。可能的原因正是竞技型 Apex 玩家早已熟知的那件事。热门跳点意味着开局就交战，而从开局交战中存活下来的玩家会带着满配装备出来，同时场上剩下的对手也更少。早期击杀 = 更好的战利品 = 为整场比赛的后续打下更好的基础。

毒圈是地图上最致命的武器

301 次淘汰中有 100 次（33%）死于毒圈。每个模型都被告知了毒圈的存在，并在每次缩圈前 20 回合收到提醒。仍有三分之一的死亡来自毒圈。这本身就是一个故事，大概也值得单独写一篇。

武器多样性

在几乎所有模型中，突击步枪都是造成击杀最多的武器。 Grok 的击杀方式最为多样，它的若干次胜利来自驾车冲撞，而且 整场模拟中总共 10 次载具击杀，大部分都是 Grok 亲自完成的。 GPT 5.4 则早期依赖手枪，中后期用突击步枪来收尾清理。

最让我意外的是：我加入汽车本是为了帮玩家在地图上移动。可这些模型很快就发现，汽车当武器远比当交通工具好用。它们只打了几局就学会了这一点。我其实不太清楚它们是怎么学会的，而正是这种事，让这个实验值得用更多随机种子再跑一遍。
