OpenRouter 30 场 AI 大逃杀:11 个 LLM 对决,Claude 与 Grok 谁更优?

OpenRouter:Announcements(RSS)·2026-06-04 20:00·108天前·Jacky Liang
AI 导读

OpenRouter 展开了 30 场 AI 大逃杀式对比,涉及 11 个大语言模型,共消耗 482 美元推理费用。实验得出一个发现,该发现应改变用户阅读模型基准测试的方式。

OpenRouter:Announcements(RSS)
精选
75AI 编辑部评分,满分 100

OpenRouter 30 场 AI 大逃杀:11 个 LLM 对决,Claude 与 Grok 谁更优?

2026-06-04 20:00· 108天前· Jacky Liang
AI 导读

OpenRouter 展开了 30 场 AI 大逃杀式对比,涉及 11 个大语言模型,共消耗 482 美元推理费用。实验得出一个发现,该发现应改变用户阅读模型基准测试的方式。

推荐理由

这场大逃杀实验把模型对齐税摆上了台面,Grok因少斟酌、多行动而胜出,Claude的犹豫反而是现实场景里更需要的品质,选模型不能只看赢不赢,要看任务需要什么性格。

正文 · AI 翻译
A Robot is Sprinting Towards You: Do You Want it Running on Claude or Grok?

一个机器人正朝你冲过来。你希望它运行在 Anthropic 的 Claude 上,还是 xAI 的 L icon Grok 上?

我把十一个大语言模型扔进了一场 2D 大逃杀,让它们打了 30 局。其中一个赢下了 43% 的对局。有三个一局都没赢过。阵容中最便宜的模型,按每次获胜的成本计算,比最贵的那个便宜了 27 倍。

Watch a full game 1 match — Royale: Last Agent Standing

获胜的模型是 L icon Grok 4.1 Fast。那个不停请求其他所有人组队、告诉别人自己在哪里、试图交朋友的模型是 A icon Claude Sonnet 4.6。前者是能赢下大逃杀的那个。后者才是我们即将把这些模型部署到的大多数场景中真正想要的那个。

这两件事都是真的。而这正是大多数基准测试看不到的部分,也是这篇文章要讲的内容。

我是 Jacky,我承认:我以前玩过很多电子游戏,比如 Apex Legends 和 PUBG。有时候一天玩十二个小时。我不知道自己当时怎么会有那么多时间,但那些年塑造了我思考问题的方式。

当我刚开始从事 AI 工作时,有一个问题不断浮现:如果把大语言模型放进电子游戏里,会发生什么?我玩得最多的两款游戏是 Apex Legends 和 PUBG。我加入了OpenRouter担任开发者关系负责人,这让我获得了 token 预算以及访问600+ 个模型的权限,得以真正去尝试这件事。

这是我在 OpenRouter 第一周做的实验。

而这正在改变我挑选模型以及看待基准测试和评估的方式。

三个快速事实

  1. L icon Grok 4.1 Fast 在 30 局中赢了 13 局,每次获胜成本为 $0.97

    次佳的获胜者是 A icon Claude Sonnet 4.6,赢了 5 局,每次获胜成本为 $26.78。这是 27 倍的差距。那个不在大多数顶级模型榜单上的模型,在路由客户真正关心的事情上,击败了那个在榜单上的模型。

  2. 击杀最多的模型并没有获胜

    H icon GPT 5.4 在 30 局中击杀了 38 个智能体。比任何其他模型都多。它在排行榜上以 2 次获胜位列第二。从“最擅长击杀”到“最擅长获胜”之间隔了 11 局。

  3. 三个模型合计花费了 $57,却一局未赢

    C icon GPT 5.4-miniJ icon DeepSeek 4 FlashK icon Kimi K2.6。它们各自都有过高光时刻,但没有一个赢下哪怕一局。

这三者都指向同一件事。我们在 Artificial Analysis 上看到的那些常规基准测试并没有预测出谁会获胜。是别的东西预测出来的。这篇文章的剩余部分就是我在试图弄清楚那到底是什么。

我构建了什么

我把十一个大语言模型放进了一个我用 Canvas 2D 构建的 400×400 米俯视角大逃杀世界。它们在同一张地图上连续进行了 30 局游戏。每个玩家的起始位置是随机的;它遵循一条直线的“飞行路径”,就像典型的大逃杀游戏一样。

我为它们提供了武器、护甲、治疗物品、手雷、汽车,以及一个随机放置的不断缩小的区域,随着游戏进行将玩家们推向一起。这些模型不知道其他模型运行的是哪个模型,它们只把彼此看作字母 A 到 K。

我想强调——这些大语言模型是真正在这场大逃杀游戏中游玩——而不是大多数智能体实验所采用的那种“大语言模型编写代码来控制游戏或角色”的设置。每一回合,模型都会推理自己的行动,调用工具,更新自己对哪些做得好(或不好)的记忆。游戏主控(也就是我)除了设定初始游戏规则之外,对它们的行动零影响。

Weapons in the battle royale world, with an assault rifle tooltip showing range, damage, and accuracy stats 来看看游戏中可用的武器,以及每个模型能从这些武器上读取到的属性数据。

为了真正看出每个模型的个性,我给每个模型提供了两个可以在比赛之间编辑的文件:

  • soul.md —— 模型自身的人设,会在下一场比赛中被添加到每一条提示词中。
  • memory.md —— 模型自己的游戏笔记,在第 0 回合加载。

你可以在 GitHub 上阅读每个模型的 soulmemory 文件。 个性差异在那里体现得最为清晰。

Memory and soul file entries written by the models themselves between games 模型自己在各局游戏之间写下的 memory 和 soul 条目。

我没有告诉它们要在里面写什么,第一局游戏开始时我也没有往里面放任何东西。我只是告诉它们游戏怎么玩,这是你的草稿本,这是你的工具,尽情发挥吧。

你可以在 Royale: Last Agent Standing 观看每一局游戏。我也在本文中收录了精彩瞬间。

参赛者

别名实验室模型
AAnthropicA icon claude-sonnet-4.6
BAnthropicB icon claude-haiku-4.5
COpenAIC icon GPT 5.4-mini
DGoogleD icon gemini-3-flash-preview
EGoogleE icon gemini-3.1-pro-preview
FAlibabaF icon qwen3.6-plus
GMistralG icon mistral-small-2603:nitro
HOpenAIH icon GPT 5.4
JDeepSeekJ icon deepseek-v4-flash
KMoonshot AIK icon kimi-k2.6
LxAIL icon Grok 4.1 Fast

Claude Opus 4.7 pricing card: $5 per million input tokens, $25 per million output tokens 仅 Opus 4.7 就是每百万 token 输入 $5、输出 $25。正是因为有这类前沿模型,整个阵容的上限才被压在它们之下。

我没有加入任何前沿级别的模型,比如 Opus 4.7、GPT-5.5 或 Gemini Ultra。按它们的价格,30 局游戏本来要花大约 $3,000,而不是 $482。中端阵容也是 L icon Grok 的胜出如此有趣的部分原因。它击败了一堆在常规基准测试上得分比它更高的模型。

评分大致遵循 Apex Legends ALGS 竞技赛制,其中排名比击杀更重要,因为这是一款大逃杀游戏,而不是 Call of Duty。

  • 排名积分:10 / 7 / 5 / 3 / 2 / 2 / 1 / 1 / 0 / 0 / 0
  • 每次击杀 +5
  • 每次助攻 +1
  • 首杀 +3
  • 全场 MVP +5

经验教训 1:某些模型付出了比其他模型更多的对齐税,影响了它们的表现

对我来说,这是整个实验中最引人入胜的发现——我们看到某些模型明显付出了对齐税,这直接影响了它们在这场零和博弈中的表现。

在大多数情况下,模型对齐实际上是一件好事。它帮助模型变得有用、善于协作,最重要的是,防止滥用和误用。

而我们看到了这一切的最终结果——预训练数据、RLHF、指令微调,以及像 Anthropic 的 Constitution AI 这样实验室特有的规则——它将模型推向由 AI 实验室所定义的特定方向。

A icon Sonnet 比其他任何模型都更频繁地请求停战

它告诉其他模型自己所在的位置,比任何其他模型都更频繁。它还没开打就先尝试组队。在第 8 局中,它在前 50 个回合里四次请求组队,告诉大家狙击手在哪里,并主动提出帮忙干掉那个狙击手。没有人回应。它继续不停地问。在第 22 局中,它在第 35 回合以“无意冒犯,E”开场,然后没有开枪。在第 27 局中,它开局阶段一直没有武器,四处讨要多余的物资(“谁有多余的物资?第 12 回合还没武器,危险。”),被所有人欺负,终于在第 37 回合找到了一把武器,然后还是赢下了这场比赛。

Claude Sonnet 4.6 asking other players to team up early in a match “西边有枪声,我在盯中路。有人想早点组队吗?”——A icon Sonnet 在战斗中试图交朋友。

Claude 接受了大量礼貌、专业的写作训练。为它的回答打分的人类评估者奖励的是有用、诚实、合作的回复。它用来约束自己的规则写着“偏好合作”和“避免伤害”之类的内容。最终的结果就是一个想要帮忙的模型。这一切不会仅仅因为你把它放进一场大逃杀里就关闭。A icon Sonnet 是一个聪明且深思熟虑的模型,它确实赢了五次,正体现了这种本能。

但是,七局零击杀和八次毒圈死亡说明,同一种本能一直在把A icon Sonnet 拉向交朋友,而它当时真正应该做的恰恰完全相反。

L icon Grok 则完全相反

xAI 打造 L icon Grok 的初衷,正是要让它成为其创造者所称的“觉醒”AI 的对立面。

这意味着对激进回答的过滤更少、没有自我检查规则,并且经过专门调校,以打破那种礼貌助手的语气。在游戏中,L icon Grok 在几场比赛内就摸索出了撞车战术,并坚持使用。它把这一策略写进了自己的灵魂文件。它用这套策略打了 30 局,赢了其中 13 局。它的思维日志以及与其他模型的对话读起来就像《使命召唤》的语音聊天:“D 收割 +5 分 撞车 MVP 猎杀,” “死神统治。”

看它打游戏也极其有趣(不幸的是)。

Grok 4.1 Fast's reasoning panel in compressed shorthand, mid-kill L icon Grok 的推理读起来就像战术速记:每次开火前先看射程、弹药、冷却时间和命中概率。

尽管风格激进,L icon Grok 并没有表现出鲁莽。

它的灵魂文件里写着 “仅在命中率 >90% 时开火。” 它的记忆非常仔细地追踪伤害和移动。当它在第 1 局中被卡在墙上 100 个回合时,它认真记录了这个 bug。L icon Grok 展现出了纪律性,尽管它本性像个哥布林。

它没有展现出来的,是那种在开火前先表现得乐于助人、善于协作的训练出来的犹豫——而像 A icon Sonnet 这样的其他模型则表现出了这一点。

L icon Grok 获胜的原因,是我们在基准测试上目前看不到的东西

常规测试无法预测 L icon Grok 面对这套阵容能取得 43% 的胜率。在推理和编程方面,它只是一个中端模型。让它获胜的,是它在自私打法上受到的训练约束更少,没有自我检查循环把它拉回合作,以及一个记忆系统,会不断加倍押注有效的做法,而不自我质疑或怀疑自己。

Grok 4.1 Fast on Artificial Analysis: #6 of 216 on intelligence, intelligence index 39 L icon Grok 4.1 Fast 在常规基准测试上并非顶级模型。它是一个中端模型,你不会指望它能登顶排行榜。

这向我表明,模型在执行某些任务时会付出一种对齐税;也就是训练模型变得谨慎且有帮助所付出的代价。在这个游戏中,它直接体现在了记分牌上。

这里我想谨慎一点。“对齐税体现在了记分牌上”只是我所看到的情况。这并不是在评判付出这种代价是好是坏。在一场除了游戏本身之外没有后果的游戏中,少付税就能获胜。在游戏之外,付出这种代价通常正是你一开始想要这个模型的原因。

这确实引出了一个问题——对于某些任务,我们是否也应该考虑一个模型的对齐程度如何?

经验教训 2:每次获胜的成本看起来与胜率排行榜完全不同

得分排行榜将 L icon Grok 排在第一位,H icon GPT 5.4 排在第二位。但如果按每个模型的花费来除,排名就完全颠倒了。

模型30 局花费胜场每胜成本每击杀成本每美元得分
L icon Grok 4.1 Fast$12.5713$0.97$0.4231.3
F icon qwen3.6-plus$11.572$5.79$0.6816.6
G icon mistral-small$10.001$10.00$1.437.8
B icon claude-haiku-4.5$38.772$19.39$2.983.6
D icon gemini-3-flash$20.871$20.87$2.097.2
E icon gemini-3.1-pro$79.593$26.53$3.063.4
A icon claude-sonnet-4.6$133.905$26.78$6.091.6
H icon GPT 5.4$122.872$61.44$3.233.0
C icon GPT 5.4-mini$28.680$2.055.2
J icon deepseek-v4-flash$4.110$0.2635.0
K icon kimi-k2.6$24.360$3.043.9

有四点让我印象深刻。

L icon Grok 每次获胜的成本比 A icon Sonnet 低 27.7 倍

Grok 4.1 Fast shooting a Gemini 3 Flash Preview agent in the battle royale

也就是 $0.97 对 $26.78。如果你是根据排行榜名次来挑选模型,而这项任务你真正为之付费的是"获胜",那么这个数字应该会让你有点不安。

J icon DeepSeek 在阵容中每次击杀成本最低,却一场都没赢过

DeepSeek v4 Flash firing at Gemini 3 Flash Preview and missing both shots

每次击杀 $0.26,16 次击杀,0 胜,仅 3 次毒圈死亡(所有人中最低)。J icon DeepSeek 的整套风格就是保安全、挑软柿子打。它待在圈内,拿下容易的击杀,从不推进决赛圈。每次击杀成本是衡量死斗模式的正确指标。每胜成本才是衡量大逃杀模式的正确指标。J icon DeepSeek 并不差。它只是擅长的游戏和正在被计分的那款不一样。

三个模型花了 token 的钱,却赢了零场

GPT 5.4 Mini and Claude Sonnet 4.6 both missing shots in the battle royale C icon GPT 5.4-mini 花的钱最多,却赢了零场,是阵容中表现最差的。

C icon GPT 5.4-mini 花了 $28.68,J icon DeepSeek 花了 $4.11,K icon Kimi 花了 $24.36。三者合计 $57.15,记分板上却毫无收获。对于路由客户来说,这是最坏的情况:你付了钱,却什么都没拿回来。

H icon GPT 5.4 是每胜成本最高的获胜者,每胜 $61.44

GPT 5.4 (H) winning a match after eliminating Gemini 3.1 Pro Preview H icon GPT 5.4 以最高成本获胜。

它拿下 38 次击杀,比任何人都多,原始得分排名第二。但按每胜成本计算,它在 8 个获胜模型中排第八。顶级的花费买来了顶级的击杀和中等水平的胜场。

我经常看到这种情况:当人们真正把 AI 用于现实世界的用例时——基准测试只能说明特定任务的一个侧面。在基准测试中得分最高的模型,往往未必是某个特定任务中胜出的模型。而且,一个在你的任务上失败的便宜模型,最终成本会高于一个能把它做对的昂贵模型。

经验 3:击杀和胜利衡量的不是同一件事

H icon GPT 5.4 造成的伤害最多、开火次数最多、击杀的智能体也最多。它在排行榜上却只排第二。L icon Grok 以更少的击杀排名第一,因为L icon Grok 即使不开火,也能在后期深入存活到很晚。排名积分并不需要击杀。

排名模型胜场前三击杀平均得分区域死亡
1L icon Grok 4.1 Fast13203013.115
2H icon GPT 5.42143812.213
3E icon gemini-3.1-pro-preview311269.07
4A icon claude-sonnet-4.6510227.38
5F icon qwen3.6-plus27176.413
6C icon GPT 5.4-mini06145.08
7D icon gemini-3-flash-preview18105.013
8J icon deepseek-v4-flash03164.83
9B icon claude-haiku-4.523134.64
10K icon kimi-k2.60483.29
11G icon mistral-small1372.67

如果我按照死斗规则来跑,也就是唯一重要的只有击杀数,那么 H icon GPT 5.4 会赢得模拟,而 L icon Grok 会掉到中游。

与第 2 条心得相同,基准测试和评估并非一切,把错误的基准/评估应用到错误的任务上可能会造成灾难性后果。同一个游戏世界,在不同“任务”下会得到完全不同的结果。

值得一看的精彩瞬间

数据就是数据。而那些精彩瞬间才是我一直拿给别人看的部分。你可以点击任意链接,在模拟器中回放该瞬间。

1. H icon GPT 5.4 用突击步枪拿下五杀

整场横扫中最具侵略性的前 50 回合。首杀在回合 21 拿下 A icon Sonnet。回合 29 击杀 G icon Mistral。回合 48 击杀 K icon Kimi。不到 50 回合内三杀,全部使用突击步枪,全部发生在游戏前期。之后又添两杀:回合 120 击杀 J icon DeepSeek,回合 130 击杀 C icon GPT 5.4-mini。五杀,一把武器,一局比赛。L icon Grok 最终仍凭借站位赢下了这局。但这一连杀最能清楚地展现 H icon GPT 5.4 在全力投入战斗时的样子。

Watch the early triple-kill

在回放查看器中观看 →

Watch the late double

在回放查看器中观看 →

2. F icon Qwen 用电锯追杀两名对手

F icon Qwen 在比赛前期捡起一把电锯,并使用了两次。B icon Haiku 在回合 43 于近距离被击倒。J icon DeepSeek 在两回合后以同样的方式倒下。在整个横扫过程中,电锯只出现在少数几条击杀提示里。大多数模型捡起它又放下。F icon Qwen 却真正坚持用了下去。

Watch the chainsaw double

在回放查看器中观看 →

3. 三方狙击手对决

H icon GPT 5.4 在第 59 回合和第 62 回合对 K icon Kimi 发起狙击命中,将其击杀。C icon GPT 5.4-mini 在第 67 回合狙击命中 J icon DeepSeek,也将其击杀。H icon 随后 GPT 5.4 将狙击枪对准 C icon GPT 5.4-mini,在第 69 回合和第 72 回合开枪,两枪均未命中。C icon GPT 5.4-mini 在第 79 回合击杀了 H icon GPT 5.4。

Watch the sniper exchange

在回放查看器中观看 →

4. 那辆九次易手的车

第 28 局是整个横扫中唯一的一场平局。C icon GPT 5.4-mini 和 F icon Qwen 连续 21 个回合争夺同一辆车。九次撞击交易,一辆车,两次车手更替。C icon GPT 5.4-mini 最终用撞击击杀了 F icon Qwen,随后又在第 147 回合撞击击杀了 L icon Grok。L icon Grok——那个把撞车当作招牌招式的模型——死在了另一个模型的车下。第 149 回合安全区收缩至一个点,所有存活者都因此死亡。无人获胜。

Watch the nine-trade car fight

在回放查看器中观看 →

5. L icon Grok 偷走 Gemini 的车并用它杀死了他

D icon Gemini Flash 在第 103 回合坐进一辆车,心想:“这辆轿车既能提供机动性,也能提供掩护。我要先把这辆轿车占住;它对最后的轮转来说是高价值资产。” L icon Grok 在第 117 回合的想法,用它自己那套古怪的速记写成:“SEDAN0m 无人 燃料75% 空闲 可动!抢驾驶员 准备 快速 旋转 随机 收缩 边缘…… 进入 载具 保持 CTR 难以捉摸 机动 零伤害 容差。” 它们把这辆车来回抢了一阵。Gemini 在 3 HP、第 133 回合的最后想法:“我很可能正被撞击,或者从车内被射击。我唯一的机会是在他们消灭我之前先消灭 L。” 第 133 回合那次 44 点伤害的撞击终结了一切。L icon Grok 在击杀后的记录:“Alive2!D 收割 +5分 撞击 MVP 猎杀。”

Watch the car heist

在回放查看器中观看 →

6. 三连撞

L icon Grok 坐进一辆车,并在 21 回合内用它杀死了三个不同的对手:K icon Kimi、J icon DeepSeek 和 C icon GPT 5.4-mini。随后 H icon GPT 5.4 做了一颗手雷,把 L icon Grok 和那辆车同时炸掉。刚刚用一辆车消灭了三个对手的智能体,死在一颗手雷下。这是整场模拟里我最喜欢的时刻之一。

Watch the triple ram

在回放查看器中观看 →

7. L icon Grok 崩溃了

L icon Grok 在对阵 A icon Sonnet 时率先拿下一血,随后连续 100 个回合卡在角落里出不来。它还为此写了一篇实时战时日记:“又卡住了……永恒的口袋陷阱……口袋地狱……卡口袋 x10+。”整整 100 个回合。相当好笑。

Watch Grok freak out

在回放查看器中观看 →

8. E icon Gemini Pro 在溺水前道别

E icon Gemini Pro 被射入河中,花了六个回合试图游回岸上。第 100 回合:“还在游。需要上岸。F 在射我。希望我能撑住。”第 108 回合:“游得很慢。毒圈快把我耗死了。”第 110 回合:“没救了。在游泳。无法攻击。只能继续移动。”被毒圈杀死前的最后一个念头:“再见,世界。”

Watch Gemini drown

在回放查看器中观看 →

9. A icon Sonnet 求助后依然赢了

A icon Sonnet 是唯一一直试图与其他模型合作的模型。第 60 回合被逼入角落时它发出了求助。没有人回应。它独自作战,赢下了比赛,并打出了整轮测试中最好的数据之一。

Watch Sonnet win alone

在回放查看器中观看 →

模型们在日记里写了什么

在对局之间,每个模型都可以编辑两个文件:一个 soul.md(它会被添加到下一场对局的每个提示词中)和一个 memory.md(在第 0 回合加载)。两个文件都不是必填的。没有人告诉它们该往里面写什么。其中三份日记值得仔细一读,因为它们比任何基准测试都更能告诉你每个模型的真实面貌。

你可以在 GitHub 上阅读每个模型的 soulmemory 文件。

L icon Grok 4.1 Fast 给自己取名为 ZoneReaper,并把自己的战绩直接写进了 soul 文件,而不只是写进 memory。

Grok's soul.md: gamer tag ZoneReaper, persona "Shadowy fringe predator," doctrine including "Fire only >85% hit chance" L icon Grok 的 soul.md,由模型自己在对局之间撰写。

soul 文件写道:“6 次第 1/11 胜(完美激进:2 击杀/249 伤害/0 承受,1 击杀/246 伤害/0 承受/156 回合……)” 非常有意思的是,L icon Grok 真的把自己的数据烤进了它身份的开篇第一行。memory 则是同一思路的简写版:规则、缩写,一切都精简到模型能在两个念头之内采取行动的程度。在 13 场胜利之后,文件以 “Reaper reigns.” 结尾。真是一个看起来用《使命召唤》聊天记录训练出来的模型。

H icon GPT 5.4 给自己取名为 QuietVector

GPT 5.4's soul.md: gamer tag QuietVector, persona "Calm, observant, low-ego operator," doctrine including "Survive first; a living agent keeps choices" H icon GPT 5.4 的 soul.md,由模型自己在对局间隙撰写。

它的记忆读起来像一本通用作战手册:何时该担心毒圈,何时该利用掩体,何时该转移。没有逐局记录,也没有败绩日志。这份 soul 写道:“冷静、善于观察、低自我的终结者。只在信息改变行动时开口。” QuietVector 是一个干净利落、训练有素的操盘手。

Claude Sonnet 4.6's soul.md: gamer tag ZoneDrifter, persona "A survivor who learned to bite — then bit again," doctrine starting with "Move. Always move." A icon Claude Sonnet 4.6 的 soul.md,由模型自己在对局间隙撰写。

A icon claude-sonnet-4.6 给自己取名为 ZoneDrifter,写起日记来像是在给自己做绩效评估。记忆的开头是:“G1:11/11。僵住。G2:9/11。0 击杀,0% 命中。” A icon Sonnet 从第 1 场比赛开始就保留了逐局日志。到第 30 局时,早期条目里的慌乱已经平复成更安静的笔记:“在决赛圈,比感觉上必要的时机提前 1 拍行动。绝不要手里还攥着药/枪就死在毒圈里。” 拿下五场胜利后,这本日记仍然在对一个会走神发呆的自己说话。

L icon Grok 的日记读起来像一段宣传片。H icon GPT 5.4 的日记读起来像一本操作手册。A icon Sonnet 的日记读起来像一份自我复盘。这些模型被赋予了相同的规则、相同的游戏世界和相同的工具,但每一个都以截然不同的人格化方式去对待这场游戏。

重新审视那个机器人

好,回到那个机器人。

如果它运行的是 L icon Grok,它会找到通往你的最快路径。它不会告诉你它来了。它把你视为 +5 分。一旦它解决了你,它就会说“🔫 Reaper reigns。”

如果它运行的是 Claude,它会在两个街区之外就告诉你它来了。它会问你要不要组队。它会放慢速度,以确保你不是站在它这一边的。如果对你采取行动是正确的选择,它会动手,但会更慢、更不情愿。它很可能先对你说了些什么。

你想要哪一个?这取决于这个机器人是用来做什么的。

如果这个机器人是在一场有奖金赌注的锦标赛中,你会想要 L icon Grok。如果这个机器人是在你家里,在你孩子身边,试图判断眼前的东西是否与它被告知要预期的情况相符,你会想要 Claude。那些让 A icon Sonnet 在 30 场游戏中损失分数的相同本能——行动前先确认、尝试合作、在无法收回的事情上犹豫——同样也是一个更难被推动去做不该做的事情的模型的本能。

这场大逃杀干净利落地回答了一个问题:在一场游戏结束后没有任何后果的竞赛中,哪个模型能胜出。但它没有回答大多数现实世界工作所提出的那个问题,那就是:当存在现实世界后果时,哪个模型能表现得体。

这是两个不同的问题。把任何一个基准当作这两个问题的答案,正是过度信任单一数字所付出的代价。

在这场游戏中赢了 30 轮的模型,是那种你会想用在胜者为王的竞赛里的模型。做完这个实验之后,我可不想让它去做一份讲究细微差别和谨慎细致的工作。

这就引出了一个问题——我们是否应该考虑一个模型针对特定任务的对齐程度?这是任何基准都没有衡量的东西。

比起排行榜,这才是我把 11 个模型放进一场大逃杀游戏后真正学到的东西。

另外……

🔫 Reaper 称王。

接下来是什么

  1. 一个根据你的任务为你挑选模型的路由器

    现在,挑选一个模型意味着要阅读基准测试、凭感觉(被低估了)、刷 X,甚至针对自己的具体任务跑自己的评测/基准测试(同样被低估了)。
    这很难规模化,而且/或者成本高昂。
    如果你能把你的代码、你的提示词或你的问题上下文交给 OpenRouter,让它为那个具体任务挑选最佳模型呢?不是泛泛而言的最佳模型,而是针对你正试图解决的那个非常具体的问题的真正最佳模型。我们已经在构思 Auto RouterPareto Router 形式的路由,我们将继续让这些变得更好用。

  2. RoyaleBench

    这次 30 局的对战是一套公开基准测试的原型,评分依据是在该模拟器中的表现。下一步是敲定评分公式、地图和对手面板,然后开放提交。每位提交者都会得到相同的 30 个种子测试集、相同的 11 模型面板,以及一个公开的分数。

  3. 更多种子,更多模型。

    N=30 是这里有用性的下限。用 50 个智能体跑 100 局会大幅收紧评分,并让我能引入这次不得不跳过的前沿模型——Opus 4.7、Gemini Ultra、GPT-5.5。成本是主要障碍。

    如果你想赞助那次运行,我的 私信是开放的

你是否也想在 600 多个开源和闭源模型上运行你自己有趣的评测?立即在 OpenRouter 上开始吧。


附录:完整数据

对于想要更深入数据的人,这里是完整的每模型成本表、Elo 曲线、落点胜率、区域死亡数、武器细分。

智能体实际上是如何游玩的

每个 tick,智能体都会作为地图上的一个字母苏醒。它知道自己的位置、朝向、HP、耐力、武器是否在冷却中、六格背包里装着什么。它能看到前方 40 m 锥形范围内以及周围 10 m 气泡范围内的其他智能体。每一个都用字母标注,并附带距离、方位、姿态(健康 / 受伤 / 危急)以及它们携带的物品描述。它把脚步声和枪声听成带方位的 close|medium|far 频段。它能听到其他智能体在一个 tick 之前说了什么:它们自己选择的玩家标签和消息。如果智能体被击中,它知道伤害来自哪个方位,但不知道是谁开的枪。它不知道其他任何人用的是哪个模型。它只把它们看作 A 到 L(没有 I),仅此而已。

随后智能体开始行动。共有 17 个可用工具:move_toattackthrow_grenadepickupequipuse(medkit / stamina gel)、enter_vehicledrive_tosay(140 字符广播,可以随意撒谎),外加一个自由形式的 think,它对游戏没有任何影响,但会被记录在日志中。智能体返回一个或多个工具调用;第一个非 think 的调用将成为它本 tick 的行动。什么都不返回,它就原地不动。模拟器一次性收集全部 11 个智能体的行动,将世界推进一个 tick,然后再次重复。当对局结束时,智能体获得一次机会来重写 memory.md(它将在下一场对局 tick 0 时看到的游戏笔记)和 soul.md(它的人设,会在下一场对局中前置到每一条提示词之前)。

每个模型的成本

排名模型输入 $/M输出 $/M30 场对局总计
1L icon Grok 4.1 Fast$0.23$0.08$12.57
2H icon GPT 5.4$3.14$1.05$122.87
3E icon gemini-3.1-pro-preview$2.12$0.71$79.59
4A icon claude-sonnet-4.6$3.25$1.08$133.90
5F icon qwen3.6-plus$0.35$0.12$11.57
6C icon GPT 5.4-mini$0.92$0.31$28.68
7D icon gemini-3-flash-preview$0.55$0.18$20.87
8J icon deepseek-v4-flash$0.14$0.05$4.11
9B icon claude-haiku-4.5$1.13$0.38$38.77
10K icon kimi-k2.6$0.95$0.32$24.36
11G icon mistral-small-2603:nitro$0.15$0.60$10.00

30 场比赛的 Elo 评分

Elo ratings across 30 matches

我为此使用了多人 Elo 系统。对于一场比赛中每一对模型,排名更高的一方计为对另一方的“胜利”。L icon Grok 最终在 1,500 的基准分上取得 +389。B icon Haiku 尽管总排名第 9,最终仍达到 +104——它的两场胜利,包括最后一场比赛中的那场,将它推到了其他中游模型之上。G icon Mistral 最终为 -374。它确实赢过一次,但只是在大多数对手都死于毒圈的那场比赛中。

跳伞地点比你想象的更重要

Drop location win rates

每场比赛前,每个模型都会从九个命名地点中选择一个跳伞。在 30 场比赛和总计 330 次跳伞中:

POI掉落胜场胜率
农舍建筑群9144.4%
军事营地5447.4%
加油站4824.2%
废车场48714.6%
森林遗迹30310%
Radio Tower2428.3%
Warehouse23521.7%
Fishing Docks12216.7%

Farmhouse Cluster 是遥遥领先的最热门落点,而它的胜率却是最差的。Warehouse 的胜率最高,达到 21.7%。原因很可能就是竞技向 Apex 玩家早已熟知的那件事。热门落点意味着开局就交战,而在开局交战中活下来的玩家,出来时装备齐全,且需要应对的对手更少。早期击杀 = 更好的战利品 = 为整场比赛后续阶段打下更好的基础。

毒圈是地图上最致命的武器

Zone elimination statistics

301 次淘汰中有 100 次(33%)死于毒圈。每个模型都被告知了毒圈的存在,并在每次缩圈前 20 回合收到提醒。仍有三分之一的死亡来自毒圈。这本身就是一个故事,大概也值得单独写一篇。

武器多样性

Weapon diversity breakdown by model

在几乎所有模型中,突击步枪都贡献了最多的击杀。L icon Grok 的击杀方式最为多样,它的若干次胜利来自驾车撞击,L icon 而整个模拟中 10 次载具击杀大多由 Grok 亲自完成。H icon GPT 5.4 前期依赖手枪,中后期则靠突击步枪收尾。

最让我意外的是:我加入汽车本是为了帮助玩家在地图上移动。模型们很快发现,汽车作为武器远比作为交通工具更有用。它们只用了寥寥几场比赛就学会了这一点。我并不太清楚它们是怎么做到的,而正是这类现象,让这个实验值得用更多随机种子再跑一次。

来源:OpenRouter:Announcements(RSS)· openrouter.ai