跳到正文
原文
The Decoder:AI News· Maximilian Schreiner·· 2 小时前同事件AI 评分77

Ataraxos 以85%有效胜率击败最强人类 Stratego 选手,训练成本不足 8000 美元

AI beats Stratego's greatest player, ending one of the last human strongholds in board games

AI 导读

研究人员开发的 AI 系统 Ataraxos 以 85% 的有效胜率(平局计半胜)击败了曾获 4 次世界冠军的史上最强 Stratego 选手 Niemeijer,并在 2025 世界锦标赛表演赛中取得 40 局 38 胜。

同一事件,精选展示《MIT 等机构发布 Ataraxos,以极低成本战胜顶级人类 Stratego 选手》

正文 · AI 翻译

Niemeijer 被认为是这款游戏历史上荣誉最多的玩家。他赢得过四次世界冠军、15 次荷兰全国冠军和两次线上世界冠军,并在世界排名第一的位置上停留了超过 600 周。George Franka 是自 1997 年以来唯一一位参加过每一届世界锦标赛的选手,他称 Niemeijer 是“有史以来最伟大的 Stratego 玩家”。

Stratego 对 AI 来说是一项格外艰难的考验,因为双方都要将自己的 40 枚棋子面朝下布置。根据论文,可能的布局超过 10^33 种。在这类信息不完全的游戏中,一步棋的价值不仅取决于之后棋局如何发展,还取决于决策之前和决策期间发生了什么,第一作者 Samuel Sokota 在 X 上写道。

双方都秘密布置自己的棋子。棋子的等级只有在与对方棋子相遇时才会揭示。谁夺取了对方的军旗谁就获胜。 | 图片:Sokota, S., Vinitsky, E., Hu, H. et al.

据 Sokota 称,源自扑克 AI 的方法确实绕过了这个问题,但仅限于隐藏信息很少的情况。在德州扑克中,只有 1,326 种可能的起手牌,而根据论文,这些方法所需的计算量会随着隐藏信息的增加而增加。因此,Stratego 是人类仍优于 AI 的最后几款主要竞技棋类游戏之一。

大学预算击败了 DeepMind 数百万美元都做不到的事

DeepMind 此前正是在这款游戏中未能突破顶尖人类玩家的水平。根据论文,其 DeepNash 系统在 1,024 个 TPU 节点上训练了两到三个月,这是相应 DeepNash 作者的回忆。Ataraxos 的作者估计,按 2025 年的价格计算,这要花费 300 万到 450 万美元。

相比之下,Ataraxos 在 16 块 Nvidia H100 GPU 上只需要一周时间,再加上在 4 块 GPU 上为其所谓的信念网络额外运行四天。按 2025 年的价格计算,这不到 8,000 美元。研究人员称其计算成本大约只有 1/500,自对弈局数为 1/30,训练样本数为 1/100。他们将此归功于自己编写的定制 GPU 模拟器,但也归功于高得多的样本效率。Sokota 写道,该团队受限于学术计算资源,多年来积累了大量技巧。

这两个系统之间没有进行过正面对比。研究人员表示,他们曾提出搭建必要的基础设施,但 DeepMind 告诉他们这不可能,因为 DeepNash 的代码已无法运行。在 2023 年世界锦标赛上,DeepNash 在 28 局中赢了 19 局,但输给了大多数顶尖选手,包括 Niemeijer。

迫使 AI 变换打法可防止其陷入僵局

Ataraxos 不借助任何人类数据学习,完全通过自我对弈。根据论文,关键在于系统被逼着变换打法的力度有多大。训练期间的一个额外条件让 AI 分散其布局和走法,而不是早早锁定一种固定策略。这被称为正则化。作者们说,这在 Stratego 中很重要,因为高水平下法需要大量随机性,而打法可预测的玩家会被利用。

随着训练的进行,研究人员会放松这种压力,并相应调整学习步长的大小。在早期阶段,Ataraxos 会大幅变化其打法,并以大跳跃的方式学习。到了后期,它的打法更加审慎,只做小幅修正。这样可以防止学习过程陷入循环或变得混乱,而这种情况在不完全信息博弈中往往会发生。研究人员将正则化比作一种能量储备。如果 AI 消耗得太快,它会在早期取得快速进展,但随后就会失去继续学习的能力,并且往往变得容易被利用。

Ataraxos 还使用了一个信念网络来预测对手的隐藏棋子是什么。在每一步棋之前,AI 会用它生成可能的游戏状态,推演候选着法,并专门为这一决策额外运行一步学习。作者表示,早期的工作跳过了这类搜索,因为在如此多的隐藏信息下,这被认为过于困难。

尽管存在内置劣势,AI 仍大获全胜

研究人员将对抗 Niemeijer 的系列赛分散在三周内进行,以避免疲劳,并给他时间准备。Niemeijer 知道 Ataraxos 不会适应他的风格。他因参与获得 1,000 美元,外加每胜一场 100 美元、每平一场 50 美元,因此他有经济动机去发挥出最佳水平。

作者写道,将平局计为半胜,85% 的有效胜率在最高水平上是前所未有的。三届世界锦标赛亚军 Max Roelofs 表示,顶尖水平的差距极其微小,因为这款游戏迫使玩家承担风险。AI 还在结构性上处于劣势。Niemeijer 可以在多局比赛中适应它,但它无法适应他。根据论文,三届世界冠军 Vincent de Boer 认为这是一个重大障碍。

在 2025 年 Stratego 世界锦标赛期间的表演赛上,Ataraxos 还在对阵锦标赛选手的 40 局比赛中赢得了 38 局。选手们形容它的风格难以捉摸。AI 会做出人类认为风险过高的诈唬,而当它落后时,它会顽固地拖延,以至于一些选手觉得这很无礼。它似乎还幸运得近乎诡异,因为它的棋子似乎总是恰好出现在正确的位置。与 Niemeijer 的对局可在网上获取。

该方法远不止适用于 Stratego

研究人员使用同样的方法构建了其他系统。在 Barrage Stratego 变体中,他们的 AI 在对阵四名排名最高选手中的三位时赢得了四个 50 局系列赛,而这三位都是两届 Barrage 世界冠军。在合作卡牌游戏 Hanabi 中,它在每个变体中都创下了新纪录,而在双人版本中,它所需的计算量比之前领先者少了两个数量级。在中国卡牌游戏斗地主中,它击败了此前的基准系统 PerfectDou 和 DouZero。

作者从这些结果中得出了一个宏大的结论。他们认为,大量隐藏信息不再是强化学习和搜索的障碍。只要能为许多战略决策问题构建快速而准确的模拟器,这就会使实用 AI 触手可及。论文指出,金融市场、军事冲突和谈判就是不完全信息情境的例子。

研究人员承认了一个局限性。由于该搜索仅模拟单个学习步骤,其性能无法仅通过增加计算时间而持续提升。更复杂的搜索方法可能会改变这一点。团队已将 Ataraxos 的代码公开。

来源:The Decoder:AI News · the-decoder.com