Stratego 也被 AI 攻克了:16 块 GPU、几千美元,Ataraxos 15:1 击败人类第一
1997 年,深蓝在国际象棋上战胜卡斯帕罗夫;2016 年,AlphaGo 击败李世石;扑克桌上…
文章目录
1997 年,深蓝在国际象棋上战胜卡斯帕罗夫;2016 年,AlphaGo 击败李世石;扑克桌上的机器人们也早已能把职业选手按在桌上摩擦。但有一款经典游戏,一直让 AI 束手无策——Stratego(战略棋)。即便是预算雄厚的 DeepMind,也造不出能稳定击败顶尖人类玩家的机器。如今,这个僵局被打破了。
一分钟速览
- 卡内基梅隆、MIT、纽约大学、斯坦福的研究者联手攻克 Stratego;
- AI 名为 Ataraxos,以 15 胜 1 负 4 平击败顶尖玩家 Pim Niemeijer;
- 训练仅用 16 块 GPU,花费只需几千美元;
- Stratego 是典型的不完全信息博弈,隐藏信息量极大;
- 成果为不完全信息、长周期博弈提供了新思路。
Stratego 难在哪
Stratego 的棋盘上,每人有 40 枚棋子,从元帅到间谍,还夹杂炸弹和军旗,目标是把对方的军旗夺下。你的对手知道你的棋子在哪,却不知道每枚棋子“是什么”;只有当两枚棋子发生战斗时,身份才会揭晓——弱的一方被移出棋盘,胜者的身份也随之暴露。这让 Stratego 成为一个不完全信息博弈,和扑克类似,但难度更上一层。
“Stratego 有个非常独特的地方:它包含海量的隐藏信息,而且这些信息要在很长的时间尺度上逐步展开。”参与研究的纽约大学研究员 Eugene Vinitsky 这样解释难点。通俗地说,AI 不只要在信息不全时做决策,还要在几十步、上百步的漫长对局里持续推理、记忆和修正判断——这比一步定输赢的游戏难得多。
数据支撑:低成本也能出好结果
研究团队来自卡内基梅隆大学、麻省理工学院、纽约大学和斯坦福大学。他们的 AI 被命名为 Ataraxos,在和史上最优秀 Stratego 玩家之一 Pim Niemeijer 的对战中,取得了 15 胜 1 负 4 平的战绩。更令人意外的是成本:训练这套系统只用了 16 块 GPU,花费仅几千美元。相比动辄耗资巨大的大模型训练,这个数字显得格外“便宜大碗”。
这背后的意义在于,攻克复杂博弈并不一定需要天文数字的算力。合适的方法与搜索推理策略,往往比堆硬件更关键。对资源和预算有限的团队来说,这是一种鼓舞。
趋势洞察
从棋类到扑克,再到 Stratego,AI 攻克游戏的历程,本质上是在攻克“不确定性”。真实世界恰恰充满不完全信息:谈判、军事、市场博弈,都是看不到对方底牌的对局。Ataraxos 的价值,不只是游戏里赢了人类,而是把“在信息不全、周期漫长的情况下做决策”这件事,往前推进了一步。这类能力,未来可能被用到物流调度、安全对抗、智能体协作等更现实的场景。
结语
又一个被 AI 攻克的人类游戏,又一次在“不确定性”上取得进展。当机器学会在看不全的情况下做判断,它离真正有用的智能,也就更近了一步。
本文地址:https://www.163264.com/16029