首页 > 资讯 > 8000美元击败四届世界冠军:AI系统Ataraxos终结Stratego最后人类堡垒

8000美元击败四届世界冠军:AI系统Ataraxos终结Stratego最后人类堡垒

赢政天下 2026-10-05 14:22 7 阅读 查看原文

2026年9月30日,一篇发表于《自然》的论文以一组具体数字宣告了棋盘游戏上最后一块人类领地的失守:AI系统Ataraxos在20局正式系列赛中,以15胜1负4平击败了四届世界冠军Pim Niemeijer。这位荷兰棋手在Stratego世界排名榜首位保持超过600周,是公认的史上荣誉最多的Stratego选手。这支由卡内基梅隆、MIT、纽约大学和斯坦福大学研究人员组成的联合团队,用不足8000美元的训练成本完成了DeepMind耗资300至450万美元却未能实现的壮举,同时在Stratego世界锦标赛中录得39胜2负的成绩。

为何Stratego比国际象棋更难

要理解这一突破的分量,需要先理解Stratego对AI的特殊挑战。国际象棋和围棋是完全信息博弈——棋盘上的一切对双方完全可见,最优解在原则上可以通过足够深的搜索逼近。Stratego则是另一个世界:每方40枚棋子代表不同军衔,开局时对手只能看到你的棋子存在,但不知道它们的身份。只有当两枚棋子正面交锋时,较弱的一方才会离场,同时暴露自己的等级。

这种信息隐藏产生了指数级的复杂性。据论文数据,Stratego的开局布置方式超过1033种,远超围棋的状态空间。一局国际象棋通常走40步左右,Stratego则可轻松延伸至2000步。更难的是虚张声势(bluffing)的策略价值:一枚弱子可以伪装成最强棋子来吓退对手,但如果频繁虚张,对手就会识破;如果从不虚张,行为就会变得可预测。这种博弈层面的"心理战"让此前所有AI方法在规模化时都遭遇了瓶颈。

MIT电气工程与计算机科学助理教授、本文通讯作者Gabriele Farina解释了问题的规模:

"在Stratego中,你必须处理的可能宇宙会爆炸式增长。为扑克等游戏开发的AI技术绝对无法在这种设定下扩展。"

三件套架构:自博弈、信念网络与决策时搜索

Ataraxos的技术核心是三个组件的协同,每一个单独拿出来都不新鲜,但将它们整合到不完全信息场景下的方式是本文的核心贡献。

第一个组件是自博弈强化学习,系统通过约1.63亿局自我对弈积累棋力,胜利的走法被强化,失败的走法被修剪。为防止自博弈陷入循环(例如只固守某套开局布置),团队引入了正则化机制:早期训练时强制策略产生大幅变化,随着训练推进再收紧调整幅度,以此保证策略库的多样性,复现人类棋手维持"不可读性"的直觉。

第二个组件是信念网络——这是最关键的创新。传统搜索算法在不完全信息场景下会因为状态空间爆炸而失效。Ataraxos的解法是训练一个独立的生成模型,专门从对手的移动轨迹中推断其隐藏棋子的位置分布。不是穷举所有可能,而是采样"最可信的棋盘状态",在这些状态上推演候选走法。Farina的描述是:

"我们不是盲目猜测,而是用决策时规划找到最可信的棋盘状态。这个生成模型让我们真正聚焦于当前面对的具体棋盘和对手。"

第三个组件是决策时搜索(decision-time planning)。信念网络提供了状态分布,策略价值网络对每个候选走法打分,搜索在有限的计算预算内找到期望收益最高的动作。这三者的整合使Ataraxos在每一步都能以"有依据的猜测"代替"枚举所有可能",将不可解问题变成了可解问题。训练过程本身运行在16块Nvidia H100 GPU上共约一周,加上信念网络额外4天的训练,总计算成本低于8000美元。

与先例的横向对比:DeepNash的失败说明了什么

DeepMind的DeepNash是此前最接近攻克Stratego的AI系统,于2022年首次亮相。其训练规模远超Ataraxos:据公开资料,DeepNash花费300至450万美元,训练局数约55亿局。尽管资源投入是Ataraxos的近500倍,DeepNash始终未能在正式比赛中达到超越人类顶尖棋手的水平。

更值得注意的是一个细节:Ataraxos团队曾主动提出进行两套系统的直接对比测试,但DeepMind的回应是无法实现——因为DeepNash的代码已无法运行。这个事实侧面揭示了大型AI实验室内部的工程现实:投入数百万美元的项目,在没有持续维护的情况下,其工程可复现性可能远低于外界预期。

从历史序列来看,Stratego是一连串"最后堡垒"中的最新一个:Deep Blue在1997年击败卡斯帕罗夫,AlphaGo在2016年击败李世石,德州扑克机器人在近年全面压制职业牌手。每一次突破都被认为需要"真正理解"信息博弈的新能力,但每一次,回头看都是工程与算法协同的产物。Ataraxos的不同之处在于规模——它不是用更多资源碾压问题,而是用更聪明的架构以百分之一的成本解决了同类问题。

对现实世界任务的真实意义

论文作者本人对技术的外延保持了审慎但具体的表述。Farina指出:

"在你在现实中面对的不完全信息任务里,你往往没有奢望穷举所有可能。可能性太多了。"
Ataraxos在三款其他不完全信息游戏(Barrage Stratego、合作纸牌游戏Hanabi、中国棋牌游戏斗地主)中同样取得了强力表现,这为方法的泛化能力提供了初步的多任务证据。

对AI工程实践而言,更直接的影响是效率范式的转移。若"信念网络+决策时搜索"的组合能在其他不完全信息领域复现这种效率优势,那么网络安全(猜测对手行动意图)、谈判策略(对手偏好未知)、供应链博弈(隐藏库存信息)等场景将有据可循的算法路径可以参考,而不必依赖DeepNash式的暴力堆算力。

卡内基梅隆博士生、论文第一作者Samuel Sokota对比了Stratego与国际象棋的根本差异:

"这与国际象棋完全不同——在国际象棋中,无论你下了多少次,最好的走法仍然是最好的走法。"
这句话点出了不完全信息博弈的核心特性:策略必须是概率性的、适应性的,因为最优动作取决于对手的隐藏状态,而隐藏状态随每一步对手的行为而更新。