国际跳棋在1997年败给深蓝,围棋在2016年败给AlphaGo,而扑克机器人也早已持续战胜人类职业选手。但有一款名为Stratego的经典棋类游戏一直未被攻克。即便拥有雄厚预算的DeepMind,也未能开发出一款能够稳定击败顶尖人类选手的程序。
如今,一个由卡内基梅隆大学、麻省理工学院、纽约大学和斯坦福大学研究人员组成的团队做到了这一点。他们开发的AI名为Ataraxos,以15胜1负4平的成绩击败了公认史上最强的Stratego选手Pim Niemeijer。而训练这款AI仅用了16块GPU和几千美元的成本。
隐藏的军队
在Stratego游戏中,每位玩家拥有40个代表军事等级的棋子,从元帅到间谍,还包括炸弹和旗子。玩家需要攻占对手的旗子才能获胜。对手能看到你棋子所在的位置,却不知道棋子的身份。棋子身份只有在两枚棋子对战相撞时才会揭晓——较弱的一方被移除,胜者的身份也随之暴露。这使得Stratego成为一款不完全信息博弈游戏,就像扑克一样,而计算机早已攻克了扑克。"Stratego有一个非常独特之处,那就是存在大量隐藏信息,且这些信息要在很长的时间跨度内才会逐渐揭晓,"纽约大学研究员、论文共同作者Eugene Vinitsky说。
在某些扑克类型中,隐藏信息量很小。在德州扑克中,"你只有两张隐藏的牌,"麻省理工学院计算机科学家、论文另一位共同作者Gabriele Farina说。这意味着总共只有1326种可能的手牌组合,数量少到机器可以逐一权衡计算。"而在Stratego中,棋盘上有40枚棋子,可以以任意顺序排列,"Farina说。这意味着存在超过十的三十三次方种可能的布局方式。此外还有游戏时长的问题。
"国际象棋通常在40步左右就能结束,但Stratego的一局游戏很容易持续2000步,"Farina说。除此之外,Stratego还是一款充满虚张声势的游戏。有时你会把一枚弱棋子当作元帅来移动,只是为了吓退对手。如果玩家虚张声势太频繁,他们的威胁就会毫无意义;但如果从不虚张声势,他们又会变得容易被预测。研究团队解释说,正是这种微妙的平衡,难住了包括DeepMind在2022年推出的DeepNash等早期AI系统。
学习猜测
与DeepNash一样,Ataraxos通过与自己对弈来学习——累计进行了1.63亿场对局。在这些自我对弈的过程中,导致胜利的走法会被强化,并在未来的对局中更频繁地使用;而导致失败的走法则会减少使用频率,这是同样简单的训练理念。不同之处在于Ataraxos在每局结束后调整策略的幅度,因为隐藏信息往往会使自我对弈学习算法陷入循环打转。研究团队通过在训练初期进行大幅度、激进的策略调整,而在后期进行小幅度、谨慎的调整,解决了这个问题。
更大的创新在于DeepNash从未具备的一项能力:在每次落子前进行前瞻思考。像AlphaGo这样的AI会在行动前通过搜索来完善其整体策略。而DeepMind未能在Stratego中实现这一点,因为搜索空间实在过于庞大,这也使得这种方法是否值得尝试一直悬而未决。
"这正是我们成功攻克的难题之一,"Farina说。解决方案是引入第二个神经网络,即信念模型,该模型经过训练,可以根据对手棋子的移动方式来推测其隐藏棋子的身份。这样一来,Ataraxos无需遍历每一种可能的排列组合,而是对合理的排列进行采样,在每种排列中推演候选走法,并根据推演结果做出选择。
这一点也体现在它的对弈风格上。
冷静而不动声色
Ataraxos这个名字来源于古希腊语,意为一种平静的状态。"它的意思是指一个冷静、不受外界干扰的人,"Farina解释道。他表示,这款AI的结构设计以及缺乏人类情感的特性,确保了它不会冲动行事,"即便在人类可能会情绪失控的局面下也是如此。"当人类可能会在大比分落后时尝试冒险翻盘,Ataraxos则会以缓慢而有条理的方式慢慢扳回局面。
Q&A
Q1:Ataraxos是什么?它的主要成就是什么?
A:Ataraxos是由卡内基梅隆大学、麻省理工学院、纽约大学和斯坦福大学研究人员联合开发的AI系统,它以15胜1负4平的成绩击败了公认史上最强的Stratego选手Pim Niemeijer,是首个能稳定击败顶尖人类选手的Stratego AI。
Q2:为什么Stratego游戏比围棋、国际象棋更难被AI攻克?
A:因为Stratego存在大量隐藏信息,棋盘上40枚棋子可以以超过十的三十三次方种方式排列,且游戏长度可达2000步,同时还涉及虚张声势的博弈平衡,这些因素共同导致其难度远超以往被攻克的棋类游戏。
Q3:Ataraxos训练成本是多少?用了什么技术突破?
A:Ataraxos仅用16块GPU、几千美元成本,通过1.63亿场自我对弈完成训练。其关键突破是引入了一个"信念模型"神经网络,用于推测对手隐藏棋子的身份,从而实现落子前的前瞻思考。
