一种擅长处理隐藏信息博弈的新型AI系统,未来或许能够帮助人类决策者在复杂场景(如军事行动)中选出智胜对手的理想策略。
借助机器学习领域的最新进展,来自麻省理工学院、卡内基梅隆大学、纽约大学和斯坦福大学的研究人员开发出一款AI,以巨大优势击败了棋盘战争游戏Stratego(军棋)的人类顶级选手——这是此前任何AI系统都未能实现的成就。
Stratego是一款双人不完全信息博弈游戏,对手棋子的身份始终处于隐藏状态,因此经常被用作衡量强大AI模型战略思维能力的基准测试。
为构建这一模型,研究人员将高效的训练算法与专为隐藏信息场景下精算决策设计的新技术相结合。
该AI系统在Stratego游戏中的表现超越了此前最强的模型,同时训练成本更低、计算需求更小。该系统在规则和设计各异的其他战略游戏中同样优于人类顶尖玩家,证明了其在多种应用场景中的泛化能力。
这套AI系统未来有望适配帮助人类解决诸多现实世界中的隐藏信息问题,比如商业谈判或网络安全。
电气工程与计算机科学系(EECS)助理教授、信息与决策系统实验室(LIDS)首席研究员、该AI系统相关论文的资深作者加布里埃莱·法里纳(Gabriele Farina)表示:"在现实中面对的那类不完全信息任务里,你往往没有机会穷举所有可能性,因为选项实在太多了。拥有一种通用型AI算法,并且能够证明它在这种极具挑战性的任务上表现出色,这是一个重大的进步。"
与他共同撰写这篇论文的还有第一作者、卡内基梅隆大学研究生塞缪尔·索科塔(Samuel Sokota);纽约大学助理教授尤金·维尼茨基(Eugene Vinitsky);卡内基梅隆大学教授泽科·科尔特(Zico Kolter);斯坦福大学研究生胡恒远(音译,Hengyuan Hu);以及麻省理工学院电气工程与计算机科学系研究生范志远(音译,Zhiyuan Fan)。该研究今日发表于《自然》杂志。
隐藏信息
现实世界中充满了不完全信息问题。
在这些互动场景中,某些参与方掌握着他人不知道的信息。例如,金融市场中的交易者可能不清楚其他交易者交易背后的逻辑,而军事力量往往也无法完全掌握敌方阵地的位置。
在存在隐藏信息的情况下,各方所做的决策,以及他们选择不做的决策,彼此交织在一起,使得确定下一步最佳行动极为困难。
索科塔解释道:"你虚张声势的次数越多,对手就越会预料到这一点,每次虚张声势的价值也就越低。这种情况该如何推理并不直观。这与国际象棋这类游戏截然不同,在国际象棋中,无论你走过多少次,最佳着法始终是最佳着法。"
Stratego经常被用来模拟不完全信息场景。在这款类似军事象棋的棋盘战争游戏中,玩家在棋盘己方一侧摆放40个棋子,然后在棋盘上移动棋子以夺取对手的旗帜。
但所有棋子的身份在相遇之前都是保密的,一旦棋子相遇,等级较低的棋子就会被淘汰出局。
棋子可能的排列组合数量超过10的66次方——比国际象棋的组合数量级高出许多,这使得AI系统极难在Stratego游戏中表现出色。
此前的尝试,比如谷歌DeepMind,依靠的是计算需求高、成本高昂的复杂运算。但即便投入数百万美元的训练成本,这些模型的实力仍不足以击败人类顶尖的Stratego玩家。
法里纳表示:"在Stratego中,你可能需要应对的可能局面数量呈爆炸式增长。那些为扑克等游戏开发的AI技术,在这种场景下根本无法扩展应用。"
麻省理工学院的研究人员着手开发一套完整的AI系统,希望以更低的成本实现超越人类的表现,他们将其命名为Ataraxos(一个希腊语词汇,用来形容一个人内心平静、无忧无虑的状态)。
双管齐下的方法
为了构建Ataraxos,研究人员采用了一种名为自我对弈强化学习的技术来训练模型。该模型通过与自己进行多次对弈,学习如何在Stratego游戏中表现出色的强大"蓝图策略"。
他们设计了格外高效的算法,使Ataraxos的学习速度远超以往方法,同时确保它不会陷入试图预测每一种可能走法的困境。这既降低了训练成本,又提升了性能表现。
法里纳表示:"我们的系统所能达到的对弈实力,严格超过了DeepNash(DeepMind的系统),而所用的训练样本不到其百分之一,自我对弈局数不到其三十分之一,这表明效率得到了大幅提升。"
在对局过程中,Ataraxos以蓝图策略作为起点来布局棋盘,并在每一回合开始思考下一步棋该如何走。
但在真正落子之前,它会运用一种名为"决策时规划"的技术,对自己的选择进行实时优化。该系统采用一个生成式模型,利用概率来估算对手隐藏棋子身份的可能情况,然后在选定下一步棋之前对未来的各种选择进行评估。
法里纳表示:"我们不是盲目地猜测,而是运用决策时规划来找出棋盘最有可能的局面。使用这种生成式模型,让我们能够真正聚焦于当前所面对的具体棋局和具体对手。"
将这种生成式模型创新性地应用于决策时规划,正是让Ataraxos得以实现超越人类表现的关键一环。
Ataraxos以15胜1负4平的创纪录战绩击败了世界上实力最强的Stratego选手,并在Stratego世界锦标赛中以39胜2负的战绩击败人类顶尖选手。法里纳表示:"Ataraxos在风险计算方面的能力是人类所不具备的。当一个人最有价值的棋子暴露时,可能会开始惊慌失措,但这个AI却能保持出人意料的冷静。它不会反应过度,也不会因此泄露自己的秘密。"
研究人员还将Ataraxos改编应用于其他不完全信息游戏,包括Barrage Stratego(一种棋子更少、节奏更快的变体)、Hanabi(一款多人合作型卡牌游戏),以及斗地主(一种两名玩家联手对抗第三名玩家的游戏)。
该系统在每一种游戏中都实现了超越人类的表现,证明了这一方法的通用性。
展望未来,研究人员希望为Ataraxos构建可解释性机制,使该系统能够以人类可以理解的方式解释其决策过程。
法里纳表示:"是否采纳某项建议,最终决定权必须掌握在人类手中,因此在系统得到实际应用之前,我们需要有办法对模型的决策进行审查。我们还有很长的路要走,但我希望这些算法能够为未来更多的研究工作奠定基础。"
本研究部分资金来自美国海军研究办公室、纽约大学土木与城市工程系、C2SMART中心、美国国家科学基金会,以及施密特科学AI2050早期职业生涯奖学金。
Q&A
Q1:Ataraxos是什么?它能做什么?
A:Ataraxos是麻省理工学院等机构研究人员开发的一款AI系统,专为处理隐藏信息博弈设计。它在棋盘战争游戏Stratego中以巨大优势击败了人类顶尖选手,是首个实现这一成就的AI系统,同时训练成本远低于此前的同类系统。
Q2:Ataraxos是如何训练出来的?
A:研究人员采用自我对弈强化学习技术训练Ataraxos,让模型通过与自己反复对弈学习强大的"蓝图策略"。对局时,系统还会运用"决策时规划"技术,借助生成式模型估算对手隐藏棋子的身份概率,从而实时优化决策。
Q3:Ataraxos未来能应用在哪些现实场景?
A:这套AI系统未来有望帮助人类处理诸多存在隐藏信息的现实问题,比如商业谈判或网络安全领域的决策。研究人员还计划为系统加入可解释性机制,让其决策过程能够被人类理解和审查。
