一种擅长应对隐藏信息挑战性博弈的全新AI系统,未来或许能帮助人类决策者在军事行动等复杂局面中选出最佳策略,以智取对手。
来自麻省理工学院、卡内基梅隆大学、纽约大学和斯坦福大学的研究人员,利用机器学习领域的最新进展,开发出一款AI系统。该系统在桌面战争游戏Stratego中以较大优势击败了排名最高的人类玩家——这是此前任何AI系统都未能做到的成就。
Stratego是一款双人不完全信息博弈游戏,对手棋子的身份始终处于隐藏状态,常被用作检验强大AI模型战略思维能力的基准测试。
为构建这一模型,研究人员将高效的训练算法与专为隐藏信息环境下的精密决策设计的新技术相结合。
该AI系统在Stratego中的表现超越了此前最优秀的模型,同时训练成本更低、计算需求也更小。此外,该系统在规则和设计各不相同的其他策略类游戏中也超越了顶尖人类玩家,证明了其方法具备良好的通用性,可适配多种使用场景。
该AI系统未来可能被改造用于帮助人类应对许多现实世界中的隐藏信息问题,例如商业谈判或网络安全领域。
“在现实中面对的那类不完全信息任务中,你往往没有机会去逐一列举所有可能性,因为可能性实在太多了。拥有通用型且能证明在这类高难度任务上表现优异的AI算法,是一个重大进步。”电气工程与计算机科学系(EECS)助理教授、信息与决策系统实验室(LIDS)首席研究员、该系统相关论文的资深作者加布里埃莱·法里纳说道。
与他共同撰写该论文的还有第一作者、卡内基梅隆大学研究生萨缪尔·索克塔;纽约大学研究生尤金·维尼茨基和基科·科尔特;斯坦福大学研究生恒远·胡;以及麻省理工学院EECS系研究生志远·范。该研究今日发表于《自然》杂志。
隐藏信息
现实世界中充满了不完全信息问题。
在这类互动中,某些参与方掌握着其他方所不具备的信息。例如,金融市场的交易者可能不知道其他交易者进行交易背后的理由,而军事力量通常也无法完全掌握敌方的部署情况。
在存在隐藏信息的情况下,各方所做出的决策,以及他们选择不做出的决策,会以一种极其复杂的方式交织在一起,使得判断下一步最佳行动极为困难。
“你越是虚张声势,对手就越会预料到这一点,每一次虚张声势的价值也就越低。该如何推理这种情况并不显而易见。”索克塔解释道,“这与国际象棋这类游戏截然不同——在国际象棋中,无论你下过多少次,最佳走法始终是最佳走法。”
Stratego常被用来模拟不完全信息情境。在这款类似军棋的桌面战争游戏中,玩家在棋盘己方一侧摆放40个棋子,然后移动棋子穿越棋盘,以夺取对方的旗帜。
但所有棋子的身份在相遇之前都是保密的,一旦相遇,等级较低的棋子就会被淘汰。
棋子可能的排列组合数量超过10的66次方——这一数字呈指数级超过国际象棋——这使得Stratego对AI系统而言极难精通。
过去的一些尝试,比如谷歌DeepMind的研究,依赖于复杂的运算,计算量大、成本高昂。但即便投入数百万美元的训练成本,这些模型的实力依然不足以击败顶尖的人类Stratego玩家。
“在Stratego中,你可能需要应对的可能局面呈爆炸式增长。为扑克等游戏开发的AI技术,在这种环境下显然无法规模化扩展。”法里纳说。
麻省理工学院的研究人员着手开发一套完整的AI系统,希望以更低的成本实现超越人类的表现,他们将这一系统命名为Ataraxos(源自希腊语,意为“心境平和、无忧无虑”的人)。
双管齐下的方法
为构建Ataraxos,研究人员采用了一种名为自我博弈强化学习的技术对模型进行训练。该模型通过与自身多次对弈,学习出一套擅长Stratego的“蓝图策略”。
他们设计了格外高效的算法,使Ataraxos的学习速度远超以往方法,同时确保它不会陷入试图预测每一种可能走法的困境。这既降低了训练成本,又提升了性能表现。
“我们的系统达到的棋力严格高于DeepNash(DeepMind的系统),而使用的训练样本量不到其百分之一,自我博弈对局数不到其三十分之一,这表明效率得到了巨大提升。”法里纳说。
在对局过程中,Ataraxos会以蓝图策略为起点来布局棋盘,并在每一回合开始思考下一步行动。
但在真正行动之前,它会利用一种名为“决策时规划”的技术,对自己的选择进行实时优化。该系统采用一个生成式模型,利用概率来估计对手隐藏棋子身份的可能情况,然后在选择下一步行动之前评估未来的各种选择。
“我们并非盲目猜测,而是利用决策时规划来找出棋盘最可能的状态。使用这个生成式模型,让我们能够真正聚焦于当前面对的具体棋局和对手。”法里纳说。
将这种生成式模型创新性地用于决策时规划,正是使Ataraxos实现超越人类表现的关键一环。
Ataraxos以15比1、平4局的创纪录战绩击败了世界上最强的Stratego玩家,并在Stratego世界锦标赛中对阵顶尖人类玩家取得了39比2的战绩。“Ataraxos在风险计算方面的能力是人类所不具备的。人类在自己最有价值的棋子暴露时可能会惊慌失措,但这个机器人却能出人意料地保持冷静。它不会过度反应,也不会暴露自己的秘密。”法里纳说。
研究人员还将Ataraxos改造应用于其他不完全信息游戏,包括Barrage Stratego(一种棋子更少、节奏更快的变体游戏)、Hanabi(一款多人合作纸牌游戏)以及斗地主(一种两名玩家联手对抗第三名玩家的游戏)。
该系统在每一种游戏中都实现了超越人类的表现,证明了这一方法的通用性。
未来,研究人员希望为Ataraxos构建可解释性机制,使该系统能够以人类可以理解的方式解释其决策过程。
“最终决定是否采纳某项建议的权力必须掌握在人类手中,因此在系统得到实际应用之前,我们需要一种能够审核模型决策的方法。我们还有很长的路要走,但我希望这些算法能够成为未来更多研究工作的基础。”法里纳说。
本研究部分资金由美国海军研究办公室、纽约大学土木与城市工程系、C2SMART中心、美国国家科学基金会以及施密特科学AI2050早期职业奖学金提供支持。
Q&A
Q1:Ataraxos是什么?它有什么特殊能力?
A:Ataraxos是由麻省理工学院、卡内基梅隆大学、纽约大学和斯坦福大学研究人员共同开发的AI系统,其核心能力是在不完全信息博弈游戏Stratego中达到超越人类顶尖玩家的水平,同时训练成本远低于以往模型。
Q2:Ataraxos是如何战胜顶尖人类玩家的?
A:Ataraxos通过自我博弈强化学习训练出“蓝图策略”,并在实际对局中运用“决策时规划”技术,借助生成式模型估算对手隐藏棋子的可能身份,从而做出更优决策,最终以15比1、平4局的战绩击败世界顶尖玩家。
Q3:Ataraxos未来能用在哪些实际场景中?
A:这类AI系统未来可能被改造应用于商业谈判、网络安全等现实中的不完全信息问题,帮助人类决策者在复杂局面中选出更优策略。
