MIT等四校研发Ataraxos:低成本击败Stratego顶级玩家

MIT等四校研发Ataraxos,以极低训练成本击败Stratego顶级玩家。该系统结合自我博弈与即时规划,训练示例少于DeepNash百分之一,实战创15胜1平4负纪录,发表于《自然》杂志。

MIT等四校联合研发Ataraxos:以极低训练成本击败Stratego顶级人类玩家

麻省理工学院(MIT)、卡内基梅隆大学、纽约大学和斯坦福大学的研究人员共同开发了一款名为 Ataraxos 的人工智能系统。该研究已发表于《自然》杂志,展示了在隐藏信息博弈中实现超人性能的新技术路径。

训练示例少于DeepNash百分之一
实现 Stratego for Zillions of Games 引擎的截图。图片来源:安德烈亚斯·考夫曼/维基媒体公众号,CC BY-SA 3.0

突破不完美信息博弈的计算瓶颈

现实世界中广泛存在“不完美信息”问题,即决策者无法掌握所有相关数据。例如,金融市场交易者难以知晓对手背后的逻辑,军事行动中敌方的具体位置往往不明。在此类情境下,虚张声势与真实意图交织,使得最佳行动难以确定。

经典棋盘游戏 Stratego(军棋)常被用作测试 AI 战略思维能力的基准。在该游戏中,两名玩家在棋盘上布置 40 枚棋子,但每枚棋子的身份仅在发生碰撞时才公开。其可能的棋子配置数量超过 $10^{66}$,远超国际象棋,导致传统基于穷举或复杂运算的方法难以扩展。

此前,包括 Google DeepMind 在内的机构曾尝试通过大规模计算解决这一问题,但即便投入数百万美元的训练成本,模型仍未能稳定击败顶级人类 Stratego 玩家。

Ataraxos 的技术架构:蓝图策略与即时规划

研究人员将这款新系统命名为 Ataraxos(希腊语意为“无忧无虑的人”)。该系统结合了高效的自我博弈强化学习算法与针对隐藏信息的决策时间规划技术。

高效训练机制:Ataraxos 通过多次自我对抗来学习强大的“蓝图策略”。MIT 研究员加布里埃尔·法里纳(Gabriel Farina)指出:“我们的系统在达到高于 DeepNash 的游戏强度时,使用的训练示例少于前者的百分之一,自我对弈局数少于三十分之一。”这种效率提升显著降低了训练成本。

动态决策优化:在对局中,Ataraxos 不仅依赖预设的蓝图策略设置棋盘,还在每一步行动前使用生成模型进行“即时规划”。该系统利用概率估计对手隐藏棋子的分布,并评估未来几步的最优选择。这种结合静态策略与动态推理的方法,被认为是其实现超人性能的关键缺失环节。

实战表现:创纪录胜率与跨游戏泛化能力

在与世界上最强的 Stratego 人类玩家的对决中,Ataraxos 取得了 15胜1平4负 的创纪录比分。在 Stratego 世界锦标赛对阵顶尖人类选手时,战绩为 39胜2负。

法里纳分析称,Ataraxos 在计算风险方面具备人类无法企及的能力。“如果最有价值的棋子暴露,人类可能会惊慌失措,但机器人却能出奇地冷静。它不会过度修正策略从而泄露自己的秘密。”

此外,研究人员将该方法改编应用于其他具有不同规则的不完美信息游戏,包括节奏更快的 Barrage Stratego、多人合作纸牌游戏 Hanabi(花火),以及两个玩家合作对抗第三个玩家的斗地主(Dou dizhu)。在所有测试实例中,Ataraxos 均表现出超人水平,证明了该方法的通用性。

研究团队与未来展望

这篇论文的主要作者包括卡内基梅隆大学研究生塞尔·索科塔(Sergey Sokota)、纽约大学研究生尤金·维尼茨基(Eugene Vinitsky)和齐科·科尔特(Zico Kolter)、斯坦福大学研究生 Hengyuan Hu,以及麻省理工学院 EECS 研究生加布里埃尔·法里纳。

目前,研究团队计划在 Ataraxos 中建立可解释性测量指标,以便人类能够理解系统的决策逻辑。法里纳表示:“在采用之前,我们需要一种方式来审核模型的决策。虽然还有很长的路要走,但这些算法有望成为未来更多工作的基础。”

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读