卡内基梅隆等高校研发AI系统Ataraxos击败战略游戏世界冠军

卡内基梅隆等高校研发AI击败战略游戏世界冠军。Ataraxos引入信念模型估算隐藏棋子,实现前瞻搜索。其训练仅需16个GPU运行一周,成本远低于DeepNash,对弈量减少34倍但强度更高。

卡内基梅隆等高校联合研发AI系统Ataraxos,以压倒性优势击败战略游戏世界冠军

来自卡内基梅隆大学、麻省理工学院(MIT)、纽约大学(NYU)和斯坦福大学的研究人员共同开发了一款名为Ataraxos的人工智能系统。该系统在经典策略游戏《Stratego》中展现了卓越性能,以15胜1负4平的成绩击败了四届世界冠军Pim Niemeijer。

16 GPU一周训练击败世界冠军

据Ars Technica报道,Ataraxos的核心优势在于引入了第二个神经网络——“信念模型”(belief model)。该模型能够根据敌方棋子的移动轨迹估算隐藏棋子的身份,从而使系统能够在合理的游戏状态中进行搜索,而非在巨大的隐藏信息空间中盲目穷举。

自我对弈训练与动态策略调整机制

与DeepMind于2022年推出的DeepNash类似,Ataraxos也是通过自我对弈进行学习的,总共进行了1.63亿局游戏。在训练过程中,导致胜利的动作被强化并在后续比赛中更频繁地被选择,而导致失败的动作则减少使用频率。这一基础训练理念虽然简单,但团队针对隐藏信息容易导致自我对弈算法陷入循环的问题进行了优化:在训练初期采取大幅度的策略调整,而在后期则转为精细且谨慎的微调。

突破性的前瞻搜索能力

Ataraxos的一项重大创新在于实现了动作前的前瞻搜索,这是DeepNash未曾具备的能力。AlphaGo等AI通常会在行动前通过搜索来优化通用策略,但在《Stratego》中,由于搜索空间过大,DeepMind未能实现这一功能,这也曾让业界质疑其可行性。研究团队成员Farina表示:“这是我们解决的关键问题之一。”

解决方案依赖于前述的信念模型。该模型经过专门训练,旨在根据对手的移动方式猜测其隐藏棋子。因此,Ataraxos无需遍历所有可能的棋子排列组合,而是采样出几种合理的可能性,在这些状态下模拟候选动作,并根据结果做出选择。这种机制直接体现在了其实际对战风格中。

显著降低的训练成本与硬件需求

在资源效率方面,Ataraxos展现出巨大优势。DeepNash曾在Google的1024颗专用芯片上训练两到三个月,按2025年的价格计算,此次运行成本估计在300万至450万美元之间。相比之下,Ataraxos仅需16个GPU运行一周,外加4个GPU运行四天用于训练信念模型。

Farina与第一作者Samuel Sokota通过编写一个能在图形卡上每秒执行数百万次移动的模拟器实现了这一效率提升。Farina指出:“在我们所处的学术界规模下,我们无法获得整个GPU集群的使用权限。”此外,该算法的学习速度也大幅提升,其进行的对弈数量比DeepNash少约34倍,但最终强度却远超后者。相关研究成果已发表在《Nature》期刊上。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读