[论文解读] Improving Hearthstone AI by Combining MCTS and Supervised Learning Algorithms
本文提出了一种混合式炉石传说AI,结合蒙特卡洛树搜索(MCTS)与监督学习,以提升在部分可观测、随机性卡牌游戏中决策的质量。通过训练神经网络来评估游戏状态并引导MCTS探索,该方法将胜率最高提升了9个百分点——尤其在时间受限时效果显著,表明学习到的启发式规则能显著提升基线MCTS的强度与效率。
We investigate the impact of supervised prediction models on the strength and efficiency of artificial agents that use the Monte-Carlo Tree Search (MCTS) algorithm to play a popular video game Hearthstone: Heroes of Warcraft. We overview our custom implementation of the MCTS that is well-suited for games with partially hidden information and random effects. We also describe experiments which we designed to quantify the performance of our Hearthstone agent's decision making. We show that even simple neural networks can be trained and successfully used for the evaluation of game states. Moreover, we demonstrate that by providing a guidance to the game state search heuristic, it is possible to substantially improve the win rate, and at the same time reduce the required computations.
研究动机与目标
- 在存在隐藏信息与随机性游戏机制的背景下,提升基于MCTS的炉石传说AI的性能与效率。
- 探究监督学习模型如何在部分可观测、非确定性游戏中引导MCTS搜索的启发式策略。
- 设计并评估一种结合MCTS与学习到的评估函数的混合AI系统,以提升游戏强度。
- 将所提出的智能体与人类玩家及随机对手进行基准测试,证明其在真实场景中的竞争力。
- 建立一个可扩展的迭代学习循环,通过自对弈与模型优化,持续进化更强的炉石传说AI。
提出的方法
- 实现了一种改进的MCTS算法,以处理炉石传说中的随机性与不完全信息,采用PIMC与ISMCTS技术进行信念状态管理。
- 开发了定制的游戏模拟器,以高效模拟游戏状态,支持高达10,000场游戏/秒的MCTS滚动模拟。
- 基于历史游戏数据,通过监督学习训练神经网络,以预测游戏状态价值,作为启发式评估函数。
- 利用价值网络估计游戏状态的预期结果,从而减少对随机滚动的依赖。
- 集成棋盘求解器,用于在模拟过程中计算最优攻击序列,提升战斗阶段的战术决策能力。
- 采用迭代学习循环,通过与先前版本对弈来优化智能体,实现技能的渐进式提升。
实验结果
研究问题
- RQ1监督学习模型能否在炉石传说的部分可观测与随机性环境中有效提升MCTS的决策质量?
- RQ2不同类型的启发式规则(如价值网络、棋盘求解器)对MCTS性能与计算效率有何影响?
- RQ3学习到的启发式规则在多大程度上减少了达到高水平游戏所需的MCTS模拟次数?
- RQ4启发式规则带来的性能提升在不同玩家角色(先手 vs. 后手)与卡组类型之间是否存在差异?
- RQ5结合MCTS与监督学习的混合系统能否在对抗高水平人类玩家时实现具有竞争力的表现?
主要发现
- 在每步仅使用0.5秒的情况下,集成价值网络与棋盘求解器使AI的胜率最高提升了9个百分点。
- 对于先手胜率基线较低(26.5%)的后手玩家,使用启发式规则后胜率几乎翻倍,最优条件下可达50%。
- 在时间限制较低时,启发式规则带来的性能提升最为显著,表明学习模型的引导可弥补搜索深度不足的缺陷。
- 在每步1秒的条件下,仅使用价值网络与同时使用价值网络与棋盘求解器之间的差距趋于最小,表明在高时间分配下收益递减。
- 该AI在对阵随机玩家时实现了100%胜率,并成功击败了传奇段位的人类玩家,表明其具备强大的实际表现。
- 人类玩家反馈称,该AI的玩法极具战略性和一致性,表明其决策质量远超基础的模式匹配。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。