[论文解读] StarCraft II Build Order Optimization using Deep Reinforcement Learning and Monte-Carlo Tree Search
本文提出了一种结合蒙特卡洛树搜索(MCTS)与深度强化学习的混合方法,以优化《星际争霸II》中的构建顺序,特别针对‘BuildMarines’小游戏。MCTS智能体在计算量极低的情况下实现了新手水平的表现,而深度神经网络的集成被证明对于在时间约束下实现专家水平结果至关重要,可降低模拟成本并实现更深的搜索。
The real-time strategy game of StarCraft II has been posed as a challenge for reinforcement learning by Google's DeepMind. This study examines the use of an agent based on the Monte-Carlo Tree Search algorithm for optimizing the build order in StarCraft II, and discusses how its performance can be improved even further by combining it with a deep reinforcement learning neural network. The experimental results accomplished using Monte-Carlo Tree Search achieves a score similar to a novice human player by only using very limited time and computational resources, which paves the way to achieving scores comparable to those of a human expert by combining it with the use of deep reinforcement learning.
研究动机与目标
- 研究使用蒙特卡洛树搜索(MCTS)优化《星际争霸II》构建顺序的可行性。
- 评估MCTS在孤立状态下于‘BuildMarines’小游戏中的表现,该小游戏是宏观策略学习的简化环境。
- 识别纯MCTS在计算资源受限下难以达到专家水平表现的局限性。
- 为将MCTS与深度强化学习结合奠定基础,以显著提升优化效率与结果质量。
提出的方法
- 智能体使用基于关键游戏变量的抽象状态表示:建造补给站、兵营和陆战队员的所需时间。
- MCTS使用UCB1选择策略,探索参数β = 1/√2。
- 动作包括无操作、训练工人、建造补给站、建造兵营和训练陆战队员,状态转移根据所选动作更新。
- 生产队列时间每帧推进,矿物采集以与工人数量成比例的速率模拟。
- 游戏持续约10分钟,最终得分为终止时存活的陆战队员数量。
- MCTS智能体在每个时间步执行多次迭代,结果在不同迭代次数限制(1至10)下收集。
实验结果
研究问题
- RQ1MCTS能否单独在《星际争霸II》‘BuildMarines’小游戏中实现有竞争力的构建顺序优化?
- RQ2增加MCTS迭代次数对最终陆战队员数量的表现有何影响?
- RQ3在该环境中,纯MCTS的性能上限是多少?与新手和专家人类玩家相比如何?
- RQ4深度强化学习神经网络在多大程度上可通过用价值函数估计替代高成本的模拟,来提升MCTS性能?
主要发现
- MCTS智能体在5次迭代时达到最高分94名陆战队员,表现与新手人类玩家相当。
- 当迭代次数在3至10之间时,得分稳定在90至94名之间,表明增加迭代次数带来的收益递减。
- 在测试的迭代范围内,得分未显著超过94名陆战队员,表明纯MCTS存在计算限制。
- 结果表明,要获得超过100名陆战队员的得分,需大幅增加计算时间,暗示纯MCTS不足以实现专家水平表现。
- 研究结论认为,必须集成深度强化学习神经网络以降低模拟成本,并在固定时间约束下实现更深、更高效的搜索。
- MCTS与深度强化学习的结合有望使智能体达到与专家人类玩家相当的性能水平。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。