[论文解读] On Reinforcement Learning for Full-length Game of StarCraft
本文提出了一种结合宏观动作(macro-actions)与课程迁移学习的分层强化学习方法,用于训练在完整《星际争霸II》游戏中表现优异的智能体。通过两级架构与奖励塑形,该智能体在计算资源有限的条件下,在64×64地图上对难度等级-1的人工智能对手取得了超过99%的胜率,对最强非作弊内置人工智能(等级7)的胜率也超过93%。
StarCraft II poses a grand challenge for reinforcement learning. The main difficulties of it include huge state and action space and a long-time horizon. In this paper, we investigate a hierarchical reinforcement learning approach for StarCraft II. The hierarchy involves two levels of abstraction. One is the macro-action automatically extracted from expert's trajectories, which reduces the action space in an order of magnitude yet remains effective. The other is a two-layer hierarchical architecture which is modular and easy to scale, enabling a curriculum transferring from simpler tasks to more complex tasks. The reinforcement training algorithm for this architecture is also investigated. On a 64x64 map and using restrictive units, we achieve a winning rate of more than 99\% against the difficulty level-1 built-in AI. Through the curriculum transfer learning algorithm and a mixture of combat model, we can achieve over 93\% winning rate of Protoss against the most difficult non-cheating built-in AI (level-7) of Terran, training within two days using a single machine with only 48 CPU cores and 8 K40 GPUs. It also shows strong generalization performance, when tested against never seen opponents including cheating levels built-in AI and all levels of Zerg and Protoss built-in AI. We hope this study could shed some light on the future research of large-scale reinforcement learning.
研究动机与目标
- 为解决完整《星际争霸II》游戏中大规模状态与动作空间、长时序以及部分可观测性带来的挑战。
- 开发一种可扩展、模块化的分层强化学习架构,以简化大规模训练过程。
- 通过课程迁移学习与有效的奖励设计,提升样本效率与学习稳定性。
- 在计算资源有限的条件下,实现对内置人工智能对手的优异性能表现。
提出的方法
- 采用两级分层架构,高层控制器选择子策略,低层策略执行由专家示范提取的宏观动作。
- 从专家轨迹中提取宏观动作,使动作空间降低一个数量级,同时保持战略有效性。
- 采用课程迁移学习策略,从简单到困难的人工智能对手逐步训练智能体,提升泛化能力与收敛性。
- 奖励塑形结合胜负信号与人工设计奖励,引导策略学习,避免次优行为。
- 采用单机设置,配备4块GPU与48个CPU线程,使用多种战斗模型的混合策略以提升鲁棒性。
- 超参数调优聚焦于每轮迭代的训练回合数,以稳定学习过程,其余参数影响较小。
实验结果
研究问题
- RQ1结合宏观动作的分层强化学习架构是否能有效降低完整《星际争霸II》游戏的复杂性,同时保持高性能?
- RQ2课程迁移学习在复杂、长时序游戏中对样本效率与最终策略性能有何影响?
- RQ3基于结果的奖励(胜负)与人工设计奖励相比,对学习稳定性与最终胜率的相对影响如何?
- RQ4该模块化两级架构相较于非分层设计,如何实现更好的可扩展性与子策略替换能力?
- RQ5在大规模《星际争霸II》训练中,哪些超参数对学习收敛性与性能影响最为显著?
主要发现
- 采用宏观动作的分层架构在仅使用4块GPU与48个CPU线程的条件下,在64×64地图上对内置难度等级-1的人工智能对手取得了超过99%的胜率。
- 结合战斗网络与规则策略的混合模型在对最困难非作弊人工智能(等级7)的对战中取得了最高胜率(超过93%)。
- 在高难度等级下,分层架构显著优于非分层单策略基线模型,凸显了抽象化与模块化设计的价值。
- 仅使用基于结果的(胜负)奖励时,智能体在等级7对手上表现极差;而人工设计奖励显著提升了学习稳定性和最终结果。
- 增加每轮训练迭代的回合数可提升学习稳定性与收敛性,尤其在高难度环境下效果更明显。
- 本研究表明,课程学习与奖励设计在实现大规模、长时序强化学习任务的优异性能方面至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。