[论文解读] Hierarchical Reinforcement Learning for Multi-agent MOBA Game
本文提出了一种用于多人在线战术竞技场(MOBA)游戏(如《王者荣耀》)的分层强化学习(HRL)框架,结合模仿学习进行宏观策略决策,以及深度强化学习进行微观操作。该方法在5v5模式下对青铜级别AI实现了100%胜率,并显著优于PPO基线模型,证明了其在样本高效、无API训练环境下的有效性。
Real Time Strategy (RTS) games require macro strategies as well as micro strategies to obtain satisfactory performance since it has large state space, action space, and hidden information. This paper presents a novel hierarchical reinforcement learning model for mastering Multiplayer Online Battle Arena (MOBA) games, a sub-genre of RTS games. The novelty of this work are: (1) proposing a hierarchical framework, where agents execute macro strategies by imitation learning and carry out micromanipulations through reinforcement learning, (2) developing a simple self-learning method to get better sample efficiency for training, and (3) designing a dense reward function for multi-agent cooperation in the absence of game engine or Application Programming Interface (API). Finally, various experiments have been performed to validate the superior performance of the proposed method over other state-of-the-art reinforcement learning algorithms. Agent successfully learns to combat and defeat bronze-level built-in AI with 100% win rate, and experiments show that our method can create a competitive multi-agent for a kind of mobile MOBA game {\it King of Glory} in 5v5 mode.
研究动机与目标
- 解决在无游戏引擎或API访问条件下训练有效AI智能体的挑战。
- 通过密集且实时的奖励设计,克服复杂高维MOBA环境中稀疏延迟奖励的问题。
- 通过全局状态表征与通信机制,实现在5v5 MOBA场景下的高效多智能体协作。
- 通过引入利用过往成功决策的自学习方法,提升深度强化学习的样本效率。
- 开发适用于移动端的轻量化训练流程,结合基于视频的特征提取与轻量级多目标检测技术。
提出的方法
- 构建两级分层强化学习架构:宏观策略智能体通过人类对战行为的模仿学习,决定移动与战术决策;微观动作智能体则基于PPO强化学习,实现实时技能释放与战斗操作。
- 设计密集且实时的奖励函数,基于对目标的接近程度、敌方单位消灭情况以及团队协作表现提供反馈,即使在无游戏引擎API的情况下亦可实现。
- 集成多目标检测技术,从游戏画面帧中提取全局状态特征(如友方/敌方单位位置、防御塔状态)作为强化学习智能体的输入。
- 采用A*路径规划算法辅助导航决策,提升移动效率并减少探索时间。
- 设计自学习机制,将当前策略与过往高性能轨迹进行对比,以优化策略并加速收敛。
- 部署分布式采样平台,以扩展数据收集规模,降低移动端训练时间。
实验结果
研究问题
- RQ1结合模仿学习与深度强化学习的分层强化学习框架,是否能在无游戏引擎API或录像回放访问条件下,在MOBA游戏中实现优异性能?
- RQ2在稀疏奖励的MOBA环境中,密集且实时的奖励函数在提升样本效率与学习稳定性方面效果如何?
- RQ3从过往成功轨迹中进行自学习,在多智能体MOBA设置中对策略收敛与胜率提升的贡献程度如何?
- RQ4将多目标检测用于全局状态表征,对多智能体协作与团队表现的影响如何?
- RQ5所提出的HRL框架是否能在资源受限的移动端部署条件下,实现人类水平或超人类水平的性能表现?
主要发现
- 所提出的HRL框架在5v5模式下对青铜级别内置AI实现了100%胜率,展现出强大的泛化能力与战术执行力。
- 在1v1模式下,HRL智能体对简单难度AI胜率为89%,对中等难度AI胜率为83%,显著优于PPO基线模型(分别为62%与60%)。
- 自学习方法提升了训练效率,使智能体能够实现正向平均奖励,并随训练时间持续提升性能,约600个训练回合后学习趋于稳定。
- 消融实验验证了各模块的关键作用:若移除宏观策略、多智能体协作、全局奖励或自学习机制,胜率将下降至52%–60%,凸显其必要性。
- 多目标检测在5v5模式下达到82%准确率,在1v1模式下达到80%准确率,为团队协作提供了可靠且关键的全局状态输入。
- 尽管未访问游戏引擎或API,该方法仍实现了具有竞争力的性能,证明了在移动端实现端到端、基于视频的训练的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。