[论文解读] Which Heroes to Pick? Learning to Draft in MOBA Games with Neural Networks and Tree Search
本文提出 JueWuDraft,一种新颖的多人在线战术竞技场(MOBA)英雄禁选算法,结合神经网络与蒙特卡洛树搜索(MCTS),以优化多轮(胜者为胜N局)禁选过程。通过将禁选过程建模为组合博弈,并引入长期价值估计机制,JueWuDraft 在性能上超越现有最先进方法,尤其在平衡短期收益与多轮比赛中的长期胜率方面表现优异。
Hero drafting is essential in MOBA game playing as it builds the team of each side and directly affects the match outcome. State-of-the-art drafting methods fail to consider: 1) drafting efficiency when the hero pool is expanded; 2) the multi-round nature of a MOBA 5v5 match series, i.e., two teams play best-of-N and the same hero is only allowed to be drafted once throughout the series. In this paper, we formulate the drafting process as a multi-round combinatorial game and propose a novel drafting algorithm based on neural networks and Monte-Carlo tree search, named JueWuDraft. Specifically, we design a long-term value estimation mechanism to handle the best-of-N drafting case. Taking Honor of Kings, one of the most popular MOBA games at present, as a running case, we demonstrate the practicality and effectiveness of JueWuDraft when compared to state-of-the-art drafting methods.
研究动机与目标
- 解决现有 MOBA 禁选方法在处理大规模英雄池和多轮对战结构时的局限性。
- 将胜者为胜N局的禁选过程建模为具有长期战略价值的多轮组合博弈。
- 设计一种价值估计机制,优先考虑未来对局结果,而非即时胜率。
- 提升大规模 MOBA 游戏(如《王者荣耀》中超过100名英雄)中的禁选效率与效果。
- 开发一种实用且可扩展的 AI 禁选系统,适用于真实 MOBA 游戏场景及人类玩家辅助。
提出的方法
- 将 MOBA 禁选过程建模为多轮组合博弈,模拟多局比赛中队伍的选择过程。
- 集成基于神经网络的胜率预测器,以估算完整阵容的对战结果。
- 在蒙特卡洛树搜索(MCTS)中引入长期价值函数,引导禁选决策超越即时收益。
- 设计一种价值机制,以最大化胜者为胜N局系列赛中所有对局的平均预测胜率。
- 通过神经网络进行模拟推演以估计价值,避免在大规模英雄池中进行穷举搜索。
- 实施非贪婪策略,综合考虑未来禁选状态与对手反制策略,从而提升长期胜率。
实验结果
研究问题
- RQ1如何有效将 MOBA 游戏中的英雄禁选建模为多轮组合博弈?
- RQ2基于神经网络的价值估计器是否能超越单轮优化,提升禁选决策质量?
- RQ3在蒙特卡洛树搜索中引入长期价值机制,是否能相比贪婪策略或单轮策略,显著提升胜者为胜N局 MOBA 系列赛的表现?
- RQ4该方法在处理大规模英雄池(如100+名英雄)时,如何在保持计算效率的同时实现可扩展性?
- RQ5在真实 MOBA 游戏环境中,该算法在多大程度上优于现有方法(如 OpenAI Five 和 DraftArtist)?
主要发现
- 在《王者荣耀》的所有实验设置中,JueWuDraft 均优于现有最先进方法,包括 OpenAI Five 和 DraftArtist。
- 该算法在处理大规模英雄池与复杂禁选序列时,展现出更优的效率与效果。
- JueWuDraft 避免了贪婪选择(如优先选择即时预测胜率最高的英雄),转而优先考虑长期战略平衡。
- 在胜者为胜3局系列赛中,即使第一局预测胜率略低,JueWuDraft 仍会选择在第二、三局中带来更高预测胜率的英雄。
- 长期价值机制使多轮表现更加稳定和一致,降低对前期优势的依赖。
- 该方法已实际部署于真实应用场景,包括 PVE 游戏模式及《王者荣耀》中人类玩家的英雄推荐系统。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。