Skip to main content
QUICK REVIEW

[论文解读] Which Heroes to Pick? Learning to Draft in MOBA Games with Neural Networks and Tree Search

Sheng Chen, Menghui Zhu|arXiv (Cornell University)|Dec 18, 2020
Artificial Intelligence in Games参考文献 41被引用 4
一句话总结

本文提出 JueWuDraft,一种新颖的多人在线战术竞技场(MOBA)英雄禁选算法,结合神经网络与蒙特卡洛树搜索(MCTS),以优化多轮(胜者为胜N局)禁选过程。通过将禁选过程建模为组合博弈,并引入长期价值估计机制,JueWuDraft 在性能上超越现有最先进方法,尤其在平衡短期收益与多轮比赛中的长期胜率方面表现优异。

ABSTRACT

Hero drafting is essential in MOBA game playing as it builds the team of each side and directly affects the match outcome. State-of-the-art drafting methods fail to consider: 1) drafting efficiency when the hero pool is expanded; 2) the multi-round nature of a MOBA 5v5 match series, i.e., two teams play best-of-N and the same hero is only allowed to be drafted once throughout the series. In this paper, we formulate the drafting process as a multi-round combinatorial game and propose a novel drafting algorithm based on neural networks and Monte-Carlo tree search, named JueWuDraft. Specifically, we design a long-term value estimation mechanism to handle the best-of-N drafting case. Taking Honor of Kings, one of the most popular MOBA games at present, as a running case, we demonstrate the practicality and effectiveness of JueWuDraft when compared to state-of-the-art drafting methods.

研究动机与目标

  • 解决现有 MOBA 禁选方法在处理大规模英雄池和多轮对战结构时的局限性。
  • 将胜者为胜N局的禁选过程建模为具有长期战略价值的多轮组合博弈。
  • 设计一种价值估计机制,优先考虑未来对局结果,而非即时胜率。
  • 提升大规模 MOBA 游戏(如《王者荣耀》中超过100名英雄)中的禁选效率与效果。
  • 开发一种实用且可扩展的 AI 禁选系统,适用于真实 MOBA 游戏场景及人类玩家辅助。

提出的方法

  • 将 MOBA 禁选过程建模为多轮组合博弈,模拟多局比赛中队伍的选择过程。
  • 集成基于神经网络的胜率预测器,以估算完整阵容的对战结果。
  • 在蒙特卡洛树搜索(MCTS)中引入长期价值函数,引导禁选决策超越即时收益。
  • 设计一种价值机制,以最大化胜者为胜N局系列赛中所有对局的平均预测胜率。
  • 通过神经网络进行模拟推演以估计价值,避免在大规模英雄池中进行穷举搜索。
  • 实施非贪婪策略,综合考虑未来禁选状态与对手反制策略,从而提升长期胜率。

实验结果

研究问题

  • RQ1如何有效将 MOBA 游戏中的英雄禁选建模为多轮组合博弈?
  • RQ2基于神经网络的价值估计器是否能超越单轮优化,提升禁选决策质量?
  • RQ3在蒙特卡洛树搜索中引入长期价值机制,是否能相比贪婪策略或单轮策略,显著提升胜者为胜N局 MOBA 系列赛的表现?
  • RQ4该方法在处理大规模英雄池(如100+名英雄)时,如何在保持计算效率的同时实现可扩展性?
  • RQ5在真实 MOBA 游戏环境中,该算法在多大程度上优于现有方法(如 OpenAI Five 和 DraftArtist)?

主要发现

  • 在《王者荣耀》的所有实验设置中,JueWuDraft 均优于现有最先进方法,包括 OpenAI Five 和 DraftArtist。
  • 该算法在处理大规模英雄池与复杂禁选序列时,展现出更优的效率与效果。
  • JueWuDraft 避免了贪婪选择(如优先选择即时预测胜率最高的英雄),转而优先考虑长期战略平衡。
  • 在胜者为胜3局系列赛中,即使第一局预测胜率略低,JueWuDraft 仍会选择在第二、三局中带来更高预测胜率的英雄。
  • 长期价值机制使多轮表现更加稳定和一致,降低对前期优势的依赖。
  • 该方法已实际部署于真实应用场景,包括 PVE 游戏模式及《王者荣耀》中人类玩家的英雄推荐系统。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。