Skip to main content
QUICK REVIEW

[论文解读] Neural Fictitious Self-Play on ELF Mini-RTS

Keigo Kawamura, Yoshimasa Tsuruoka|arXiv (Cornell University)|Feb 6, 2019
Reinforcement Learning in Robotics参考文献 20被引用 5
一句话总结

该论文将神经虚构自对弈(NFSP)应用于ELF平台上的Mini-RTS,结合策略梯度强化学习与NFSP,以寻找一种更难被利用、具有博弈论性质的策略。通过使用策略梯度方法对NFSP智能体进行原始自对弈预训练,显著提升了可扩展性与收敛速度,即使在自对弈缺乏理论收敛保证的情况下,仍能获得强大且稳定的策略。

ABSTRACT

Despite the notable successes in video games such as Atari 2600, current AI is yet to defeat human champions in the domain of real-time strategy (RTS) games. One of the reasons is that an RTS game is a multi-agent game, in which single-agent reinforcement learning methods cannot simply be applied because the environment is not a stationary Markov Decision Process. In this paper, we present a first step toward finding a game-theoretic solution to RTS games by applying Neural Fictitious Self-Play (NFSP), a game-theoretic approach for finding Nash equilibria, to Mini-RTS, a small but nontrivial RTS game provided on the ELF platform. More specifically, we show that NFSP can be effectively combined with policy gradient reinforcement learning and be applied to Mini-RTS. Experimental results also show that the scalability of NFSP can be substantially improved by pretraining the models with simple self-play using policy gradients, which by itself gives a strong strategy despite its lack of theoretical guarantee of convergence.

研究动机与目标

  • 通过NFSP开发实时战略(RTS)游戏的博弈论解法,解决多智能体环境中非平稳性带来的挑战。
  • 将NFSP应用于ELF平台上的Mini-RTS,这是一个非平凡的、不完美信息的RTS游戏,以计算接近纳什均衡的策略组合。
  • 通过使用策略梯度方法对原始自对弈进行预训练,提升NFSP的可扩展性与训练效率。
  • 评估使用快速但不稳定的自对弈进行预训练,是否能提升NFSP在复杂RTS环境中的性能与稳定性。

提出的方法

  • NFSP被应用于Mini-RTS,作为两人、零和、不完美信息的广义形式博弈。
  • NFSP智能体采用双头神经网络:强化学习(RL)头用于计算最佳响应策略,监督学习(SL)头用于策略平均。
  • RL组件使用近端策略优化(PPO)来计算对对手平均策略的最佳响应。
  • SL组件维护一个过去策略的回放缓冲区,并计算加权平均以形成元策略。
  • 预训练通过先使用PPO对RL头进行原始自对弈训练,然后将相同策略参数初始化SL头来完成。
  • 预训练过程通过利用PPO的快速学习能力,同时保留NFSP的理论收敛保证,实现了更快的收敛速度与更好的稳定性。

实验结果

研究问题

  • RQ1NFSP能否与策略梯度强化学习有效结合,以在Mini-RTS中找到稳定且更难被利用的策略?
  • RQ2使用PPO对NFSP智能体进行原始自对弈预训练,如何影响其可扩展性与收敛速度?
  • RQ3尽管原始自对弈缺乏理论收敛保证,预训练是否仍能提升NFSP相比从零开始训练的性能?
  • RQ4预训练策略能否在对抗强基线AI(如AI-Simple与AI-Hit-and-Run)时保持或提升最终智能体的性能?
  • RQ5预训练在多大程度上缓解了NFSP的缓慢收敛问题,同时保持其博弈论稳定性?

主要发现

  • 使用PPO对原始自对弈进行预训练,显著加速了学习过程,并相比从零开始训练NFSP,显著提升了可扩展性。
  • 该预训练方法生成的策略在对抗基线AI时表现强劲,即使基础自对弈策略稍弱,胜率仍能稳定在高水平。
  • 经过预训练的NFSP智能体优于未预训练的NFSP,实现了更稳定且更难被利用的策略组合。
  • 预训练方法成功利用了PPO的快速学习能力,同时保留了NFSP的收敛保证,从而构建出稳健且可扩展的训练流程。
  • 实验结果表明,该预训练方法显著减少了计算时间,即使在自对弈算法出现振荡的情况下也表现出有效性,显示出在复杂游戏环境中的实际优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。