Skip to main content
QUICK REVIEW

[论文解读] Monte Carlo Q-learning for General Game Playing

Hui Wang, Michael Emmerich|arXiv (Cornell University)|Feb 16, 2018
Artificial Intelligence in Games参考文献 14被引用 14
一句话总结

本文提出 QM-learning,一种将蒙特卡洛搜索(MCS)整合到 Q-learning 循环中的混合强化学习方法,以加速通用游戏对弈(GGP)中的收敛速度。在井字棋、连环四子棋和十六子棋等小型游戏上评估,QM-learning 显著提升了学习速度和胜率,对随机玩家达到 87.5% 的胜率,尽管仍不及 MCTS 在小型游戏中的完美对弈表现。

ABSTRACT

After the recent groundbreaking results of AlphaGo, we have seen a strong interest in reinforcement learning in game playing. General Game Playing (GGP) provides a good testbed for reinforcement learning. In GGP, a specification of games rules is given. GGP problems can be solved by reinforcement learning. Q-learning is one of the canonical reinforcement learning methods, and has been used by (Banerjee & Stone, IJCAI 2007) in GGP. In this paper we implement Q-learning in GGP for three small-board games (Tic-Tac-Toe, Connect Four, Hex), to allow comparison to Banerjee et al. As expected, Q-learning converges, although much slower than MCTS. Borrowing an idea from MCTS, we enhance Q-learning with Monte Carlo Search, to give QM-learning. This enhancement improves the performance of pure Q-learning. We believe that QM-learning can also be used to improve performance of reinforcement learning further for larger games, something which we will test in future work.

研究动机与目标

  • 评估经典表格型 Q-learning 在通用游戏对弈(GGP)环境中的性能与收敛速度。
  • 通过将蒙特卡洛搜索(MCS)整合到 Q-learning 循环中,解决 Q-learning 在 GGP 中收敛缓慢的问题。
  • 在小型双人零和游戏中,将改进后的 QM-learning 方法与 MCTS 及基线 Q-learning 进行对比。
  • 研究自适应 epsilon 调度对 Q-learning 在 GGP 中性能的影响。
  • 探索将 QM-learning 扩展至更大规模游戏或与神经网络架构结合的可行性。

提出的方法

  • 为三种小型 GGP 游戏(井字棋、连环四子棋和十六子棋)实现基于表格的 Q-learning。
  • 将蒙特卡洛搜索(MCS)整合到 Q-learning 更新循环中,形成 QM-learning,其中 MCS 在学习过程中指导动作选择。
  • 采用 UCT 风格的树策略,通过交替最大化与最小化实现双人游戏中的对手建模。
  • 应用动态 epsilon-greedy 策略,随学习阶段递减,以平衡探索与利用。
  • 将每次走步的 MCS 时间限制在 50ms,以模拟实时约束,与 MCTS 的 10 秒时间限制形成对比。
  • 使用游戏管理器(GM)和 GDL 解释器执行对局并收集性能数据。

实验结果

研究问题

  • RQ1经典 Q-learning 是否能在通用游戏对弈环境中收敛,其收敛速度与 MCTS 相比如何?
  • RQ2将蒙特卡洛搜索整合到 Q-learning 循环中,是否能显著提升学习效率与最终性能?
  • RQ3自适应 epsilon 调度对 Q-learning 在 GGP 中的收敛速度与胜率有何影响?
  • RQ4QM-learning 在井字棋等小型 GGP 游戏中,相较于标准 Q-learning 能在多大程度上实现性能提升?
  • RQ5QM-learning 框架是否可扩展至更大规模游戏,或与深度学习架构结合?

主要发现

  • 经典 Q-learning 能在 GGP 游戏中收敛,但学习速度显著慢于 MCTS,在井字棋中未能实现完美对弈。
  • QM-learning 通过将 MCS 整合到 Q-learning 循环中,提升了收敛速度与性能,对随机玩家胜率达到 87.5%,略高于 Q-learning 的 86.5%。
  • 由于游戏状态空间较小,MCTS 在井字棋中实现完美对弈,对 QPlayer 和 QMPlayer 的胜率均为 100%。
  • QM-learning 在学习初期表现优于 Q-learning,得益于 MCS 引导的探索,能更快学习高回报策略。
  • 随时间递减的动态 epsilon 调度优于固定 epsilon,提升了收敛性能。
  • 尽管有所改进,QM-learning 仍无法在小型游戏中达到 MCTS 的性能,表明在缺乏更深层架构扩展的情况下,其可扩展性存在局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。