Skip to main content
QUICK REVIEW

[论文解读] Train on Small, Play the Large: Scaling Up Board Games with AlphaZero and GNN

Shai Ben-Assayag, Ran El‐Yaniv|arXiv (Cornell University)|Jul 18, 2021
Educational Games and Gamification参考文献 27被引用 4
一句话总结

本文提出可扩展AlphaZero(SAZ),一种结合图神经网络(GNN)与AlphaZero算法的强化学习框架,可在小尺寸棋盘上进行训练,并在不重新训练的情况下泛化至更大棋盘。通过用GNN替代卷积网络并引入子图采样以减少预测不确定性,SAZ在大棋盘上的表现与AlphaZero相当——仅用三天训练时间(相比AlphaZero的三十天)即实现训练时间缩短十倍,展现出卓越的可扩展性。

ABSTRACT

Playing board games is considered a major challenge for both humans and AI researchers. Because some complicated board games are quite hard to learn, humans usually begin with playing on smaller boards and incrementally advance to master larger board strategies. Most neural network frameworks that are currently tasked with playing board games neither perform such incremental learning nor possess capabilities to automatically scale up. In this work, we look at the board as a graph and combine a graph neural network architecture inside the AlphaZero framework, along with some other innovative improvements. Our ScalableAlphaZero is capable of learning to play incrementally on small boards, and advancing to play on large ones. Our model can be trained quickly to play different challenging board games on multiple board sizes, without using any domain knowledge. We demonstrate the effectiveness of ScalableAlphaZero and show, for example, that by training it for only three days on small Othello boards, it can defeat the AlphaZero model on a large board, which was trained to play the large board for $30$ days.

研究动机与目标

  • 使深度强化学习智能体能够在不从头开始重新训练的情况下,学习适用于多种棋盘尺寸的可扩展棋类策略。
  • 通过用图神经网络(GNN)替代 AlphaZero 的卷积神经网络,克服其固定输入尺寸的限制,实现内在的可扩展性。
  • 通过一种新颖的子图采样技术,减少基于 GNN 的价值和策略网络中的预测不确定性,从而提升模型鲁棒性。
  • 证明在小棋盘上训练的智能体可达到与在大棋盘上长期训练的智能体相当的性能,显著降低计算成本。

提出的方法

  • 用图神经网络(GNN)替代 AlphaZero 中的卷积神经网络(CNN),使模型能够处理任意尺寸的棋盘输入,而无需修改网络架构。
  • 使用 GNN 将棋盘编码为图结构,其中每个交叉点作为节点,相邻交叉点通过边连接,使模型能够学习任意棋盘尺寸下的空间依赖关系。
  • 引入子图采样:从完整棋盘中采样多个子图,使用相同的 GNN 处理每个子图,并对预测结果进行平均或集成,以减少不确定性并提升鲁棒性。
  • 将基于 GNN 的价值和策略网络集成至 AlphaZero 框架中,利用蒙特卡洛树搜索(MCTS)与自我对弈进行策略优化。
  • 仅在小棋盘(如 9×9)上训练模型,并在不针对大棋盘进行任何微调的情况下,评估其在更大棋盘(如 16×16、20×20)上的表现。
  • 在所有棋盘尺寸上使用共享的 GNN 架构,保持参数数量恒定,与输入维度无关。

实验结果

研究问题

  • RQ1在围棋、黑白棋和五子棋等可扩展棋类游戏中,仅在小棋盘上训练的强化学习智能体是否能有效泛化至远大于训练尺寸的大棋盘?
  • RQ2将 AlphaZero 中的 CNN 替换为 GNN 是否能实现在棋盘尺寸上的真正可扩展性,同时保持或提升性能?
  • RQ3子图采样在多大程度上减少了基于 GNN 的智能体的预测不确定性,并提升了其在棋类环境中的泛化能力?
  • RQ4在小棋盘上仅训练三天的模型是否能超越在大棋盘上训练三十天的 AlphaZero 智能体,即使未在大棋盘上直接训练?
  • RQ5当在大棋盘上测试时,该可扩展模型与标准 AlphaZero 的性能相比如何,特别是在胜率和计算效率方面?

主要发现

  • 在 9×9 黑白棋棋盘上仅训练三天的可扩展AlphaZero(SAZ)在对阵在 16×16 棋盘上训练三十天的 AlphaZero 智能体时,取得了 54% 的胜率。
  • 在 20×20 黑白棋棋盘上,SAZ 对阵同一 30 天训练的 AlphaZero 智能体赢得了 84% 的对局,展现出对大棋盘的强大泛化能力。
  • 在 19×19 五子棋棋盘上,SAZ 对阵在相同大棋盘上训练的 AlphaZero 模型实现了 100% 的胜率,尽管未在该尺寸上进行直接训练。
  • 消融实验表明,移除子图采样技术后,黑白棋上的性能下降了 24%,证实其在降低不确定性方面起着关键作用。
  • 在围棋中,SAZ 在 9×9 棋盘上仅训练三天,便以 68% 的胜率击败了在 9×9 棋盘上训练二十天的 AlphaZero 智能体,且在对阵十天训练的 15×15 AlphaZero 模型时胜率达到 77.5%。
  • 未使用子图采样的模型(model4)在黑白棋上表现较差(胜率 28%),但在五子棋上表现提升至 98%,表明在某些游戏中,全局棋盘结构比局部模式更为关键。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。