Skip to main content
QUICK REVIEW

[論文レビュー] Train on Small, Play the Large: Scaling Up Board Games with AlphaZero and GNN

Shai Ben-Assayag, Ran El‐Yaniv|arXiv (Cornell University)|Jul 18, 2021
Educational Games and Gamification参考文献 27被引用数 4
ひとこと要約

本稿では、スケーラブル・アルファゼロ(SAZ)を提案する。SAZは、グラフニューラルネットワーク(GNN)とアルファゼロアルゴリズムを組み合わせた強化学習フレームワークであり、再訓練を伴わずに小規模なチェス盤で学習し、大規模な盤に一般化できる。畳み込みネットワークの代わりにGNNを採用し、予測不確実性を低減するための部分グラフサンプリングを導入することで、大規模な盤でもアルファゼロと同等の性能を達成。3日間の学習で実現可能であり、30日間の学習に比べ10倍の高速化を達成。スケーラビリティに優れた性能を示している。

ABSTRACT

Playing board games is considered a major challenge for both humans and AI researchers. Because some complicated board games are quite hard to learn, humans usually begin with playing on smaller boards and incrementally advance to master larger board strategies. Most neural network frameworks that are currently tasked with playing board games neither perform such incremental learning nor possess capabilities to automatically scale up. In this work, we look at the board as a graph and combine a graph neural network architecture inside the AlphaZero framework, along with some other innovative improvements. Our ScalableAlphaZero is capable of learning to play incrementally on small boards, and advancing to play on large ones. Our model can be trained quickly to play different challenging board games on multiple board sizes, without using any domain knowledge. We demonstrate the effectiveness of ScalableAlphaZero and show, for example, that by training it for only three days on small Othello boards, it can defeat the AlphaZero model on a large board, which was trained to play the large board for $30$ days.

研究の動機と目的

  • 再訓練を一切行わずに、複数の盤サイズにわたるスケーラブルなチェスゲーム戦略を、深層強化学習エージェントが学習可能とする。
  • アルファゼロの固定サイズ入力制限を克服するため、畳み込みニューラルネットワークの代わりに、内在的なスケーラビリティを持つグラフニューラルネットワーク(GNN)を採用する。
  • GNNベースの価値関数および方策関数における予測不確実性を低減するため、新たな部分グラフサンプリング技術を導入し、モデルのロバスト性を向上させる。
  • 小規模な盤での学習が、大規模な盤で長期間訓練されたエージェントと競合可能な性能を発揮できることを示し、計算コストを大幅に削減する。

提案手法

  • アルファゼロの畳み込みニューラルネットワーク(CNN)をグラフニューラルネットワーク(GNN)に置き換え、アーキテクチャの変更なしに可変サイズの盤入力を処理可能にする。
  • GNNを用いて盤をグラフとして符号化し、各交点をノードとし、隣接する交点同士をエッジで接続することで、任意の盤サイズで空間的依存関係を学習可能にする。
  • 部分グラフサンプリングを導入:全盤から複数の部分グラフをサンプリングし、同じGNNで処理した後、予測結果を平均化またはアンサンブルすることで、不確実性を低減し、モデルのロバスト性を向上させる。
  • GNNベースの価値関数および方策関数をアルファゼロフレームワークに統合し、自己対戦による方策改善にモンテカルロツリー探索(MCTS)を用いる。
  • モデルを小規模な盤(例:9×9)でのみ学習し、大規模な盤(例:16×16、20×20)での評価を、大規模盤での微調整なしに行う。
  • すべての盤サイズで同一のGNNアーキテクチャを共有し、入力次元に関係なく、パラメータ数を一定に保つ。

実験結果

リサーチクエスチョン

  • RQ1オセロ、ゴンブルク、囲碁のようなスケーラブルなゲームにおいて、小規模な盤サイズで学習した強化学習エージェントが、はるかに大きな盤サイズに効果的に一般化できるか?
  • RQ2アルファゼロのCNNをGNNに置き換えることで、盤サイズにわたる真正のスケーラビリティが達成され、性能が維持または向上するか?
  • RQ3部分グラフサンプリングは、GNNベースのエージェントにおける予測不確実性をどの程度低減し、チェスゲーム環境における一般化性能を向上させるか?
  • RQ4大規模な盤で直接学習していないにもかかわらず、小規模な盤で3日間だけ学習したモデルが、大規模な盤で30日間学習したアルファゼロエージェントを上回る性能を示せるか?
  • RQ5特に勝率と計算効率の観点から、大規模な盤上で標準的なアルファゼロと比較して、スケーラブルモデルの性能はどの程度か?

主な発見

  • 9×9オセロ盤で3日間学習したスケーラブル・アルファゼロ(SAZ)は、16×16盤で30日間学習したアルファゼロエージェントに対して54%の勝率を記録した。
  • 20×20オセロ盤では、同じ30日間学習のアルファゼロエージェントに対して84%の勝率を記録し、大規模な盤への強力な一般化能力を示した。
  • 19×19ゴンブルクでは、同じ大規模盤で学習したアルファゼロモデルに対して、直接の学習が行われていないにもかかわらず100%の勝率を達成した。
  • アブレーションスタディの結果、部分グラフサンプリング技術を削除するとオセロで24%の性能低下が生じ、不確実性低減におけるその重要性が確認された。
  • 囲碁では、9×9盤で3日間学習したSAZは、9×9盤で20日間学習したアルファゼロエージェントに対して68%の勝率を記録し、15×15盤で10日間学習したモデルに対しても77.5%の勝率を記録した。
  • 部分グラフサンプリングを導入しないモデル(model4)は、オセロでは28%の勝率にとどまり、性能が著しく低下したが、ゴンブルクでは98%まで向上した。これは、特定のゲームではグローバルな盤構造がローカルパターンよりも重要であることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。