Skip to main content
QUICK REVIEW

[論文レビュー] Multiplayer AlphaZero

Nick Petosa, Tucker Balch|arXiv (Cornell University)|Oct 29, 2019
Artificial Intelligence in Games参考文献 7被引用数 12
ひとこと要約

本論文では、マルチプレイヤーで非ゼロサムなゲームに拡張された自己対戦強化学習を可能にする、AlphaZeroアルゴリズムの変更版であるMultiplayer AlphaZeroを提案する。モンテカルロ木探索(MCTS)を全プレイヤーを順に回す形に変更し、価値関数と方策関数のヘッドを複数エージェントの結果に対応させる。これにより、有効な自己対戦学習が可能となる。本手法は、3人用のゲーム2つ(Tic-Tac-MoとConnect 3x3)において、より少ないロールアウト回数でMCTSベースラインを常に上回る強力なエージェントを学習し、AlphaZeroをマルチプレイヤー環境に適用可能であることを示している。

ABSTRACT

The AlphaZero algorithm has achieved superhuman performance in two-player, deterministic, zero-sum games where perfect information of the game state is available. This success has been demonstrated in Chess, Shogi, and Go where learning occurs solely through self-play. Many real-world applications (e.g., equity trading) require the consideration of a multiplayer environment. In this work, we suggest novel modifications of the AlphaZero algorithm to support multiplayer environments, and evaluate the approach in two simple 3-player games. Our experiments show that multiplayer AlphaZero learns successfully and consistently outperforms a competing approach: Monte Carlo tree search. These results suggest that our modified AlphaZero can learn effective strategies in multiplayer game scenarios. Our work supports the use of AlphaZero in multiplayer games and suggests future research for more complex environments.

研究の動機と目的

  • 元々2人ゼロサム対戦ゲームを想定していたAlphaZeroアルゴリズムを、マルチプレイヤー環境に拡張すること。
  • 完全情報の非ゼロサムマルチプレイヤーゲームにおいて、自己対戦強化学習が効果的にエージェントを訓練できるかを調査すること。
  • 複数プレイヤーと非対称な結果を扱えるように、マルチプレイヤー用に修正されたMCTSとニューラルネットワークアーキテクチャを開発・評価すること。
  • マルチプレイヤー用AlphaZeroの性能を、MCTSベースラインおよび人間プレイヤーと比較するための実証的ベンチマークを確立すること。

提案手法

  • ロールアウト中に2人対戦の代わりに全プレイヤーを順に回すように変更したMCTSを採用し、マルチエージェント木探索を可能にする。
  • 単一プレイヤー用の価値ヘッドを、各プレイヤーの期待利得を出力するベクトルを出力するマルチプレイヤー用価値ヘッドに置き換え。
  • 行動の確率分布を維持したが、探索中に現在のプレイヤーの視点に合わせて適応した方策ヘッドを採用。
  • エージェント同士が対戦する自己対戦学習ループを用い、遷移をリプレイバッファに保存して学習に使用。
  • 盤面状態を処理し、価値と方策の出力を予測する、残差畳み込みニューラルネットワークを、SENetに類似したアーキテクチャで訓練。
  • 価値予測のための平均二乗誤差と方策予測のための交差エントロピーを組み合わせた損失関数を適用し、確率的勾配降下法で最適化。

実験結果

リサーチクエスチョン

  • RQ1アーキテクチャ的およびアルゴリズム的修正を加えることで、AlphaZeroをマルチプレイヤーゲームに成功裏に拡張できるか?
  • RQ2同じロールアウト回数で、修正されたAlphaZeroアルゴリズムはマルチプレイヤー環境において従来のMCTSを上回る性能を示すか?
  • RQ3Tic-Tac-MoやConnect 3x3のような、より深いゲームツリーを持つマルチプレイヤーゲームにおいて、学習されたヒューリスティクスの安定性と一般化性能はどの程度か?
  • RQ4完全収束していないにもかかわらず、人間プレイヤーを上回る十分な一般化性能をエージェントが発揮できるか?

主な発見

  • Tic-Tac-Moでは、50回のロールアウトで3000回のロールアウトを持つMCTSと同等の性能を達成し、高いサンプル効率を示した。
  • Tic-Tac-MoおよびConnect 3x3の両方で、ロールアウト回数が増えるにつれてAlphaZeroはMCTSエージェントを一貫して上回り、スコア差が非負を保った。
  • Connect 3x3では、人間プレイヤーに対して79%の勝率を記録し、収束が不完全であっても強力な一般化性能を示した。
  • トレーニング全体を通して損失関数が安定し、発散しなかったことから、知識の効果的統合と一般化が図られたと示唆された。
  • 損失関数は安定していたが、ネットワークは完全に収束しなかったため、複雑なマルチプレイヤーゲームのマスタリーにはさらなるハイパーパramータチューニングが必要であると示唆された。
  • コントロール用のMCTSエージェントは、同じロールアウト回数であっても、多くの場合AlphaZeroに劣った。これは、学習されたヒューリスティクスの価値を裏付けるものである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。