Skip to main content
QUICK REVIEW

[論文レビュー] Application of Self-Play Reinforcement Learning to a Four-Player Game of Imperfect Information

Henry Charlesworth|arXiv (Cornell University)|Aug 30, 2018
Artificial Intelligence in Games参考文献 9被引用数 6
ひとこと要約

この論文は、複雑な行動空間を有する4人用の不完全情報カードゲームであるBig 2に対する、新規の自己対戦強化学習フレームワークを紹介する。Proximal Policy Optimization (PPO) を用いて、純粋な自己対戦による深層ニューラルネットワークの訓練を実施し、木探索や相手のサンプリングを用いずに、アマチュア人間プレーヤーよりも顕著に優れた超人間レベルのパフォーマンスを達成した。

ABSTRACT

We introduce a new virtual environment for simulating a card game known as "Big 2". This is a four-player game of imperfect information with a relatively complicated action space (being allowed to play 1,2,3,4 or 5 card combinations from an initial starting hand of 13 cards). As such it poses a challenge for many current reinforcement learning methods. We then use the recently proposed "Proximal Policy Optimization" algorithm to train a deep neural network to play the game, purely learning via self-play, and find that it is able to reach a level which outperforms amateur human players after only a relatively short amount of training time and without needing to search a tree of future game states.

研究の動機と目的

  • 不完全情報を持つゲーム向けにスケーラブルでアクセス可能なマルチエージェント強化学習環境の開発。
  • 自己対戦による深層強化学習が、モンテカルロ木探索や相手モデル化に依存せずに、Big 2のような複雑な4人トランプゲームをマスターできるかの評価。
  • PPOが高次元の行動空間と部分的観測を伴う非定常的でマルチエージェント環境において、効果的に機能するかの検証。
  • Big 2を次世代マルチエージェントRLアルゴリズムのベンチマークとして確立すること。

提案手法

  • 著者らは、カードのレーティング、スートの順序、有効な手役(例:ストレート、フルハウス、フラッシュ)を含む、標準的なルールを遵守するBig 2用の仮想シミュレーション環境を構築した。
  • 深層ニューラルネットワークは、一般化された利得推定(GAE)を用いて、行動の優位性を推定する価値関数と、方策 π(a|s) を同時に学習するProximal Policy Optimization (PPO) を用いて訓練された。
  • 自己対戦による訓練は、現在の方策の4つのコピーを用い、20ステップのロールアウトで48本の並列ゲームから経験を収集し、バッチサイズ960のミニバッチを用いた。
  • モデルは1台のGPU搭載PC上で1億5000万ステップ(156,250回の更新)の訓練を実施し、将来の状態のシミュレーションを一切行わず、現在のゲーム状態のみを入力として使用した。
  • 相手のサンプリングやカリキュラム学習は使用せず、訓練中は常に最新の自身のバージョンと対戦した。
  • パフォーマンスはランダムエージェントおよび以前のネットワークチェックポイントとの対戦で評価され、人間対AI対戦は公開のWebインターフェースを通じて実施された。

実験結果

リサーチクエスチョン

  • RQ1自己対戦による深層強化学習は、複雑な行動空間を有する4人用不完全情報ゲームで超人間レベルのパフォーマンスを達成できるか?
  • RQ2PPOは、高次元の行動空間と部分的観測を伴う非定常的でマルチエージェント環境に効果的に一般化できるか?
  • RQ3モンテカルロ木探索や将来のゲーム状態に対するヒューリスティック探索に依存せずに、深層RLエージェントはBig 2で強力な戦略を学習できるか?
  • RQ4訓練中にパフォーマンスはどのように変化するか?観察された訓練期間を超えても向上が続くか?
  • RQ5訓練済みエージェントは、直接対戦において経験豊富なアマチュア人間プレーヤーを一貫して上回ることができるか?

主な発見

  • 最初の1,000回の訓練更新以内に、3体のランダムプレーヤーに対して顕著な正のスコアを達成し、初期段階での急速な学習が示された。
  • 訓練の全期間にわたりパフォーマンスが着実に向上したため、より長い訓練期間でさらなる向上が期待できることが示唆された。
  • 最終モデルは、直接対戦でテストされたすべてのアマチュア人間プレーヤーを、勝率と最終スコアの両面で顕著に上回った。
  • 標準的なPPOの設定を超えるハイパーパrameterチューニングは必要とせず、相手のサンプリングなしで安定した収束を示した。
  • エージェントは、将来のゲーム状態のシミュレーションや木探索を一切行わず、現在のゲーム状態のみを用いて効果的にプレイする戦略を学習した。
  • 結果として、PPOが補助的な探索機構を用いずに、複雑でマルチエージェント的かつ不完全情報のゲームに成功裏に適用可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。