Skip to main content
QUICK REVIEW

[論文レビュー] Multiplayer Support for the Arcade Learning Environment

Justin K. Terry, Benjamin Black|arXiv (Cornell University)|Sep 20, 2020
Reinforcement Learning in Robotics参考文献 19被引用数 5
ひとこと要約

本論文は、Arcade Learning Environment (ALE) にマルチプレイヤー対応を導入し、2〜4名のプレイヤーが参加可能な18種類のAtari 2600ゲームへのプログラム的アクセスを可能にする拡張されたALE APIと、PettingZooとの統合を通じてGymに類似したインターフェースを提供する。Ape-X DQNを用いたセルフプレイベースラインを提示し、一部のゲーム(例:Joust、Wizard of Wor)が混合ゲーム理論的構造のため病理的トレーニングを示すことが判明。これは、リーグ制トレーニングなどの高度なトレーニング制度の必要性を示唆する。

ABSTRACT

The Arcade Learning Environment ("ALE") is a widely used library in the reinforcement learning community that allows easy programmatic interfacing with Atari 2600 games, via the Stella emulator. We introduce a publicly available extension to the ALE that extends its support to multiplayer games and game modes. This interface is additionally integrated with PettingZoo to allow for a simple Gym-like interface in Python to interact with these games. We additionally introduce experimental baselines for all environments included.

研究の動機と目的

  • Arcade Learning Environment (ALE) を拡張し、従来シングルエージェント設定に限定されていたマルチプレイヤーAtari 2600ゲームをサポートすること。
  • 行動リストとエージェントごとの報酬を介したマルチエージェント相互作用を可能にする、後方互換性を保った標準化されたAPI拡張を提供すること。
  • マルチプレイヤーA LE環境をPettingZooに統合し、マルチエージェント強化学習に適した一貫性のある、Gymに類似したPythonインターフェースを提供すること。
  • セルフプレイとApe-X DQNを用いたベースラインを確立し、各新規環境の難易度とトレーニング可能性を特徴付けること。
  • セルフプレイ下で病理的トレーニングダイナミクスを示す環境を特定し、リーグ制トレーニングなどの高度なトレーニング手法の必要性を示唆すること。

提案手法

  • `num_players` 引数を受け入れ、指定されたプレイヤー数に対応するゲームモードを返すように `getAvailableModes` メソッドをオーバーロードすることで、ALE API を拡張した。
  • 行動リスト(1プレイヤーあたり1つずつ)を受け入れ、エージェントごとの報酬、観測値、ゲーム状態のリストを返すように `step` メソッドをオーバーロードした。
  • 各プレイヤーのライフ数をリスト形式で返す `allLives` メソッドを追加し、マルチプレイヤーゲームにおけるエージェントの生存状況の適切な追跡を可能にした。
  • 拡張されたALEをPettingZooに統合し、OpenAI Gymのマルチエージェント版としての機能を提供し、Pythonでの環境操作をスムーズにした。
  • 標準的なAtari前処理ラッパーを用いたApe-X DQNを用いてセルフプレイベースラインを訓練し、ランダムエージェントとの比較を通じて一般化能力を評価した。
  • スローモーになりやすいゲーム(例:Double Dunk、Othello)の報酬構造を変更し、300フレーム以上にわたる無動作用のペナルティを課すことで、ゲームの凍結を防ぎ、安定したトレーニングを可能にした。

実験結果

リサーチクエスチョン

  • RQ1Arcade Learning Environment は、シングルエージェント環境との後方互換性を保ちつつ、マルチプレイヤーAtari 2600ゲームをサポートできるように拡張可能か?
  • RQ2マルチプレイヤーAtariゲームに見られる異なるゲーム理論的構造(競合的、協力的、混合和)は、マルチエージェント強化学習方策のトレーニング可能性にどのように影響するか?
  • RQ3多様なマルチプレイヤーAtari環境におけるセルフプレイベースラインの性能特性は何か?また、どの環境が病理的トレーニングダイナミクスを示すか?
  • RQ4ランダムな相手と対戦することで、セルフプレイで訓練された方策の一般化能力がどの程度明らかになるか?
  • RQ5現在の深層強化学習手法は、複雑なマルチプレイヤーAtariゲームで効果的な方策を学習するために十分か?それともリーグ制トレーニングのような制度が必要か?

主な発見

  • 拡張されたALEは18のROMと24の異なるマルチプレイヤー対戦モードをサポートしており、Warlords(4人対戦)、Space Invaders(2人対戦)、およびEntombed(協力モード)を含む、競合的、協力的、混合和のゲームが含まれる。
  • Ape-X DQNを用いたセルフプレイベースラインは、Boxing や Tennis などのゲームで優れたパフォーマンスを達成し、壁押しや最適な位置取りといった戦略をエージェントが学習した。
  • Joust や Wizard of Wor では、訓練されたエージェントがランダムエージェントよりも劣る性能を示し、これらの環境が混合ゲーム理論的構造のため病理的トレーニングダイナミクスを示している可能性が示唆された。
  • スローモーになりやすいゲーム(例:Tennis、Othello)では、300フレーム以上にわたる無動作用にペナルティを課す報酬構造を変更し、無限に続くゲーム状態を防ぎ、安定したトレーニングを可能にした。
  • エージェントがパンチを避け、相手を壁に押し込む戦略的適応を学習するなど、顕在的行動が観察された。
  • 結果から、Vinyalsら(2019)と同様のリーグ制トレーニングのような高度なトレーニング制度が、特定のマルチプレイヤーAtariゲームにおけるトレーニング不安定性を克服するためにおそらく不可欠であると示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。