Skip to main content
QUICK REVIEW

[論文レビュー] Scalable Multi-Agent Model-Based Reinforcement Learning

Vladimir Egorov, Aleksei Shpilman|arXiv (Cornell University)|May 25, 2022
Software Reliability and Analysis Research被引用数 8
ひとこと要約

この論文は、訓練中に分散型の世界モデルを維持するためにエージェント間の通信を活用するスケーラブルなマルチエージェントモデルベース強化学習手法MAMBAを提案する。環境との直接的相互作用なしに、サンプル効率の高い学習を可能にする。MAMBAは、モデルフリーの最先端手法と比較して、環境との相互作用回数を最大10倍まで削減するが、SMACおよびFlatland環境における低データ環境でもそれらを上回る性能を示す。

ABSTRACT

Recent Multi-Agent Reinforcement Learning (MARL) literature has been largely focused on Centralized Training with Decentralized Execution (CTDE) paradigm. CTDE has been a dominant approach for both cooperative and mixed environments due to its capability to efficiently train decentralized policies. While in mixed environments full autonomy of the agents can be a desirable outcome, cooperative environments allow agents to share information to facilitate coordination. Approaches that leverage this technique are usually referred as communication methods, as full autonomy of agents is compromised for better performance. Although communication approaches have shown impressive results, they do not fully leverage this additional information during training phase. In this paper, we propose a new method called MAMBA which utilizes Model-Based Reinforcement Learning (MBRL) to further leverage centralized training in cooperative environments. We argue that communication between agents is enough to sustain a world model for each agent during execution phase while imaginary rollouts can be used for training, removing the necessity to interact with the environment. These properties yield sample efficient algorithm that can scale gracefully with the number of agents. We empirically confirm that MAMBA achieves good performance while reducing the number of interactions with the environment up to an orders of magnitude compared to Model-Free state-of-the-art approaches in challenging domains of SMAC and Flatland.

研究の動機と目的

  • 協調的環境におけるモデルフリー多エージェント強化学習(MFRL)のサンプル非効率性を解消すること。
  • 実行段階での分散性を保ちつつ、任意の数のエージェントを想定したマルチエージェント環境へのモデルベース強化学習(MBRL)の拡張すること。
  • 通信を世界モデルの維持メカニズムとして活用し、集中型訓練を可能にしつつ実行段階の分散性を損なわないようにすること。
  • 学習済みの世界モデルからの仮想的ロールアウトを用いて、低データ環境におけるサンプル効率を向上させること。
  • エージェント数の増加(例:Flatlandにおける15エージェント)に対してもスケーラブルでありながら、性能を維持すること。

提案手法

  • MAMBAは各エージェントに世界モデルを割り当て、訓練中に全エージェントの集中型経験を用いて学習させることで、実環境との相互作用なしに仮想的ロールアウトを可能にする。
  • 各エージェントは、隣接エージェントとの離散的メッセージを用いて通信することで、環境の離散的潜在空間表現を更新する。
  • 世界モデルは離散的潜在空間を備えた変分オートエンコーダ(VAE)を用いて訓練され、分離可能でスケーラブルな表現学習が可能になる。
  • 訓練段階では、世界モデルからの仮想的ロールアウトを用いてポリシーを最適化することで、実環境との相互作用への依存度を低減する。
  • 実行段階では、エージェントは隣接エージェントからのローカルなメッセージのみを用いて個々の世界モデルを更新し、分散性を確保する。
  • 通信を世界モデルの更新メカニズムの根幹に据え、構造的な情報共有の一種とみなす。

実験結果

リサーチクエスチョン

  • RQ1協調的マルチエージェント環境において、エージェント間の通信が訓練に必要な世界モデルを維持するのに十分であるか?
  • RQ2モデルベースアプローチが、低データ環境における最先端のモデルフリー手法と比較して優れたサンプル効率を達成できるか?
  • RQ3エージェント数の増加に伴い、世界モデルおよび通信メカニズムのスケーラビリティはどのように変化するか?
  • RQ4集中型世界モデルからの仮想的ロールアウトを用いることで、分散型実行を保ちながら効果的なポリシー訓練が可能か?
  • RQ5特に15エージェントの高密度環境(Flatland)においても、隣接エージェントからの離散的メッセージのみで世界モデルを効果的に学習できるか?

主な発見

  • MAMBAは、SMACおよびFlatland環境において、MAPPOなどの最先端のモデルフリー手法と比較して、必要な環境との相互作用回数を最大10倍まで削減した。
  • SMAC環境では、低データ環境下でもMAMBAがほぼ半数のエピソードで勝利し、MAPPOは同様の条件下で困難を示した。
  • 5エージェントのFlatlandマップでは、MAMBAは30万サンプルで良好な性能を達成したが、1RLベースラインは性能向上にそれ以上のサンプルを要した。
  • 10エージェントのFlatland設定では、100万サンプル経過後もMAMBAは1RLを上回ったが、サンプル効率は低下し始めた。
  • 15エージェントのFlatland設定では、150万サンプル経過後にMAMBAは1RLと同等の性能を達成したが、環境の複雑性上、サンプル効率は低下した。
  • MAMBAはグローバル報酬を効果的に分離し、追加の責任割り当て技術なしに良好な性能を示しており、協調的環境における堅牢性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。