Skip to main content
QUICK REVIEW

[論文レビュー] Revisiting Parameter Sharing in Multi-Agent Deep Reinforcement Learning

Justin K. Terry, Nathaniel Grammel|arXiv (Cornell University)|May 27, 2020
Reinforcement Learning in Robotics参考文献 30被引用数 12
ひとこと要約

この論文は、マルチエージェント強化学習におけるパラメータ共有—これまであまり活用されていなかったが—完全な集中化によって非定常性を排除することで、学習を著しく加速し、性能を向上させることを示している。著者らは、8つの現代的な深層強化学習アルゴリズムにパラメータ共有を適用し、従来のパラメータ共有設定と比較して、わずか16%のエピソードで平均報酬が最大44倍にまで向上した。これは、ベンチマーク上でのマルチエージェント強化学習環境において、新たなSOTA(最先端)の結果を樹立した。さらに、観測と行動空間のパディングにより、異種エージェントへの適用可能性を拡張した。

ABSTRACT

Parameter sharing, where each agent independently learns a policy with fully shared parameters between all policies, is a popular baseline method for multi-agent deep reinforcement learning. Unfortunately, since all agents share the same policy network, they cannot learn different policies or tasks. This issue has been circumvented experimentally by adding an agent-specific indicator signal to observations, which we term "agent indication". Agent indication is limited, however, in that without modification it does not allow parameter sharing to be applied to environments where the action spaces and/or observation spaces are heterogeneous. This work formalizes the notion of agent indication and proves that it enables convergence to optimal policies for the first time. Next, we formally introduce methods to extend parameter sharing to learning in heterogeneous observation and action spaces, and prove that these methods allow for convergence to optimal policies. Finally, we experimentally confirm that the methods we introduce function empirically, and conduct a wide array of experiments studying the empirical efficacy of many different agent indication schemes for image based observation spaces.

研究の動機と目的

  • 学習の集中化を高めることで、協調的マルチエージェント強化学習における非定常性が軽減されるかどうかを調査すること。
  • パラメータ共有—極端な集中化—が、マルチエージェント強化学習のベンチマークにおいて、現代的な深層強化学習アルゴリズムに与える性能を評価すること。
  • 観測空間と行動空間のサイズが異なる異種エージェントに対しても、パラメータ共有を拡張すること。
  • エージェント識別、観測パディング、行動空間パディングの有効性を、多様なマルチエージェント強化学習環境におけるパラメータ共有の実現可能性について形式的に証明すること。

提案手法

  • MAILPモデルを用いて情報伝達ダイナミクスを形式化し、集中化の度合いを変化させた場合の学習収束に関する理論的限界を導出する。
  • 本研究では、文献において初めて8つの現代的な深層強化学習アルゴリズム(例:SAC、PPO、SAC-BC)にパラメータ共有を適用し、単一エージェント手法をマルチエージェント設定に起動する。
  • エージェント識別を用いて、1つの共有ポリシーがエージェントごとに異なる行動を取れるように、観測内でのエージェントIDを条件として用いる。
  • 観測パディングは、小さな観測を最大のサイズにまで延長することで、エージェント間での入力次元を統一し、入力構造を保持する。
  • 行動空間パディングは、小さな行動空間を最大サイズに拡張し、範囲外の行動を切り捨てることで、異種行動空間を一致させる。
  • エージェント識別、観測パディング、行動空間パディングの正しさについて、形式的な証明を提供する。

実験結果

リサーチクエスチョン

  • RQ1学習の集中化を高め、最終的にパラメータ共有に至ることで、協調的マルチエージェント強化学習における収束速度と性能が向上するか?
  • RQ2DQN や DDPG といった初期手法にとどまらず、現代的な深層強化学習アルゴリズムに対しても、パラメータ共有を効果的に適用できるか?
  • RQ3観測空間と行動空間のサイズが異なるエージェントを含む環境において、パラメータ共有をどのように拡張できるか?
  • RQ4エージェント識別、観測パディング、行動空間パディングといった手法が、異種マルチエージェント強化学習におけるパラメータ共有の実現を保証する理論的根拠は何か?
  • RQ5標準的なマルチエージェント強化学習ベンチマークで、最先端のDRLアルゴリズムにパラメータ共有を適用した場合、どの程度の性能向上が達成可能か?

主な発見

  • Guptaら(2017)のマルチエージェント強化学習ベンチマークスイートにおいて、パラメータ共有が文書化された最高性能を達成し、新たなSOTAを樹立した。
  • 従来の文書化済みのパラメータ共有設定と比較して、最大44倍の高い平均累積報酬を達成した。
  • 従来のパラメータ共有手法に比べ、必要なエピソード数のわずか16%で性能を達成した。これは、顕著なサンプル効率の向上を示している。
  • 現代的なDRLアルゴリズムの中では、プロキシマルポリシーオプティマイゼーション(PPO)とソフトアクターキャリブレーター(SAC)が、パラメータ共有と組み合わせることで特に優れた性能を示した。
  • 理論的分析により、パラメータ共有が、ポリシー学習の完全な集中化によって非定常性に起因する収束遅延を完全に排除することが確認された。
  • 提案手法であるエージェント識別、観測パディング、行動空間パディングは、異種マルチエージェント強化学習環境における正しさと機能性を形式的に証明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。