Skip to main content
QUICK REVIEW

[論文レビュー] Dealing with Non-Stationarity in MARL via Trust-Region Decomposition

Wenhao Li, Xiangfeng Wang|arXiv (Cornell University)|Feb 21, 2021
Reinforcement Learning in Robotics被引用数 4
ひとこと要約

本稿では、メッセージスレッディングネットワーク(TRD-Net)を用いて共同方針制約を分解することで、非定常性を軽減する信頼領域ベースのマルチエージェント強化学習アルゴリズムMAMTを提案する。MAMTは、エンドツーエンドで局所的信頼領域を適応的に調整することで、多様な協調的タスクにおいて安定的かつ顕著な性能向上を達成し、密度の高い報酬環境ではベースラインを最大25.04 ± 1.68の性能向上で上回る。

ABSTRACT

Non-stationarity is one thorny issue in cooperative multi-agent reinforcement learning (MARL). One of the reasons is the policy changes of agents during the learning process. Some existing works have discussed various consequences caused by non-stationarity with several kinds of measurement indicators. This makes the objectives or goals of existing algorithms are inevitably inconsistent and disparate. In this paper, we introduce a novel notion, the $δ$-measurement, to explicitly measure the non-stationarity of a policy sequence, which can be further proved to be bounded by the KL-divergence of consecutive joint policies. A straightforward but highly non-trivial way is to control the joint policies' divergence, which is difficult to estimate accurately by imposing the trust-region constraint on the joint policy. Although it has lower computational complexity to decompose the joint policy and impose trust-region constraints on the factorized policies, simple policy factorization like mean-field approximation will lead to more considerable policy divergence, which can be considered as the trust-region decomposition dilemma. We model the joint policy as a pairwise Markov random field and propose a trust-region decomposition network (TRD-Net) based on message passing to estimate the joint policy divergence more accurately. The Multi-Agent Mirror descent policy algorithm with Trust region decomposition, called MAMT, is established by adjusting the trust-region of the local policies adaptively in an end-to-end manner. MAMT can approximately constrain the consecutive joint policies' divergence to satisfy $δ$-stationarity and alleviate the non-stationarity problem. Our method can bring noticeable and stable performance improvement compared with baselines in cooperative tasks of different complexity.

研究の動機と目的

  • 他のエージェントの方針変更による学習の不安定化という、協調的マルチエージェント強化学習(MARL)における非定常性の課題に対処する。
  • 共同方針を制約する(非現実的)か、単純な方針因子分解を行う(高い乖離を引き起こす)という既存の信頼領域手法の限界を克服する。
  • 連続する共同方針のKLダイバージェンスによって理論的に境界づけられる、方針シーケンスの非定常性を明示的に測定するための新しい$δ$-定常性指標を導入する。
  • 直接的な共同方針最適化を回避するため、因子化された信頼領域制約を通じて、共同方針乖離をスケーラブルかつ正確に推定する手法を開発する。
  • 局所的信頼領域の適応的調整を維持し、$δ$-定常性を保ち、サンプル効率と性能を向上させるエンドツーエンドの学習フレームワークを確立する。

提案手法

  • 非定常性の形式的測定と境界化のため、相手切り替えコストを根拠にした$δ$-定常性を新規に提案し、連続する共同方針のKLダイバージェンスによって理論的に境界づけられる。
  • 正確な共同方針乖離推定を可能にするため、共同方針をペアワイズのマルコフ確率的フィールドとしてモデル化し、構造的メッセージスレッディングを実現する。
  • 局所的方針更新を用いて、連続する共同方針間のKLダイバージェンスを推定するメッセージスレッディングニューラルネットワークであるTRD-Netを設計する。
  • TRD-Netの出力を用いて、各エージェントの局所的信頼領域に対する適応的協調係数を計算する信頼領域フレームワークに統合する。
  • TRD-Netの出力に基づき、局所的信頼領域を適応的に調整するエンドツーエンドのアルゴリズムMAMT(信頼領域分解を施したマルチエージェントミラー降下)を開発する。
  • ベースとなる方針更新ルールとして、プロキシマルポリシー最適化(PPO)を採用し、学習された協調係数を介して各エージェントごとに信頼領域制約を適用する。

実験結果

リサーチクエスチョン

  • RQ1非定常性は、整合的な指標を用いて形式的に測定・境界づけられるか?
  • RQ2直接的な共同最適化を伴わず、因子化された局所的方針制約を通じて、共同方針乖離を正確に推定できるか?
  • RQ3適応的協調係数を用いた信頼領域分解は、固定またはランダムな制約よりも、方針安定性を維持する上で優れているか?
  • RQ4信頼領域パrameterのエンドツーエンド学習は、協調的MARLタスクにおけるサンプル効率と性能を向上させるか?
  • RQ5本手法は、複雑さの異なるタスクにおいて、ベースラインと比較して安定性、収束速度、最終的性能の観点で優れているか?

主な発見

  • MAMTは4つの協調的タスクすべてで最良の性能を達成し、Rover-Tower環境では最終リターンが25.04 ± 1.68に達し、MAMT-PPOや他のアブレーションバージョンを著しく上回る。
  • MAMT-PPOに到達するのと同じ性能に到達するためのエピソード数は、MAMTが約半分で済むことから、優れたサンプル効率を示している。
  • 協調係数をランダム化した(MAMT-Random)場合、性能が著しく劣化するため、学習された適応的信頼領域制御の必要性が確認された。
  • 固定された協調係数(MAMT-Fixed)を設定した場合、MAMTと同程度の性能を示すため、TRD-Netが局所的信頼領域と共同方針乖離の最適な関係を効果的に学習していることが示された。
  • KLダイバージェンスの重み付き和近似(MAMT-WS)は、複雑なタスクで高い分散と劣った性能を示し、単純な因子分解手法の不安定性が浮き彫りになった。
  • KLダイバージェンス曲線(図16〜19)から、MAMTがMAACよりも顕著に低くかつより安定した共同方針乖離を維持していることが確認され、方針安定性の向上が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。