Skip to main content
QUICK REVIEW

[論文レビュー] A Maximum Mutual Information Framework for Multi-Agent Reinforcement Learning

Woojun Kim, Whiyoung Jung|arXiv (Cornell University)|Jun 4, 2020
Reinforcement Learning in Robotics参考文献 29被引用数 6
ひとこと要約

本論文は、マルチエージェント強化学習(MARL)のための最大相互情報量(MMI)フレームワークを提案し、エージェントの行動間の相互情報量を正則化することで、累積報酬の最適化を促進する。潜在変数と変分推論を用いることで、方策最適化に向けた取り扱い可能な下界を導出し、VM3-ACアルゴリズムを構築した。このアルゴリズムは、マルチウォーカーや捕食者・獲物環境など、協調が求められるタスクにおいて、MADDPG、I-SAC、MA-SACを上回る性能を発揮する。

ABSTRACT

In this paper, we propose a maximum mutual information (MMI) framework for multi-agent reinforcement learning (MARL) to enable multiple agents to learn coordinated behaviors by regularizing the accumulated return with the mutual information between actions. By introducing a latent variable to induce nonzero mutual information between actions and applying a variational bound, we derive a tractable lower bound on the considered MMI-regularized objective function. Applying policy iteration to maximize the derived lower bound, we propose a practical algorithm named variational maximum mutual information multi-agent actor-critic (VM3-AC), which follows centralized learning with decentralized execution (CTDE). We evaluated VM3-AC for several games requiring coordination, and numerical results show that VM3-AC outperforms MADDPG and other MARL algorithms in multi-agent tasks requiring coordination.

研究の動機と目的

  • 実行時における明示的通信や依存関係が存在しない状況下で、マルチエージェント強化学習(MARL)における協調行動の学習という課題に取り組むこと。
  • 独立学習や因子化された方策の限界を克服し、協調的MARLにおける協調性の欠如を是正すること。
  • 相互情報量正則化を通じて、暗黙的に協調行動を促進する、取り扱いやすくスケーラブルなフレームワークを構築すること。
  • 中央集権的訓練と分散型実行(CTDE)の枠組みにおいて、相互情報量正則化を方策最適化プロセスに統合すること。

提案手法

  • エージェントの行動間の非ゼロ相互情報量を誘導するための潜在変数を導入し、明示的通信なしに協調行動を実現すること。
  • 条件付き分布が取り扱いにくい状況下でも、相互情報量正則化を実行可能にするために変分下界を適用すること。
  • 累積報酬と行動間の相互情報量を組み合わせたMMI正則化目的関数の下界を導出すること。
  • 導出された下界を最大化する方策反復を用い、変分的最大相互情報量マルチエージェントアクターキャリブレーター(VM3-AC)アルゴリズムを導出すること。
  • 中央集権的訓練と分散型実行(CTDE)を採用し、訓練時には全情報をアクセス可能だが、実行時には局所的観測に基づいて行動するようにすること。
  • 相互情報量正則化とエントロピー正則化、中央集権的クリティックを組み合わせることで、探索性と協調性の両方を向上させること。

実験結果

リサーチクエスチョン

  • RQ1エージェントの行動間の相互情報量は、マルチエージェント強化学習における協調性向上に効果的に活用可能か?
  • RQ2分散型方策と明示的通信なしのMARLにおいて、相互情報量正則化をどのように取り扱い可能にするか?
  • RQ3目的関数に相互情報量を組み込むことで、従来の手法と比較して協調性が求められるMARLタスクにおける性能が向上するか?
  • RQ4潜在変数と温度ハイパーパrameter β は、学習済み方策の協調性と性能にどのような影響を及えるか?

主な発見

  • VM3-ACは、マルチウォーカー、捕食者・獲物、協調的ナビゲーションタスクを含む、複数の協調性が求められる環境で、MADDPG、I-SAC、MA-AC、MA-SACを上回る性能を発揮する。
  • N=4エージェントのマルチウォーカー環境では、VM3-ACが顕著な性能向上を示し、高協調性要件のシナリオにおいてその有効性を実証している。
  • アブレーションスタディの結果、潜在変数が協調性に不可欠であることが確認され、N=3およびN=4のマルチウォーカー設定において、その除去が性能低下を引き起こしている。
  • 温度パrameter β は報酬と相互情報量のトレードオフを制御し、最適な性能は β ≈ 0.05–0.1 の範囲で観察された。
  • 補足結果から、VM3-ACは評価された環境において、最先端のMAVENアルゴリズムを顕著に上回っている。
  • 相互情報量正則化とエントロピー正則化の併用は、単独での正則化よりも優れた協調性をもたらし、相乗効果があることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。