Skip to main content
QUICK REVIEW

[論文レビュー] Plan Better Amid Conservatism: Offline Multi-Agent Reinforcement Learning with Actor Rectification

Ling Pan, Longbo Huang|arXiv (Cornell University)|Nov 22, 2021
Reinforcement Learning in Robotics被引用数 9
ひとこと要約

本論文は、保守的価値関数における方策最適化を改善するために一次の政策勾配とゼロ次最適化を組み合わせる、OMARと呼ばれる新しいオффラインマルチエージェント強化学習アルゴリズムを提案する。この手法は、エージェント数の増加に伴う性能の低下という問題に取り組み、連続的および離散的制御ベンチマークで最先端の性能を達成する。OMARは、ゼロ次最適化によって発見された行動を用いて方策を補正することで、既存の保守的オフラインマルチエージェントRL手法を著しく上回る性能を発揮する。

ABSTRACT

Conservatism has led to significant progress in offline reinforcement learning (RL) where an agent learns from pre-collected datasets. However, as many real-world scenarios involve interaction among multiple agents, it is important to resolve offline RL in the multi-agent setting. Given the recent success of transferring online RL algorithms to the multi-agent setting, one may expect that offline RL algorithms will also transfer to multi-agent settings directly. Surprisingly, we empirically observe that conservative offline RL algorithms do not work well in the multi-agent setting -- the performance degrades significantly with an increasing number of agents. Towards mitigating the degradation, we identify a key issue that non-concavity of the value function makes the policy gradient improvements prone to local optima. Multiple agents exacerbate the problem severely, since the suboptimal policy by any agent can lead to uncoordinated global failure. Following this intuition, we propose a simple yet effective method, Offline Multi-Agent RL with Actor Rectification (OMAR), which combines the first-order policy gradients and zeroth-order optimization methods to better optimize the conservative value functions over the actor parameters. Despite the simplicity, OMAR achieves state-of-the-art results in a variety of multi-agent control tasks.

研究の動機と目的

  • エージェント数の増加に伴い、保守的オフラインマルチエージェントRLアルゴリズムの性能が著しく低下する根本的要因を特定すること。
  • 保守性の制約下で、非凹な価値関数が方策最適化における悪質な局所最適解を引き起こす問題を解消すること。
  • 高次元のマルチエージェント行動空間における方策最適化を向上させることで、保守的クライアントをより効果的に活用する手法を開発すること。
  • 事前に収集されたデータセットのみを用いて、探索を伴わない有効なオフラインマルチエージェント学習を可能にすること。
  • 一次およびゼロ次最適化を組み合わせることで、オフラインMARLにおけるより安全で効果的な方策改善が達成できることを示すこと。

提案手法

  • OMARは、標準的な一次方策勾配とゼロ次最適化を組み合わせることで、方策更新を精緻化する新しいアクター補正メカニズムを導入する。
  • ゼロ次成分は、行動のサンプリング分布を維持し、Q値推定に基づいて反復的に改善することで、より良い行動を発見する。
  • アクター損失に正則化項を追加し、方策がゼロ次最適化器によって生成された行動を模倣するよう促進することで、探索性と協調性を向上させる。
  • この手法は、分散型および集中型の両方の訓練パラダイム、特にCTDE(集中型訓練・分散型実行)と互換性を持つように設計されている。
  • アルゴリズムはハイブリッド最適化戦略を採用しており、一次勾配による効率的な方策更新と、局所最適解からの脱出および耐性向上のためのゼロ次手法を組み合わせる。
  • Q値フィードバックに基づいてゼロ次最適化器の行動分布を精緻化する有効なサンプリング機構が提案され、収束性と性能の向上が図られる。

実験結果

リサーチクエスチョン

  • RQ1なぜCQLのような保守的オフラインRLアルゴリズムが、マルチエージェント環境におけるエージェント数の増加に伴い、著しく性能が低下するのか?
  • RQ2特に局所最適解や非協調的行動の観点から、保守的オフラインMARLにおける方策最適化の失敗要因は何か?
  • RQ3一次方策勾配とゼロ次最適化を組み合わせることで、保守的オフラインマルチエージェント環境における方策学習が向上するか?
  • RQ4提案されたアクター補正メカニズムは、高次元の共同行動空間における協調性と性能をどのように向上させるか?
  • RQ5OMARにおけるハイブリッド最適化アプローチは、標準的な保守的オフラインMARL手法と比較して、より安全で効果的な方策改善をもたらすか?

主な発見

  • OMARは、協調的ナビゲーション、捕食者・獲物、StarCraft IIミクロマネジメントタスクを含む、すべてのベンチマーク環境でMA-CQL、MA-TD3+BC、MA-ICQを著しく上回る性能を発揮する。
  • StarCraft IIミクロマネジメントベンチマークでは、エキスパートデータセット上で正規化スコア105.9 ± 3.6を達成し、MA-TD3+BC(108.1 ± 3.3)を上回り、MA-CQL(69.5 ± 15.7)を大きく上回る。
  • エキスパートデータを用いたCN(協調的ナビゲーション)環境では、OMARが正規化スコア96.7 ± 4.1を達成し、MA-ICQ(96.7 ± 4.1)、MA-TD3+BC(108.1 ± 3.3)、MA-CQL(69.5 ± 15.7)を上回る。
  • 完全なリプレイデータセットの1%のみを用いても、OMARはMA-CQLを上回り、データ量の増加に伴い性能が向上し、ベースラインよりもオンラインエージェントの性能に近づく。
  • 集中型訓練・分散型実行(CTDE)設定では、OMAR(集中型)はランダムデータセットで21.6 ± 4.6、ミディアムデータセットで33.7 ± 14.5を達成し、MA-CQLを上回り、エキスパート設定ではMA-TD3+BCと同等の性能を示す。
  • アブレーションスタディにより、ゼロ次最適化器が、標準的手法が失敗する大規模かつ高次元の行動空間において、悪質な局所最適解からの脱出を支援することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。