Skip to main content
QUICK REVIEW

[論文レビュー] Believe What You See: Implicit Constraint Approach for Offline Multi-Agent Reinforcement Learning

Yiqin Yang, Xiaoteng Ma|arXiv (Cornell University)|Jun 7, 2021
Reinforcement Learning in Robotics参考文献 55被引用数 18
ひとこと要約

本稿では、オフラインデータセットに存在する状態・行動ペアに限定してQ値推定を制限することにより、外挿誤差を軽減する新しいオフラインマルチエージェント強化学習アルゴリズムである暗黙的制約Q学習(ICQ)を提案する。ポリシー学習を暗黙的制約下での教師あり回帰問題として定式化し、共同ポリシーを分解することで、エージェント数の変動にかかわらず安定的かつスケーラブルな学習が可能となり、挑戦的なStarCraft IIオフラインマルチエージェント環境において最先端の性能を達成する。

ABSTRACT

Learning from datasets without interaction with environments (Offline Learning) is an essential step to apply Reinforcement Learning (RL) algorithms in real-world scenarios. However, compared with the single-agent counterpart, offline multi-agent RL introduces more agents with the larger state and action space, which is more challenging but attracts little attention. We demonstrate current offline RL algorithms are ineffective in multi-agent systems due to the accumulated extrapolation error. In this paper, we propose a novel offline RL algorithm, named Implicit Constraint Q-learning (ICQ), which effectively alleviates the extrapolation error by only trusting the state-action pairs given in the dataset for value estimation. Moreover, we extend ICQ to multi-agent tasks by decomposing the joint-policy under the implicit constraint. Experimental results demonstrate that the extrapolation error is successfully controlled within a reasonable range and insensitive to the number of agents. We further show that ICQ achieves the state-of-the-art performance in the challenging multi-agent offline tasks (StarCraft II). Our code is public online at https://github.com/YiqinYang/ICQ.

研究の動機と目的

  • オフラインマルチエージェント強化学習における外挿誤差の深刻な課題に取り組むこと。これは、共同行動空間の指数的増大に伴い、急速に蓄積されるためである。
  • Q値推定に、観測済みデータにのみ依存することで、未観測の状態・行動ペアへの一般化を回避する手法を開発すること。
  • 暗黙的制約に基づくポリシー分解を用いて、オフラインRLの原則をマルチエージェント設定に拡張すること。
  • 複雑なStarCraft IIシナリオを含む、多様なマルチエージェントオフライン環境において、強固でスケーラブルな性能を示すこと。
  • マルチエージェントオフラインRLにおける外挿誤差の最初の体系的分析を提供し、BCQのような既存のアルゴリズムの失敗モードを明らかにすること。

提案手法

  • ICQは、オフラインデータセットに存在する状態・行動ペアにのみ依存するSARSAに類似した更新式を用いてQ値推定を定式化し、未観測の行動に依存しないようにする。
  • ポリシー学習を、観測済み状態・行動ペア上のQ値を最大化するように最適化することで、教師あり回帰問題に変換し、分布シフトを回避する。
  • 共同ポリシーは暗黙的制約の下で分解され、データの整合性を保ちつつ外挿リスクを低減しながらマルチエージェント協調を可能にする。
  • ポリシー勾配におけるパーティション関数の近似にソフトマックスベースの正規化を用い、最適化に未観測の行動が含まれないことを保証する。
  • 個々のQ値を共有の注目メカニズムを用いて統合することで共同価値関数をモデル化する価値分解を介して、マルチエージェント設定に拡張する。
  • ラグランジュ緩和法を用いて暗黙的制約を強制し、ポリシー改善とデータ整合性のバランスを取る。

実験結果

リサーチクエスチョン

  • RQ1オフラインマルチエージェント強化学習において、エージェント数の増加に伴い外挿誤差はどのようにスケーリングするか?
  • RQ2共同行動空間の指数的増大に伴い、オフラインRLアルゴリズムはマルチエージェント環境で効果的に一般化できるか?
  • RQ3BCQのような既存のオフラインRL手法が、未観測の行動推定に起因してマルチエージェント設定でどの程度失敗するか?
  • RQ4Q値推定を観測済み状態・行動ペアに限定する手法が、複雑なマルチエージェントタスクにおいて安定的かつスケーラブルな学習を達成できるか?
  • RQ5暗黙的制約の下で共同ポリシーを分解することで、相互作用なしに効果的なマルチエージェントオフライン学習を実現できるか?

主な発見

  • BCQとは異なり、ICQはエージェント数に関係なく外挿誤差を合理的な範囲に制御する。エージェント数の増加に伴い、BCQはQ推定が発散するのに対し、ICQは安定性を維持する。
  • StarCraft IIオフラインベンチマークにおいて、ICQは全難易度レベルで最先端の性能を達成しており、27m_vs_30mのような最も困難な「スーパー・ハード」マップでも同様に優れた結果を示す。
  • ICQの単一エージェント版はD4RLベンチマークでも競争力のある結果を達成し、単一およびマルチエージェントタスクの両方における汎用性を示している。
  • アブレーションスタディにより、ソフトマックスベースのパーティション関数近似が最小限のバイアスをもたらし、マルチエージェント設定における有効性が裏付けられた。
  • BCQ-MA や CQL-MA といった強力なベースラインと比較して、ICQは全評価環境で優れた性能を示し、特に高複雑度のシナリオで顕著な優位性を示す。
  • ICQはエージェント数にほとんど影響されず、30体以上のエージェントが存在する環境でも安定した学習曲線と一貫した性能を維持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。