Skip to main content
QUICK REVIEW

[論文レビュー] F2A2: Flexible Fully-decentralized Approximate Actor-critic for Cooperative Multi-agent Reinforcement Learning

Wenhao Li, Bo Jin|arXiv (Cornell University)|Apr 17, 2020
Reinforcement Learning in Robotics参考文献 75被引用数 12
ひとこと要約

F2A2 は、集中型の調整を必要とせず、スケーラブルで安定した学習を可能にする、柔軟かつ完全に分散型のアクタ・クリティックフレームワークを提示する。プライマルデュアルハイブリッド勾配降下法とパラメータ共有、および理論的思考に基づく他エージェントのモデリング(オンライン教師付き学習を用いて)を組み合わせることで、通信負荷を低減し、ポリシー学習におけるバイアスを軽減する。F2A2 は、StarCraft II や Multi-Agent Particle 環境において、集中型および分散型のベースラインと比較して競争力のある性能を達成する。

ABSTRACT

Traditional centralized multi-agent reinforcement learning (MARL) algorithms are sometimes unpractical in complicated applications, due to non-interactivity between agents, curse of dimensionality and computation complexity. Hence, several decentralized MARL algorithms are motivated. However, existing decentralized methods only handle the fully cooperative setting where massive information needs to be transmitted in training. The block coordinate gradient descent scheme they used for successive independent actor and critic steps can simplify the calculation, but it causes serious bias. In this paper, we propose a flexible fully decentralized actor-critic MARL framework, which can combine most of actor-critic methods, and handle large-scale general cooperative multi-agent setting. A primal-dual hybrid gradient descent type algorithm framework is designed to learn individual agents separately for decentralization. From the perspective of each agent, policy improvement and value evaluation are jointly optimized, which can stabilize multi-agent policy learning. Furthermore, our framework can achieve scalability and stability for large-scale environment and reduce information transmission, by the parameter sharing mechanism and a novel modeling-other-agents methods based on theory-of-mind and online supervised learning. Sufficient experiments in cooperative Multi-agent Particle Environment and StarCraft II show that our decentralized MARL instantiation algorithms perform competitively against conventional centralized and decentralized methods.

研究の動機と目的

  • 集中型トレーニングの限界、特にスケーラビリティの問題と通信のボトル neck を解決すること。
  • 既存の分散型 MARL メソッドで生じるブロック座標降下法に起因するバイアスを克服するために、エージェントごとにポリシーと価値関数を同時に最適化できる仕組みを提供すること。
  • 最小限の情報交換で大規模な協調的マルチエージェント環境をサポートできる完全に分散型のフレームワークを設計すること。
  • エージェントがプライベートな目的を持ち、観測が限られている部分的に観測可能な確率的ゲーム(POSGs)において、安定性とスケーラビリティを向上させること。
  • 集中型コントローラーやグローバルな状態情報に依存せずに、効果的なマルチエージェントポリシー学習を可能にすること。

提案手法

  • エージェントごとに分散的にポリシー(アクター)と価値関数(クリティック)を同時に最適化するためのプライマルデュアルハイブリッド勾配降下法を採用する。
  • 有限記憶圧縮と単層LSTMを用いて信念状態を近似し、他エージェントの行動をコンactな表現で表現する。
  • 理論的思考に基づく新規な他エージェントモデリング手法を導入し、直接観測せずに他エージェントのポリシーを推定する。
  • エージェント間でパラメータ共有を実装することで、モデルの複雑さと通信負荷を低減する。
  • さまざまなアクタ・クリティック手法と統合可能な柔軟なアーキテクチャを設計し、相互運用性と拡張性を向上させる。
  • 集中型コントローラーに依存しない分散型トレーニングと実行(DTDE)パラダイムを実装する。

実験結果

リサーチクエスチョン

  • RQ1完全に分散型のアクタ・クリティックフレームワークは、集中型調整なしで協調的マルチエージェント強化学習で競争力のある性能を達成できるか?
  • RQ2分散型MARLにおいて、逐次的アクタ・クリティック更新に起因するバイアスを、ポリシーと価値関数の同時最適化によってどのように軽減できるか?
  • RQ3パラメータ共有と理論的思考に基づくモデリングによって、通信負荷をどれほど低減でき、スケーラビリティを向上できるか?
  • RQ4単層LSTMを用いたポリシーは、部分的に観測可能な環境において、多段階の信念を効果的に近似できるか?
  • RQ5本手法のフレームワークは、プライベートな目的を持つ大規模な協調的環境で、どのように性能を発揮するか?

主な発見

  • F2A2 は StarCraft II および Multi-Agent Particle 環境で、集中型および分散型のベースラインと比較して、主要指標において競争力のある性能を達成した。
  • パラメータ共有と他エージェントのオンラインモデリングにより、情報伝送を顕著に削減し、通信効率を向上させた。
  • プライマルデュアル法によるポリシーと価値関数の同時最適化により、ブロック座標降下法に内在するバイアスが緩和され、学習が安定化した。
  • 理論的思考に基づくモデリングの活用により、観測が限られている状況でも他エージェントの行動を効果的に推定でき、協調性が向上した。
  • 実験的結果から、F2A2 は大規模な協調的環境でも安定性とスケーラビリティを維持しており、多様な環境において頑健であることが示された。
  • 単一の層LSTMを用いても、F2A2 は優れた性能を発揮した。これは、実際の応用において有限の信念階層を効果的に近似できる可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。