Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Agent Actor-Critic with Generative Cooperative Policy Network

Heechang Ryu, Hayong Shin|arXiv (Cornell University)|Oct 22, 2018
Reinforcement Learning in Robotics参考文献 10被引用数 9
ひとこと要約

本稿では、協力的マルコフゲームにおける分散型方策学習を改善するため、生成的協調方策ネットワーク(GCPN)を備えたマルチエージェント・アクタ・クリティックフレームワークを提案する。GCPNを介して行動サンプルを生成することにより、エージェントは共同行動空間をより効果的に探索でき、協調的方策が向上する。マイクログリッドエネルギー貯蔵制御タスクにおいて、本手法は中央集権的最適化に近いエネルギーコストを達成し、DDPGを上回り、QP性能と同等の結果を示したが、将来の完全な知識は欠如している。

ABSTRACT

We propose an efficient multi-agent reinforcement learning approach to derive equilibrium strategies for multi-agents who are participating in a Markov game. Mainly, we are focused on obtaining decentralized policies for agents to maximize the performance of a collaborative task by all the agents, which is similar to solving a decentralized Markov decision process. We propose to use two different policy networks: (1) decentralized greedy policy network used to generate greedy action during training and execution period and (2) generative cooperative policy network (GCPN) used to generate action samples to make other agents improve their objectives during training period. We show that the samples generated by GCPN enable other agents to explore the policy space more effectively and favorably to reach a better policy in terms of achieving the collaborative tasks.

研究の動機と目的

  • 協力的マルコフゲームにおいてエージェントが協調的方策を学習できる分散型マルチエージェント強化学習アルゴリズムの開発を目的とする。
  • エージェント間の相互作用を無視する標準的な手法に起因する探索の制限を解消するため、多様な行動サンプルを生成する生成的協調方策ネットワーク(GCPN)を導入することを目的とする。
  • 他のエージェントの方策の完全な知識や中央集権的制御を必要とせずに、エージェント間の協調性を向上させることを目的とする。
  • 実世界のマイクログリッドエネルギー貯蔵制御問題を対象に本手法を評価し、エネルギーコストの低減効果を実証することを目的とする。

提案手法

  • 本手法は、各エージェントに対して2つの方策ネットワークを採用する:実行時の行動選択に用いる分散型グリーディ方策、および探索に用いる生成的協調方策ネットワーク(GCPN)。
  • GCPNは学習中に行動サンプルを生成し、他のエージェントが共同行動空間をより効果的に探索できるように支援する。
  • 各エージェントは、部分観測下でも価値ベースの学習が可能となるように、中央集権的クリティックネットワークを用いてグローバルリターンを推定する。
  • MADDPGにGCPNによって生成されたサンプルを組み込むことで、方策学習と協調性の向上を図る。
  • 本フレームワークは、マイクログリッドエネルギー貯蔵制御の分散型マルコフ意思決定過程(Dec-MDP)定式化に適用される。
  • GCPNは、グローバルパフォーマンスを向上させる行動を生成するように訓練され、協調的探索を通じてより良い方策収束を実現する。

実験結果

リサーチクエスチョン

  • RQ1生成的協調方策ネットワーク(GCPN)は、マルチエージェント強化学習における探索効率を向上させることができるか?
  • RQ2GCPNによって生成された行動サンプルを用いることで、標準的な深層マルチエージェントRL手法と比較して、より優れた協調的方策学習が達成できるか?
  • RQ3本手法は、将来のシステムダイナミクスの完全な知識がなくても、分散環境下で近似最適性能を達成できるか?
  • RQ4実世界のマイクログリッドエネルギー貯蔵制御において、本手法は中央集権的最適化と比較してどの程度の性能を示すか?

主な発見

  • MADDPG-GCPN手法は、エネルギーコストを1.00に正規化し、性能の上限として機能する中央集権的二次計画法(QP)ベースラインとほぼ同一の結果を達成した。
  • これに対して、相互作用を無視するDDPGベースラインは、正規化コストが1.18に上昇し、協調性の欠如に起因する顕著な非効率性を示した。
  • MADDPG-GCPNの解のPAR(ピーク対平均比)はDDPGよりわずかに低く、負荷の信頼性が向上し、エネルギー消費プロファイルが滑らかであることが示された。
  • GCPNを用いた探索により、収束が速く、方策学習がより安定したことが、テストエピソード全体にわたる一貫性あるパフォーマンスから裏付けられた。
  • QPベースラインとは異なり、将来のシステムダイナミクスの知識がなくても、本手法は近似最適性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。