Skip to main content
QUICK REVIEW

[論文レビュー] Independent Generative Adversarial Self-Imitation Learning in Cooperative Multiagent Systems

Xiaotian Hao, Weixun Wang|arXiv (Cornell University)|Sep 25, 2019
Reinforcement Learning in Robotics被引用数 12
ひとこと要約

本稿では、自己模倣学習と生成的対抗的模倣学習を組み合わせた、完全に分散型の協調的マルチエージェント強化学習のための新規フレームワークである独立的生成的対抗的自己模倣学習(IGASIL)を提案する。サブカリキュラムの経験リプレイ機構と対抗的模倣学習を統合することで、StarCraftのユニット微調整管理タスクおよび野生動物救出タスクの両方で最先端の性能を達成し、収束速度と最終報酬の両面で、共同行動学習者でさえも上回った。

ABSTRACT

Many tasks in practice require the collaboration of multiple agents through reinforcement learning. In general, cooperative multiagent reinforcement learning algorithms can be classified into two paradigms: Joint Action Learners (JALs) and Independent Learners (ILs). In many practical applications, agents are unable to observe other agents' actions and rewards, making JALs inapplicable. In this work, we focus on independent learning paradigm in which each agent makes decisions based on its local observations only. However, learning is challenging in independent settings due to the local viewpoints of all agents, which perceive the world as a non-stationary environment due to the concurrently exploring teammates. In this paper, we propose a novel framework called Independent Generative Adversarial Self-Imitation Learning (IGASIL) to address the coordination problems in fully cooperative multiagent environments. To the best of our knowledge, we are the first to combine self-imitation learning with generative adversarial imitation learning (GAIL) and apply it to cooperative multiagent systems. Besides, we put forward a Sub-Curriculum Experience Replay mechanism to pick out the past beneficial experiences as much as possible and accelerate the self-imitation learning process. Evaluations conducted in the testbed of StarCraft unit micromanagement and a commonly adopted benchmark show that our IGASIL produces state-of-the-art results and even outperforms JALs in terms of both convergence speed and final performance.

研究の動機と目的

  • エージェントが他のエージェントの行動や報酬を観測できない完全に協調的なマルチエージェントシステムにおける連携課題に対処すること。
  • 独立学習における非定常性問題を克服し、エージェントが自身の過去の成功経験から学習できるようにすること。
  • 従来のQ学習ベースのIL手法が適用できない連続的制御タスクにおけるサンプル効率と収束速度の向上。
  • 中央集権的なクリティックや共同行動空間に依存しない、完全に分散型で独立した学習フレームワークの開発。
  • 自己模倣とGAILの組み合わせが、複雑な協調的環境において、既存の独立学習および共同学習パラダイムを上回ることの実証。

提案手法

  • 各エージェントは、一般のロールアウト用の通常バッファと、高パフォーマンスの軌道を格納するポジティブ(サブカリキュラム)バッファの2つの経験バッファを維持する。
  • サブカリキュラム経験リプレイ機構は、過去の成功したエピソードから有用な部分軌道を抽出し、ポジティブバッファに格納することで、自己模倣学習の加速を図る。
  • 生成的対抗的模倣学習(GAIL)のディスクラミネーターは、エキスパートに似たデモンストレーション(ポジティブバッファからのもの)と現在の行動を区別するように学習され、ポリシーの改善を導く。
  • 自己模倣は、ディスクラミネーターの報酬信号を用いて、エージェント自身の高品質な過去経験に基づきポリシーをファインチューニングすることで実行される。
  • フレームワークはオフポリシーで動作し、とくに報酬がスパarsな環境において、効率的なリプレイとサンプル再利用が可能である。
  • この方法は完全に分散型であり、各エージェントは他のエージェントのポリシーの知識を必要とせず、自身の観測と経験からのみ学習を行う。

実験結果

リサーチクエスチョン

  • RQ1自己模倣学習を生成的対抗的模倣学習と効果的に組み合わせることで、独立的マルチエージェントシステムにおける連携性能を向上させることができるか?
  • RQ2提案されたサブカリキュラム経験リプレイ機構は、協調的タスクにおける学習の加速とポリシー性能の向上に顕著な効果を示すか?
  • RQ3独立的で分散型のフレームワークは、協調的マルチエージェント環境において、共同行動学習者と同等またはそれ以上の性能を達成できるか?
  • RQ4オフポリシー版IGASILのサンプル効率は、オンポリシー版と比較して、複雑な協調的タスクにおいてどのように異なるか?
  • RQ5ポジティブバッファに格納された経験の質が、訓練の進行に伴い、エージェントのパフォーマンス向上にどの程度寄与するか?

主な発見

  • IGASILは、StarCraftユニット微調整管理タスクおよび協調的レッドウッド・ワイルドライフ・レース救出タスクの両方で、収束速度と最終報酬の両面で最先端の性能を達成し、既存手法を上回った。
  • オフポリシー版IGASILは、動物救出タスクでエキスパートレベルのパフォーマンスに到達するまでに、オンポリシー版の約10倍少ないサンプル数を要した。
  • サブカリキュラム経験リプレイ機構は学習を顕著に加速し、IAC+SCERは両シナリオにおいてIAC+PERおよびベースラインIACを上回った。
  • 訓練が進行するに従い、ポジティブバッファ $M_E^i$ に格納された経験の質が向上し、より良いポリシー学習と高い平均報酬が得られた。
  • 1エピソードあたりの敵の撃破数は、格納された経験の質の向上と併行して増加し、より良い部分スキルが学習され、再利用されていることが確認された。
  • IGASILは、オンポリシーおよびオフポリシーのベースラインと比較して、優れたサンプル効率とより速い収束速度を示し、性能指標において共同行動学習者をも凌駕した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。