Skip to main content
QUICK REVIEW

[論文レビュー] Agent Modeling as Auxiliary Task for Deep Reinforcement Learning

Pablo Hernández-Leal, Bilal Kartal|arXiv (Cornell University)|Jul 22, 2019
Reinforcement Learning in Robotics被引用数 15
ひとこと要約

本稿では、エージェントモデリングを補助タスクとして用いることで、方策および価値関数の学習を改善する2つのA3Cベースの深層強化学習アーキテクチャ—AMS-A3C(パラメータ共有)およびAMF-A3C(方策特徴)—を提案する。両アーキテクチャとも、学習を安定化させ、協調的および競合的マルチエージェント環境において標準A3Cを上回る性能を発揮し、より高い期待報酬を達成するとともに、協調性や相手の行動の利用を向上させる。

ABSTRACT

In this paper we explore how actor-critic methods in deep reinforcement learning, in particular Asynchronous Advantage Actor-Critic (A3C), can be extended with agent modeling. Inspired by recent works on representation learning and multiagent deep reinforcement learning, we propose two architectures to perform agent modeling: the first one based on parameter sharing, and the second one based on agent policy features. Both architectures aim to learn other agents' policies as auxiliary tasks, besides the standard actor (policy) and critic (values). We performed experiments in both cooperative and competitive domains. The former is a problem of coordinated multiagent object transportation and the latter is a two-player mini version of the Pommerman game. Our results show that the proposed architectures stabilize learning and outperform the standard A3C architecture when learning a best response in terms of expected rewards.

研究の動機と目的

  • エージェントモデリングを補助タスクとして組み込むことで、マルチエージェント設定における深層強化学習を改善すること。
  • 主な方策および価値関数に加えて、他のエージェントの方策を学習することが、学習の安定性と性能を向上させるかどうかを調査すること。
  • オンポリシーA3Cフレームワーク内でのパラメータ共有型と方策特徴に基づくモデリングという2つの異なるアーキテクチャの有効性を検討すること。
  • 提案手法を協調的(マルチエージェントオブジェクト輸送)および競合的(mini-Pommerman)な環境で評価すること。
  • 補助的エージェントモデリングが協調的状況ではより良い協調性を、競合的状況ではより効果的なベストリスポンス戦略をもたらすことを示すこと。

提案手法

  • 学習エージェントのための方策ネットワークと、相手または味方エージェントの方策をモデリングする共有ネットワークをパラメータ共有により同時に学習するAMS-A3Cを提案する。
  • 観測から得られる方策特徴を用いて、相手エージェントの方策の潜在的表現を学習し、その表現をエージェントのアクターおよびクリティックネットワークの入力として用いるAMF-A3Cを導入する。
  • A3Cフレームワークにおける標準的な方策および価値関数損失に加えて、エージェントモデリングを補助損失として統合する。
  • 経験再生を用いないオンポリシー学習を採用し、A3Cの非同期的かつリアルタイムの学習パラダイムを維持する。
  • 補助的エージェントモデリング損失と主なRL目的とのバランスをとるために、ハイパーパrameter λAM を用いる。
  • 学習済み表現の分析のため、t-SNEを用いてA3Cと本稿で提案するモデルの間で活性化パターンを比較する。

実験結果

リサーチクエスチョン

  • RQ1他のエージェントの方策を補助タスクとしてモデリングすることで、深層強化学習における学習の安定性と性能が向上するか?
  • RQ2エージェントモデリングに用いるパラメータ共有と方策特徴の学習を比較した場合、性能および収束性にどのような差が生じるか?
  • RQ3補助的エージェントモデリングが協調的マルチエージェントタスクにおける協調性の向上や、競合的状況におけるベストリスポンス戦略の強化に寄与するか?
  • RQ4t-SNEによる学習済み状態表現の可視化によって、エージェントモデリングが表現学習をどの程度向上させるか?
  • RQ5提案されたアーキテクチャは、mini-Pommermanのような複雑で確率的な環境において、標準A3Cを上回ることができるか?

主な発見

  • 協調的マルチエージェントオブジェクト輸送タスクにおいて、AMS-A3CおよびAMF-A3Cは標準A3Cを著しく上回り、より高い期待報酬を達成するとともに、より速くより安定した協調行動を示した。
  • 競合的mini-Pommerman環境において、両アーキテクチャともA3Cを上回る報酬を得たが、AMS-A3Cは350万エピソード目以降で統計的に有意(α=0.05)に優れた性能を示した。
  • 非決定的で不確実なチームメイト(特に「頑固な」チームメイト)に対処する際、AMS-A3CおよびAMF-A3Cは学習の安定性と分散の低減を示した。
  • AMS-A3Cで学習されたエージェントは、物体を把持した後、A3Cよりも速くゴールに到達する優れた協調行動を示した。
  • 競合的領域において、AMS-A3CおよびAMF-A3Cは相手の行動(例:自殺を引き起こすブロッキング行動)を効果的に利用し、より高いスコアを達成した。
  • t-SNE可視化により、AMS-A3Cはより構造的かつ意味のある状態表現を学習していることが判明した。特に、報酬値が約1の「勝利状態」に対応する明確なクラスタが形成されており、相手の行動予測能力が向上していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。