Skip to main content
QUICK REVIEW

[論文レビュー] A Decentralized Policy Gradient Approach to Multi-task Reinforcement Learning

Sihan Zeng, Aqeel Anwar|arXiv (Cornell University)|Jun 8, 2020
Reinforcement Learning in Robotics参考文献 44被引用数 7
ひとこと要約

本論文は、複数のエージェントが異なる環境においてのみならず、ポリシー・パラメータの交換に限って協調的に共有ポリシーを学習する分散型方策勾配法を提案する。この手法は、表形式設定では有限時間内に定常点に収束することを保証し、構造的仮定の下ではグローバル最適性能を達成する。GridWorldおよび大規模なドローンナビゲーションタスクにおいて、ニューラルネットワーク関数近似を用いて有効性が示された。

ABSTRACT

We develop a mathematical framework for solving multi-task reinforcement learning (MTRL) problems based on a type of policy gradient method. The goal in MTRL is to learn a common policy that operates effectively in different environments; these environments have similar (or overlapping) state spaces, but have different rewards and dynamics. We highlight two fundamental challenges in MTRL that are not present in its single task counterpart, and illustrate them with simple examples. We then develop a decentralized entropy-regularized policy gradient method for solving the MTRL problem, and study its finite-time convergence rate. We demonstrate the effectiveness of the proposed method using a series of numerical experiments. These experiments range from small-scale "GridWorld" problems that readily demonstrate the trade-offs involved in multi-task learning to large-scale problems, where common policies are learned to navigate an airborne drone in multiple (simulated) environments.

研究の動機と目的

  • 異なるダイナミクスと報酬を持つ複数の環境にまたがって、1つの汎用的で一般化可能なポリシーを学習する課題に対処すること。
  • 中央集権的調整を避けるために、エージェントがポリシー・パラメータのみを共有する分散型通信フレームワークを構築すること。
  • 提案手法の理論的収束保証を、表形式およびニューラルネットワーク設定の両方で提供すること。
  • ドローンナビゲーションのような大規模かつ高次元のタスクにおけるスケーラビリティと有効性を実証すること。
  • 単一タスクRLとマルチタスクRLとの根本的な違いを、具体的な例を用いて強調すること。

提案手法

  • エージェントのネットワーク上で分散最適化問題としてMTRLを定式化し、各エージェントが1つのタスクを担当する。
  • 探索と活用のバランスを保つために、エントロピー正則化付き方策勾配更新を採用する。
  • 通信はサイクリック(リング)通信グラフを介してのみポリシー・パラメータの交換に限定する。
  • 勾配推定にはREINFORCE、A2C、またはPPOを用い、ADAM最適化とモンテカルロ報酬推定を併用する。
  • 理論的分析により、表形式設定では定常点に収束し、特定のダイナミクス仮定の下ではグローバル最適性が保証される。
  • 高次元状態空間に対応するため、ニューラルネットワークポリシー関数近似を用い、ドローン実験では5層のCNNアーキテクチャを採用した。

実験結果

リサーチクエスチョン

  • RQ1分散型通信は、マルチタスク強化学習におけるポリシー学習性能にどのように影響を与えるか?
  • RQ2単一タスクRLとマルチタスクRLとの間に、なぜ新しいアルゴリズム設計を必要とする根本的差異が存在するのか?
  • RQ3共有ポリシー・パラメータを用いたMTRLにおいて、分散型方策勾配法が有限時間内に収束するか?
  • RQ4この手法は、ドローンナビゲーションのような高次元で現実世界に近い環境にどのようにスケーリングできるか?
  • RQ5どのような構造的仮定の下で、アルゴリズムがグローバル最適ポリシー値に収束するか?

主な発見

  • 分散型方策勾配法は、表形式設定において非凹型のグローバル目的関数の定常点に収束する。
  • 環境ダイナミクスに特定の構造的仮定を置くと、この手法はグローバル最適ポリシー値に収束する。
  • GridWorld環境では、タスク間のトレードオフをバランスさせながら、安定的かつ効果的なマルチタスク性能を達成した。
  • 大規模なドローンナビゲーションタスクでは、明るさや構造が異なる4つの異なる屋内環境において、共有ポリシーを効果的に学習した。
  • 4000エピソードの学習にRTX2080 GPUを2台使用して約25時間かかったが、これはデータ集約的タスクにおける実用性を示している。
  • 完全な軌道データではなくポリシー・パラメータの交換を採用することで、通信オーバーヘッドが低減され、大規模ネットワークにおけるスケーラビリティが可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。