Skip to main content
QUICK REVIEW

[論文レビュー] Provably Convergent Policy Gradient Methods for Model-Agnostic Meta-Reinforcement Learning

Alireza Fallah, Aryan Mokhtari|arXiv (Cornell University)|Feb 12, 2020
Reinforcement Learning in Robotics参考文献 16被引用数 12
ひとこと要約

本稿では、新しいタスクへの効率的な適応を図るための確率的方策勾配を用いるモデルに依存しないメタ強化学習手法であるStochastic Gradient Meta-Reinforcement Learning (SG-MRL) を提案する。本手法は、このような手法における理論的収束保証を初めて提供し、$\c{\epsilon}$-一次静止点に到達するための反復回数およびサンプル複雑性の上限を確立する。

ABSTRACT

We consider Model-Agnostic Meta-Learning (MAML) methods for Reinforcement Learning (RL) problems where the goal is to find a policy (using data from several tasks represented by Markov Decision Processes (MDPs)) that can be updated by one step of stochastic policy gradient for the realized MDP. In particular, using stochastic gradients in MAML update step is crucial for RL problems since computation of exact gradients requires access to a large number of possible trajectories. For this formulation, we propose a variant of the MAML method, named Stochastic Gradient Meta-Reinforcement Learning (SG-MRL), and study its convergence properties. We derive the iteration and sample complexity of SG-MRL to find an $\epsilon$-first-order stationary point, which, to the best of our knowledge, provides the first convergence guarantee for model-agnostic meta-reinforcement learning algorithms. We further show how our results extend to the case where more than one step of stochastic policy gradient method is used in the update during the test time.

研究の動機と目的

  • モデルに依存しないメタ強化学習アルゴリズムにおいて、確率的方策勾配が用いられる場合の理論的収束保証の欠如に対処すること。
  • 内側のループで正確な勾配計算を回避する強化学習に特化した、保証付き収束性を有するMAMLの変種を構築すること。
  • 提案手法が $\u0005c{\epsilon}$-一次静止点に到達するまでの反復回数およびサンプル複雑性を分析すること。
  • テスト時適応における複数回の確率的方策勾配更新を含む状況への収束解析を拡張すること。

提案手法

  • 内側の更新に正確な勾配ではなく、確率的方策勾配を使用するメタ強化学習の確率的勾配ベースの変種であるSG-MRLを提案する。
  • 強化学習における正確な勾配計算の高バイアスおよび計算コストを軽減するため、適応段階で1ステップの確率的方策勾配更新を採用する。
  • 標準的な滑らかさおよび勾配有界性仮定の下で、$\u0005c{\epsilon}$-一次静止点に到達するための反復およびサンプル複雑性の理論的上限を導出する。
  • メタ最適化フレームワークを採用し、メタ方策はMDPの分布全体を通して確率的勾配降下法で更新される。
  • 関数近似を伴う強化学習の文脈における収束を分析するため、非凸確率的最適化の理論的道具を適用する。
  • テスト時適応における複数回の内側ループ方策更新を含む状況への解析を拡張し、収束保証を維持する。

実験結果

リサーチクエスチョン

  • RQ1モデルに依存しないメタ強化学習アルゴリズムが確率的方策勾配を用いる場合の反復回数およびサンプル複雑性は何か?
  • RQ2内側ループで正確な勾配計算を回避する保証付き収束性を持つアルゴリズムをメタ強化学習に設計できるか?
  • RQ3テスト時適応において1回より多くの確率的方策勾配更新が用いられる場合、収束保証はどのように拡張されるか?
  • RQ4この設定で $\u0005c{\epsilon}$-一次静止点への収束を保証する理論的条件は何か?

主な発見

  • 本稿は、確率的方策勾配を用いるモデルに依存しないメタ強化学習における反復回数およびサンプル複雑性の上限を初めて確立する。
  • 標準的な滑らかさおよび勾配有界性仮定の下で、SG-MRLは有限回の反復およびサンプル数で $\u0005c{\epsilon}$-一次静止点に収束する。
  • 収束速度は、確率的方策勾配の分散および方策勾配目的関数の滑らかさに依存する。
  • 理論的枠組みは、テスト時適応における複数回の内側ループ更新に対しても拡張可能であり、収束保証を維持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。