Skip to main content
QUICK REVIEW

[논문 리뷰] Provably Convergent Policy Gradient Methods for Model-Agnostic Meta-Reinforcement Learning

Alireza Fallah, Aryan Mokhtari|arXiv (Cornell University)|2020. 02. 12.
Reinforcement Learning in Robotics참고 문헌 16인용 수 12
한 줄 요약

이 논문은 새로운 작업에 효율적으로 적응하기 위해 확률적 정책 그래디언트를 사용하는 모델에 종속되지 않는 메타-강화학습 방법인 Stochastic Gradient Meta-Reinforcement Learning (SG-MRL)을 제안한다. 이는 이러한 방법에 대해 처음으로 이론적 수렴 보장을 제공하며, $\c{\epsilon}$-일阶 정류점에 도달하기 위한 반복 및 샘플 복잡도 한계를 설정한다.

ABSTRACT

We consider Model-Agnostic Meta-Learning (MAML) methods for Reinforcement Learning (RL) problems where the goal is to find a policy (using data from several tasks represented by Markov Decision Processes (MDPs)) that can be updated by one step of stochastic policy gradient for the realized MDP. In particular, using stochastic gradients in MAML update step is crucial for RL problems since computation of exact gradients requires access to a large number of possible trajectories. For this formulation, we propose a variant of the MAML method, named Stochastic Gradient Meta-Reinforcement Learning (SG-MRL), and study its convergence properties. We derive the iteration and sample complexity of SG-MRL to find an $\epsilon$-first-order stationary point, which, to the best of our knowledge, provides the first convergence guarantee for model-agnostic meta-reinforcement learning algorithms. We further show how our results extend to the case where more than one step of stochastic policy gradient method is used in the update during the test time.

연구 동기 및 목표

  • 확률적 정책 그래디언트를 사용하는 모델에 종속되지 않는 메타-강화학습 알고리즘에서 이론적 수렴 보장의 부족을 해결하기 위해.
  • 정확한 그래디언트 계산을 내부 루프에서 피하는 강화학습을 위한 특화된 MAML의 증명 가능하게 수렴하는 변종을 개발하기 위해.
  • 제안된 방법이 $\u0005c{\epsilon}$-일阶 정류점에 도달하기 위한 반복 및 샘플 복잡도를 분석하기 위해.
  • 시험 시 적응 과정에서 다중 확률적 정책 그래디언트 업데이트가 포함된 경우로의 수렴 분석을 확장하기 위해.

제안 방법

  • 내부 업데이트에서 정확한 그래디언트 대신 확률적 정책 그래디언트를 사용하는 메타-강화학습을 위한 확률적 그래디언트 기반 변종인 SG-MRL를 제안한다.
  • 강화학습에서 정확한 그래디언트 계산의 높은 분산과 계산 비용을 고려해 적응 단계에서 일단의 확률적 정책 그래디언트 업데이트를 적용한다.
  • 표준 부드러움 및 유한한 그래디언트 가정 하에 $\u0005c{\epsilon}$-일阶 정류점에 도달하기 위한 반복 및 샘플 복잡도에 대한 이론적 한계를 도출한다.
  • 메타-정책이 MDP의 분포를 기반으로 한 확률적 그래디언트 하강을 통해 업데이트되는 메타 최적화 프레임워크를 사용한다.
  • 함수 근사가 적용된 강화학습 맥락에서 수렴을 분석하기 위해 비볼록 확률적 최적화의 이론적 도구를 적용한다.
  • 시험 시 적응 과정에서 다중 내부 루프 정책 업데이트가 포함된 경우로의 분석을 확장하며, 여전히 수렴 보장을 유지한다.

실험 결과

연구 질문

  • RQ1확률적 정책 그래디언트를 사용하는 모델에 종속되지 않는 메타-강화학습 알고리즘의 반복 및 샘플 복잡도는 무엇인가?
  • RQ2내부 루프에서 정확한 그래디언트 계산을 피하는 증명 가능하게 수렴하는 알고리즘을 메타-강화학습을 위해 설계할 수 있는가?
  • RQ3시험 시 적응 과정에서 하나 이상의 확률적 정책 그래디언트 업데이트를 사용할 경우 수렴 보장은 어떻게 확장되는가?
  • RQ4이 설정에서 $\u0005c{\epsilon}$-일阶 정류점으로의 수렴을 보장하기 위한 이론적 조건은 무엇인가?

주요 결과

  • 이 논문은 확률적 정책 그래디언트를 사용하는 모델에 종속되지 않는 메타-강화학습에 대해 알려진 바 없는 첫 번째 반복 및 샘플 복잡도 한계를 설정한다.
  • SG-MRL는 표준 부드러움 및 유한한 그래디언트 가정 하에 유한한 반복 및 샘플 수로 $\u0005c{\epsilon}$-일阶 정류점으로 수렴한다.
  • 수렴 속도는 확률적 정책 그래디언트의 분산과 정책 그래디언트 목표의 부드러움에 따라 달라진다.
  • 이론적 프레임워크는 시험 시 적응 과정에서 다중 내부 루프 업데이트가 포함된 경우로도 확장되며, 여전히 수렴 보장을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.