Skip to main content
QUICK REVIEW

[논문 리뷰] A Hybrid Stochastic Policy Gradient Algorithm for Reinforcement Learning

Nhan H. Pham, Lam M. Nguyen|arXiv (Cornell University)|2020. 03. 01.
Reinforcement Learning in Robotics참고 문헌 47인용 수 6
한 줄 요약

이 논문은 편향 없는 REINFORCE 추정기와 편향 있는 SARAH 기반 추정기를 조합하여 분산을 줄이고 계산 효율성을 유지하는 새로운 하이브리드 스토하스틱 정책 그래디언트 추정기를 제안한다. 이를 통해 유도된 ProxHSPGA 알고리즘은 복합 정책 최적화에서 제1차 정류점에 도달하기 위한 최적의 궤적 복잡도 𝒪(ε⁻³)를 달성하며, 비복합 및 복합 설정 모두에서 기존 방법들인 REINFORCE (𝒪(ε⁻⁴))과 SVRPG (𝒪(ε⁻¹⁰ᐟ³))을 능가한다.

ABSTRACT

We propose a novel hybrid stochastic policy gradient estimator by combining an unbiased policy gradient estimator, the REINFORCE estimator, with another biased one, an adapted SARAH estimator for policy optimization. The hybrid policy gradient estimator is shown to be biased, but has variance reduced property. Using this estimator, we develop a new Proximal Hybrid Stochastic Policy Gradient Algorithm (ProxHSPGA) to solve a composite policy optimization problem that allows us to handle constraints or regularizers on the policy parameters. We first propose a single-looped algorithm then introduce a more practical restarting variant. We prove that both algorithms can achieve the best-known trajectory complexity $\mathcal{O}\left(\varepsilon^{-3} ight)$ to attain a first-order stationary point for the composite problem which is better than existing REINFORCE/GPOMDP $\mathcal{O}\left(\varepsilon^{-4} ight)$ and SVRPG $\mathcal{O}\left(\varepsilon^{-10/3} ight)$ in the non-composite setting. We evaluate the performance of our algorithm on several well-known examples in reinforcement learning. Numerical results show that our algorithm outperforms two existing methods on these examples. Moreover, the composite settings indeed have some advantages compared to the non-composite ones on certain problems.

연구 동기 및 목표

  • 강화 학습에서 큰 또는 연속적인 액션 공간에서 정책 그래디언트 방법의 높은 분산 문제를 해결하기 위해.
  • 편향 없는 (REINFORCE)과 편향 있는 (SARAH) 추정기의 장점을 결합한 분산 감소 정책 그래디언트 추정기를 개발하기 위해.
  • 정규화나 제약 조건이 있는 정책 파라미터를 다룰 수 있는 프록시멀 알고리즘을 설계하기 위해.
  • 기존 정책 그래디언트 방법들에 비해 더 높은 샘플 효율성과 수렴 속도를 달성하기 위해.
  • 연속 제어 과제에서 정규화를 포함한 복합 설정이 샘플 효율성과 성능 향상에 기여하는지 실증적으로 검증하기 위해.

제안 방법

  • 편향 없는 (REINFORCE)과 수정된 SARAH 추정기(편향 있음)를 조합하여 편향은 있지만 분산이 감소된 추정기를 도입한 하이브리드 정책 그래디언트 추정기를 제안한다.
  • 정규화 또는 제약 조건이 있는 복합 정책 최적화를 위한 단일 루프 프록시멀 하이브리드 스토하스틱 정책 그래디언트 알고리즘(ProxHSPGA)을 개발한다.
  • 실제 수렴성과 안정성을 향상시키기 위해 ProxHSPGA의 재시작 변형을 도입한다.
  • 복합 목표를 다루기 위해 정규화 함수 Q(θ)를 사용한 프록시멀 스텝을 도입하여 안정성과 수렴성을 보장한다.
  • 미니배치와 스크래치 샘플링 전략을 활용하여 그래디언트 분산을 줄이며, 비.i.i.d. 샘플링 하에서의 수렴성에 대한 이론적 분석을 수행한다.
  • SVRG와 SARAH에 영감을 받은 분산 감소 메커니즘을 도입하였으며, 궤적 기반 샘플링에 적합하게 정책 그래디언트 설정에 적응시켰다.

실험 결과

연구 질문

  • RQ1편향 없는 추정기와 편향 있는 추정기를 조합한 하이브리드 정책 그래디언트 추정기가 기존 방법들보다 더 나은 분산 감소를 달성할 수 있는가?
  • RQ2제안된 ProxHSPGA 알고리즘이 복합 정책 최적화에서 REINFORCE, GPOMDP, SVRPG에 비해 더 낮은 궤적 복잡도를 달성하는가?
  • RQ3정책 최적화 문제에 정규화나 제약 조건을 포함시키면 연속 제어 과제에서 더 높은 샘플 효율성과 성능 향상이 이루어지는가?
  • RQ4재시작 변형된 ProxHSPGA는 단일 루프 버전에 비해 수렴 속도와 안정성 측면에서 어떻게 비교되는가?
  • RQ5Mujoco 환경에서 다양한 정규화 함수가 최종 정책 성능에 미치는 영향은 무엇인가?

주요 결과

  • ProxHSPGA 알고리즘은 제1차 정류점에 도달하기 위해 𝒪(ε⁻³)의 궤적 복잡도를 달성하며, 이는 복합 정책 최적화 문제에서 알려진 최고의 속도이다.
  • 하이브리드 추정기는 REINFORCE에 비해 분산을 감소시키면서도 계산 효율성을 유지하여 실질적으로 더 빠른 수렴을 이끌어낸다.
  • 수치 실험 결과, ProxHSPGA는 CartPole, Acrobot, Mujoco 환경을 포함한 표준 제어 벤치마크에서 GPOMDP와 SVRPG를 모두 능가한다.
  • 정규화를 포함한 복합 설정은 비복합 설정에 비해 일관되게 더 높은 성능을 보이며, 이는 정규화가 샘플 효율성과 정책 안정성 향상에 기여함을 시사한다.
  • ProxHSPGA의 재시작 변형은 고차원적이고 연속적인 제어 과제에서 특히 더 뛰어난 실용적 수렴 성능을 보였다.
  • 알고리즘은 총 궤적 수와 프록시멀 연산 수 모두 𝒪(ε⁻³)를 유지하여 이론적 효율성과 확장 가능성(스케일러빌리티)을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.