Skip to main content
QUICK REVIEW

[논문 리뷰] Stochastic Variance Reduction for Policy Gradient Estimation

Tian-Bing Xu, Qiang Liu|arXiv (Cornell University)|2017. 10. 17.
Reinforcement Learning in Robotics참고 문헌 28인용 수 10
한 줄 요약

이 논문은 연속 제어 작업에서 샘플 효율성을 크게 향상시키기 위해 SVRG를 신뢰 영역 프레임워크의 TRPO에 통합한 확률적 분산 감소 정책 최적화 방법인 SVRPO를 제안한다. 이 방법은 기울기 분산을 감소시키고 곡률 정보를 활용함으로써 Mujoco 벤치마크인 Swimmer, Walker, Hopper, Ant에서 TRPO보다 뛰어난 성능을 달성한다.

ABSTRACT

Recent advances in policy gradient methods and deep learning have demonstrated their applicability for complex reinforcement learning problems. However, the variance of the performance gradient estimates obtained from the simulation is often excessive, leading to poor sample efficiency. In this paper, we apply the stochastic variance reduced gradient descent (SVRG) to model-free policy gradient to significantly improve the sample-efficiency. The SVRG estimation is incorporated into a trust-region Newton conjugate gradient framework for the policy optimization. On several Mujoco tasks, our method achieves significantly better performance compared to the state-of-the-art model-free policy gradient methods in robotic continuous control such as trust region policy optimization (TRPO)

연구 동기 및 목표

  • 모델-프리 강화 학습에서 샘플 효율성을 저해하는 정책 기울기 추정의 높은 분산을 해결하기 위해.
  • 정책 업데이트에서 기울기 분산을 감소시킴으로써 신뢰 영역 정책 최적화(TRPO)의 수렴성과 안정성을 향상시키기 위해.
  • 스토하스틱 분산 감소(SVRG)를 TRPO 프레임워크에 통합하여 연속 제어 작업에서의 성능을 향상시키기 위해.
  • 제어 변수와 곡률 정보를 활용한 미니배치 추정을 통해 롤아웃의 더 효율적인 사용을 가능하게 하기 위해.

제안 방법

  • 온정책 강화 학습에서 정책 기울기 추정의 분산을 감소시키기 위해 SVRG 기법을 적용한다.
  • 피셔 정보 행렬을 사용한 곡률 보정을 위한 신뢰 영역 뉴턴-CG 최적화 프레임워크에 SVRG를 통합한다.
  • 추정된 가치 함수를 바탕으로 한 제어 변수를 사용하여 정책 업데이트에서 기울기 분산을 추가로 감소시킨다.
  • 트레이젝터리의 미니배치 샘플링을 통해 온정책 일관성을 유지하면서 분산 감소 기반 기울기를 계산한다.
  • 피셔 정보 행렬을 활용하여 이차 정보를 통해 정책 업데이트를 안내함으로써 수렴 안정성을 향상시킨다.
  • 스토하스틱 미니배치 추정과 신뢰 영역 제약 조건을 조합하여 탐색과 이용의 균형을 맞춘다.

실험 결과

연구 질문

  • RQ1스토하스틱 분산 감소(SVRG)가 연속 제어 작업에서 정책 기울기 방법의 샘플 효율성을 크게 향상시킬 수 있는가?
  • RQ2SVRG를 신뢰 영역 최적화와 조합할 경우 Mujoco 환경에서 수렴 속도와 최종 성능에 어떤 영향을 미치는가?
  • RQ3제어 변수와 곡률 정보를 통한 분산 감소가 정책 학습의 안정성에 어느 정도 기여하는가?
  • RQ4제안된 방법이 TRPO와 같은 최신 온정책 방법보다 샘플 효율성과 최종 수익 측면에서 뛰어나게 되는가?

주요 결과

  • SVRPO는 Swimmer, Walker, Hopper, Ant를 포함한 Mujoco 작업에서 TRPO보다 유의미하게 뛰어난 성능을 달성한다.
  • 기울기 분산을 감소시킴으로써 기존 정책 기울기 방법과 TRPO에 비해 더 안정적이고 빠른 수렴을 이룬다.
  • Swimmer와 Walker에서 TRPO는 수정되지 않은 기울기로는 성능 향상이 불가능할 정도로 높은 분산으로 인해 성능 향상에 실패하지만, SVRPO는 효과적인 정책을 성공적으로 학습한다.
  • SVRPO에서 제어 변수와 피셔 정보 행렬의 사용은 더 효율적인 정책 업데이트와 향상된 샘플 효율성을 이끌어낸다.
  • 체계적인 실험 결과, SVRPO는 TRPO보다 더 적은 환경 상호작용 횟수로 더 높은 수익을 달성하는 것으로 나타나 샘플 효율성이 향상됨을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.