Skip to main content
QUICK REVIEW

[논문 리뷰] Greedy-GQ with Variance Reduction: Finite-time Analysis and Improved Complexity

Shaocong Ma, Ziyi Chen|arXiv (Cornell University)|2021. 03. 30.
Reinforcement Learning in Robotics참고 문헌 36인용 수 7
한 줄 요약

이 논문은 선형 함수 근사와 마르코프성 샘플링 하에서 오프-폴리시 최적 제어를 위한 분산 감소 두 시간 척도 강화 학습 알고리즘인 VR-Greedy-GQ를 제안한다. 두 시간 척도 업데이트에서 확률적 경사 하강의 분산을 줄이기 위해 SVRG 체계를 통합함으로써, 이 방법은 $\mathcal{O}(e^{-2})$의 개선된 샘플 복잡도를 달성하며, 원래 Greedy-GQ의 $\mathcal{O}(e^{-3})$ 복잡도를 크게 감소시키면서도 $e$-정류점으로의 수렴을 유지한다.

ABSTRACT

Greedy-GQ is a value-based reinforcement learning (RL) algorithm for optimal control. Recently, the finite-time analysis of Greedy-GQ has been developed under linear function approximation and Markovian sampling, and the algorithm is shown to achieve an $ε$-stationary point with a sample complexity in the order of $\mathcal{O}(ε^{-3})$. Such a high sample complexity is due to the large variance induced by the Markovian samples. In this paper, we propose a variance-reduced Greedy-GQ (VR-Greedy-GQ) algorithm for off-policy optimal control. In particular, the algorithm applies the SVRG-based variance reduction scheme to reduce the stochastic variance of the two time-scale updates. We study the finite-time convergence of VR-Greedy-GQ under linear function approximation and Markovian sampling and show that the algorithm achieves a much smaller bias and variance error than the original Greedy-GQ. In particular, we prove that VR-Greedy-GQ achieves an improved sample complexity that is in the order of $\mathcal{O}(ε^{-2})$. We further compare the performance of VR-Greedy-GQ with that of Greedy-GQ in various RL experiments to corroborate our theoretical findings.

연구 동기 및 목표

  • 마르코프성 샘플링 하에서 Greedy-GQ의 높은 샘플 복잡도를 해결하기 위해, 이는 오프-폴리시 시간 차분 업데이트에서 큰 확률적 분산에 기인한다.
  • 두 시간 척도 업데이트에 특화된 분산 감소 기법을 개발하여, SVRG 프레임워크를 활용해 학습 안정성을 향상시키기 위해 노력한다.
  • 선형 함수 근사와 마르코프성 샘플링 하에서 제안된 알고리즘의 유한 시간 수렴 보장을 수립한다.
  • 이론적으로도 실험적으로도 분산 감소가 최적 제어에서 더 높은 샘플 효율성으로 이어진다는 것을 입증한다.

제안 방법

  • 알고리즘은 SVRG 기반 분산 감소 기법을 Greedy-GQ의 빠른 시간 척도와 느린 시간 척도 업데이트에 모두 적용하며, 제어 변수를 계산하기 위해 크기 $M$의 기준 배치를 사용한다.
  • 외부 루프의 시작 시점에 매개변수 $\widetilde{\theta}^{(m)}$와 $\widetilde{\omega}^{(m)}$의 스냅샷을 유지하여 확률적 경사 하강의 분산을 줄인다.
  • 정책 매개변수 $\theta$와 가치 함수 매개변수 $\omega$에 대해 각각 별도의 학습률 $\eta_\theta$와 $\eta_\omega$를 사용하여 두 시간 척도 업데이트 체계를 구현한다.
  • 이론적 분석은 편향 오차와 분산 오차를 각각 $\mathcal{O}(M^{-1})$과 $\mathcal{O}(\eta_\theta M^{-1})$로 경계하며, 이는 Greedy-GQ에 비해 분산이 $M$ 배 감소했음을 보여준다.
  • 경험 재생과 행동 정책에서의 마르코프성 샘플링을 사용하여 오프-폴리시 학습을 위한 선형 함수 근사를 위한 알고리즘으로 설계되었다.
  • 수렴 분석은 SVRG 스타일의 추론을 두 시간 척도, 비볼록 설정으로 확장하였으며, 마르코프성 의존성 하에서 새로운 분산 및 편향 제어 기법이 필요하다.

실험 결과

연구 질문

  • RQ1마르코프성 샘플링 하에서 Greedy-GQ의 두 시간 척도 업데이트에 분산 감소 기법을 효과적으로 적용하여 확률적 경사 하강의 분산을 줄일 수 있는가?
  • RQ2제안된 분산 감소 알고리즘이 유한 시간 설정에서 원래 Greedy-GQ보다 더 낮은 샘플 복잡도를 달성하는가?
  • RQ3SVRG 프레임워크는 두 시간 척도 강화 학습의 상관관계가 있고 비볼록인 업데이트를 다룰 수 있도록 적응될 수 있는가?
  • RQ4분산 감소 설정에서 배치 크기 $M$, 학습률 $\eta_\theta$, 수렴 오차 사이의 이론적 트레이드오���은 무엇인가?
  • RQ5유한 시간 영역에서 업데이트의 편향과 분산은 $M$과 $\eta_\theta$에 따라 어떻게 척도화되는가?

주요 결과

  • VR-Greedy-GQ는 샘플 복잡도 $\mathcal{O}(e^{-2})$로 $e$-정류점에 도달하며, 원래 Greedy-GQ의 $\mathcal{O}(e^{-3})$ 복잡도보다 개선되었다.
  • 마르코프성 샘플링에 기인한 편향 오차는 $\mathcal{O}(M^{-1})$로 감소하였고, 분산 오차는 $\mathcal{O}(\eta_\theta M^{-1})$로 감소하였으며, 둘 다 Greedy-GQ에 비해 $M$ 배 감소하였다.
  • 이론적 분석은 선형 함수 근사 하에서 두 시간 척도 업데이트의 편향과 분산이 분산 감소 기법으로 크게 감소함을 확인한다.
  • Garnet와 Frozen Lake 환경에서의 실험 평가 결과, VR-Greedy-GQ는 Greedy-GQ보다 빠르게 수렴하고 더 높은 최대 기대 보상을 달성한다.
  • 다양한 트레이젝터리에 걸쳐 안정적인 성능을 유지하며, 최대 추정 보상이 훈련 과정에서 점차 증가함으로써 효과적인 정책 최적화가 이루어졌음을 시사한다.
  • 샘플 복잡도 향상은 두 시간 척도 업데이트에서 기울기 노이즈를 줄이는 SVRG 기반 제어 변수 메커니즘 덕분이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.