Skip to main content
QUICK REVIEW

[논문 리뷰] Non-asymptotic Convergence of Adam-type Reinforcement Learning Algorithms under Markovian Sampling

Huaqing Xiong, Tengyu Xu|arXiv (Cornell University)|2020. 02. 15.
Reinforcement Learning in Robotics참고 문헌 65인용 수 11
한 줄 요약

이 논문은 마르코프 샘플링 하에서 Adam 유형 강화학습 알고리즘—PG-AMSGrad 및 TD-AMSGrad—에 대한 최초의 비점근 수렴 분석을 제시한다. 감소하는 단계 크기 하에서 수렴 속도가 $\mathcal{O}(\log^2 T / \sqrt{T})$ 로 정류점에 수렴하고, 일정한 단계 크기 하에서 최적점의 이웃으로 수렴하며, 각각 일반적인 비선형 및 선형 함수 근사 하에서 $\mathcal{O}(1/T)$ 의 속도를 보인다.

ABSTRACT

Despite the wide applications of Adam in reinforcement learning (RL), the theoretical convergence of Adam-type RL algorithms has not been established. This paper provides the first such convergence analysis for two fundamental RL algorithms of policy gradient (PG) and temporal difference (TD) learning that incorporate AMSGrad updates (a standard alternative of Adam in theoretical analysis), referred to as PG-AMSGrad and TD-AMSGrad, respectively. Moreover, our analysis focuses on Markovian sampling for both algorithms. We show that under general nonlinear function approximation, PG-AMSGrad with a constant stepsize converges to a neighborhood of a stationary point at the rate of $\mathcal{O}(1/T)$ (where $T$ denotes the number of iterations), and with a diminishing stepsize converges exactly to a stationary point at the rate of $\mathcal{O}(\log^2 T/\sqrt{T})$. Furthermore, under linear function approximation, TD-AMSGrad with a constant stepsize converges to a neighborhood of the global optimum at the rate of $\mathcal{O}(1/T)$, and with a diminishing stepsize converges exactly to the global optimum at the rate of $\mathcal{O}(\log T/\sqrt{T})$. Our study develops new techniques for analyzing the Adam-type RL algorithms under Markovian sampling.

연구 동기 및 목표

  • 마르코프 샘플링 하에서 Adam 유형 강화학습 알고리즘에 대한 최초의 비점근 수렴 보장을 확립하는 것.
  • 정책 그래เดียน트 및 시간 차이 학습에서 비.i.i.d. 샘플로 인한 편향된 그래디언트 추정 문제를 해결하는 것.
  • 시간에 따라 변하는 비.i.i.d. 샘플링 과정 하에서 AMSGrad 업데이트의 편향과 분산을 제어하기 위한 새로운 분석 기법 개발.
  • 기존의 순수한 정책 그래디언트 분석을 개선하여, 적응형 도구를 활용해 마르코프 샘플링 하에서 더 날카운 수렴 속도 유도.
  • 일般 및 선형 함수 근사 하에서 일정 및 감소하는 단계 크기 스케줄 하에서 PG-AMSGrad와 TD-AMSGrad의 수렴 속도 제공.

제안 방법

  • PG-AMSGrad와 TD-AMSGrad를 정책 그래디언트 및 시간 차이 학습에 기반한 AMSGrad 적응형 업데이트 규칙의 확장으로 제안.
  • 비.i.i.d. 샘플링 및 적응형 모멘타무 하에서도 단계 크기로 그래디언트 추정 오차를 제한하는 새로운 편향 제어 메커니즘 도입.
  • PG-AMSGrad에서 시간에 따라 변화하는 정책과 마르코프 전이의 영향을 분리하기 위해 기준 프로세스와의 커플링 기법 사용.
  • AMSGrad의 적응형 학습률 동역학을 다루기 위해 레마 14 및 17를 활용한 기하급수적 경계 및 모멘트 제어.
  • 최종 출력 반복값의 수렴 속도 유도를 위해 젠슨 부등식과 반복값 평균화 활용.
  • 분석에서 편향 및 분산 항을 유한하게 제어하기 위해 그래디언트 노름, 함수 근사, 혼합 시간에 대한 가정 활용.

실험 결과

연구 질문

  • RQ1정책 그래디언트 및 시간 차이 학습에서 Adam 유형 업데이트가 마르코프 샘플링 하에서 비점근 수렴을 달성할 수 있는가?
  • RQ2일반적인 비선형 및 선형 함수 근사 하에서 일정 및 감소하는 단계 크기 스케줄 하에서 PG-AMSGrad와 TD-AMSGrad의 수렴 속도는 무엇인가?
  • RQ3비.i.i.d. 샘플링과 적응형 모멘타무로 인한 편향은 강화학습 알고리즘에서 어떻게 공식적으로 제한하고 제어할 수 있는가?
  • RQ4제안된 분석 기법은 마르코프 샘플링 하에서 기존의 순수한 정책 그래디언트의 수렴 속도를 향상시킬 수 있는가?
  • RQ5샘플링이 i.i.d. 가 아닌 상황에서 적응형 최적화의 이론적 한계는 무엇인가?

주요 결과

  • 일반적인 비선형 함수 근사 하에서 일정 단계 크기로 PG-AMSGrad는 $\mathcal{O}(1/T)$ 의 속도로 정류점의 이웃으로 수렴한다.
  • 감소하는 단계 크기 $\alpha_t = \alpha / \sqrt{t}$ 를 사용할 경우 PG-AMSGrad는 정확히 정류점으로 $\mathcal{O}(\log^2 T / \sqrt{T})$ 의 속도로 수렴한다.
  • 선형 함수 근사 하에서 일정 단계 크기로 TD-AMSGrad는 전역 최적점의 이웃으로 $\mathcal{O}(1/T)$ 의 속도로 수렴한다.
  • 감소하는 단계 크기로 선형 함수 근사 하에서 TD-AMSGrad는 전역 최적점으로 정확히 $\mathcal{O}(\log T / \sqrt{T})$ 의 속도로 수렴한다.
  • 비.i.i.d. 샘플링과 적응형 모멘타무로 인한 편향을 제어하기 위한 새로운 기법을 도입하였으며, 이는 표준 Adam 분석에선 볼 수 없는 것이다.
  • 유도된 수렴 속도는 마르코프 샘플링 하에서 기존의 순수한 정책 그래디언트 결과를 개선하여 순서적으로 더 낮은 계산 복잡도를 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.