[논문 리뷰] Sample Complexity Bounds for Two Timescale Value-based Reinforcement Learning Algorithms
이 논문은 일정한 스텝사이즈를 사용하는 마코프 샘플링 하에서 두 타임스케일 가치기반 강화학습 알고리즘—선형 및 비선형 TDC, 그리고 Greedy-GQ에 대해 최초로 비점근적 수렴 분석을 제공한다. 선형 TDC의 경우 최적의 표본 복잡도 $\mathcal{O}(\epsilon^{-1}\log(1/\epsilon))$를, 비선형 TDC 및 Greedy-GQ의 경우 $\mathcal{O}(\epsilon^{-2})$를 확립하며, 이는 이전 결과를 크게 향상시키고 널리 사용되는 RL 알고리즘에 실용적인 유한표본 보장을 제공한다.
Two timescale stochastic approximation (SA) has been widely used in value-based reinforcement learning algorithms. In the policy evaluation setting, it can model the linear and nonlinear temporal difference learning with gradient correction (TDC) algorithms as linear SA and nonlinear SA, respectively. In the policy optimization setting, two timescale nonlinear SA can also model the greedy gradient-Q (Greedy-GQ) algorithm. In previous studies, the non-asymptotic analysis of linear TDC and Greedy-GQ has been studied in the Markovian setting, with diminishing or accuracy-dependent stepsize. For the nonlinear TDC algorithm, only the asymptotic convergence has been established. In this paper, we study the non-asymptotic convergence rate of two timescale linear and nonlinear TDC and Greedy-GQ under Markovian sampling and with accuracy-independent constant stepsize. For linear TDC, we provide a novel non-asymptotic analysis and show that it attains an $\\epsilon$-accurate solution with the optimal sample complexity of $\\mathcal{O}(\\epsilon^{-1}\\log(1/\\epsilon))$ under a constant stepsize. For nonlinear TDC and Greedy-GQ, we show that both algorithms attain $\\epsilon$-accurate stationary solution with sample complexity $\\mathcal{O}(\\epsilon^{-2})$. It is the first non-asymptotic convergence result established for nonlinear TDC under Markovian sampling and our result for Greedy-GQ outperforms the previous result orderwisely by a factor of $\\mathcal{O}(\\epsilon^{-1}\\log(1/\\epsilon))$.
연구 동기 및 목표
- 실제로 널리 사용되는 일정한 스텝사이즈를 사용하는 두 타임스케일 가치기반 RL의 비점근적 수렴 분석에서의 격차를 메우기 위해.
- 이전에 점근적 수렴만 알려진 상태에서, 마코프 샘플링 하에서 비선형 TDC에 대한 최초의 비점근적 수렴 속도를 확립하기 위해.
- 일정한 스텝사이즈 하에서 Greedy-GQ의 표본 복잡도를 이전 결과를 초월하여 $\mathcal{O}(\epsilon^{-2})$로 향상시키기 위해.
- 강화학습의 정책 평가 및 최적화 문제에 대해 선형 및 비선형 두 타임스케일 확률적 근사(SA) 분석을 통합하기 위해.
제안 방법
- 마코프 샘플링과 일정한 스텝사이즈 하에서 두 타임스케일 확률적 근사(SA)에 대한 새로운 비점근적 분석 프레임워크를 개발한다.
- 리아푸노프 함수 기법과 재귀 부등식을 사용하여 반복값의 기대 제곱 오차를 최적 해에서의 오차로 제한한다.
- 빠른 타임스케일과 느린 타임스케일 간의 상호작용을 정밀하게 분석함으로써 수렴 속도를 확립하며, 특히 빠른 변수의 오차가 느린 변수로의 오차 전파를 중점적으로 다룬다.
- 느린 변수의 누적 오차를 빠른 변수의 추적 오차와 기울기 노름으로 제한하는 핵심 부등식(식 59)을 도입한다.
- 전역 안정성 또는 국소 선형화 조건과 같은 제약 조건을 최소화하여, 비선형 함수 근사에 더 넓은 적용 가능성을 제공한다.
- 반복 수 $T$ 와 목표 정확도 $\epsilon$ 간의 관계를 이용하여 표본 복잡도 한계를 유도하며, 평균 기울기 노름을 수렴 지표로 사용한다.
실험 결과
연구 질문
- RQ1마코프 샘플링 하에서 일정한 스텝사이즈를 사용할 때 선형 TDC의 비점근적 표본 복잡도는 무엇인가?
- RQ2이전에 유한표본 분석이 없었음에도 불구하고, 마코프 샘플링 하에서 일정한 스텝사이즈를 사용할 때 비선형 TDC에 대한 비점근적 수렴 속도를 확립할 수 있는가?
- RQ3일정한 스텝사이즈를 사용할 때 Greedy-GQ의 표본 복잡도는 이전의 감소하는 또는 $\epsilon$-의존 스텝사이즈 결과와 비교해 어떻게 되는가?
- RQ4지나치게 제약적인 가정(예: 국소 선형화 또는 전역 안정성) 없이도 비선형 두 타임스케일 SA 분석을 일반화할 수 있는가?
- RQ5실제 샘플링 조건 하에서 두 타임스케일 RL 알고리즘의 스텝사이즈 선택과 수렴 속도 사이의 최적의 트레이드오프는 무엇인가?
주요 결과
- 선형 TDC 알고리즘은 일정한 스텝사이즈 하에서 $\epsilon$-정확한 해를 $\mathcal{O}(\epsilon^{-1}\log(1/\epsilon))$의 표본 복잡도로 달성하며, 이는 최적이다.
- 비선형 TDC에 대해 마코프 샘플링 하에서 최초로 비점근적 수렴 결과를 확립하였으며, 표본 복잡도는 $\mathcal{O}(\epsilon^{-2})$이다.
- Greedy-GQ 알고리즘은 일정한 스텝사이즈 하에서 표본 복잡도 $\mathcal{O}(\epsilon^{-2})$를 달성하여, 이전 결과보다 $\mathcal{O}(\epsilon^{-1}\log(1/\epsilon))$의 요소만큼 향상되었다.
- 국소 선형화나 전역 안정성과 같은 제약 조건 없이 분석이 유지되어 일반적인 비선형 함수 근사에 적용 가능하다.
- 수렴 속도는 실용적이고 실제로 널리 사용되는 일정한 스텝사이즈를 사용하여 유도되었다.
- 유도된 한계는 날카롭고, 마코프 샘플링 하에서 비볼록 확률적 최적화의 이론적 하한과 일치한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.