Skip to main content
QUICK REVIEW

[논문 리뷰] Optimal Matrix Momentum Stochastic Approximation and Applications to Q-learning

Adithya M. Devraj, Ana Bušić|arXiv (Cornell University)|2018. 09. 17.
Stochastic Gradient Optimization Techniques참고 문헌 25인용 수 5
한 줄 요약

이 논문은 루트-찾기 문제에 대해 최적의 渐近 분산을 갖는 두 가지 새로운 확률적 근사 알고리즘인 PolSA와 NeSA를 소개한다. Polyak의 무거운 공 방법과 Nesterov의 가속화에 영감을 받은 행렬 모멘텀을 통합함으로써, PolSA는 계산 비용이 높은 확률적 뉴턴-라프슨(SNR) 방법과 유사한 성능을 달성한다. 반면 NeSA는 강한 수렴성과 낮은 계산 비용을 제공하는 단순화된 버전으로, 특히 Q-학습과 TD-학습 응용에서 효과적이다.

ABSTRACT

Acceleration is an increasingly common theme in the stochastic optimization literature. The two most common examples are Nesterov's method, and Polyak's momentum technique. In this paper two new algorithms are introduced for root finding problems: 1) PolSA is a root finding algorithm with specially designed matrix momentum, and 2) NeSA can be regarded as a variant of Nesterov's algorithm, or a simplification of PolSA. The PolSA algorithm is new even in the context of optimization (when cast as a root finding problem). The research surveyed in this paper is motivated by applications to reinforcement learning. It is well known that most variants of TD- and Q-learning may be cast as SA (stochastic approximation) algorithms, and the tools from general SA theory can be used to investigate convergence and bounds on convergence rate. In particular, the asymptotic variance is a common metric of performance for SA algorithms, and is also one among many metrics used in assessing the performance of stochastic optimization algorithms. There are two well known SA techniques that are known to have optimal asymptotic variance: the Ruppert-Polyak averaging technique, and stochastic Newton-Raphson (SNR). The former algorithm can have extremely bad transient performance, and the latter can be computationally expensive. It is demonstrated here that parameter estimates from the new PolSA algorithm couple with those of the ideal (but more complex) SNR algorithm. The new algorithm is thus a third approach to obtain optimal asymptotic covariance. These strong results require assumptions on the model. A linearized model is considered, and the noise is assumed to be a martingale difference sequence. Numerical results are obtained in a non-linear setting that is the motivation for this work: In PolSA implementations of Q-learning it is observed that coupling occurs with SNR in this non-ideal setting.

연구 동기 및 목표

  • 확률적 뉴턴-라프슨(SNR) 방법의 계산 비용을 피하면서도 최적의 渐近 분산을 갖는 새로운 확률적 근사 알고리즘을 개발하기 위해.
  • 선형 및 비선형 설정 모두에서 SNR와의 결합을 달성하는 행렬 모멘텀 기반 알고리즘(PolSA)을 설계하여 최적의 수렴 속도를 보장하기 위해.
  • 계산 복잡도를 줄이고 강한 수렴 성능를 유지하는 단순화된 변형(NeSA)을 제안하기 위해.
  • 기본적인 확률적 근사 방법이 높은 분산이나 느린 수렴으로 어려움을 겪는 강화학습 문제, 특히 Q-학습과 TD(0)-학습에 새로운 알고리즘을 적용하기 위해.
  • 표준 SA 가정(마링갈 차분 노이즈 및 선형화된 동역학 포함) 하에서 수렴 속도와 渐近 공분산에 대한 이론적 보장을 수립하기 위해.

제안 방법

  • PolSA는 확률적 근사 프레임워크 내에서 시간에 따라 변화하는 행렬 시퀀스 {Gn}을 통해 행렬 모멘텀을 도입하며, 업데이트에 모멘텀 항 ∆θn과 보정된 기울기 항이 포함된다.
  • 이 알고리즘은 헤시안 유사한 행렬의 역행렬을 추정하는 행렬 보정 시퀀스 {Gn}을 사용하여, 명시적인 헤시안 역행렬 계산 없이도 SNR의 행동을 모방한다.
  • NeSA는 PolSA의 단순화된 변형으로, 행렬 보정을 고정된 스칼라 모멘텀 파라미터 ζ로 대체하여 Nesterov 유사 가속 항이 포함된 재귀적 업데이트를 제공한다.
  • 알고리즘들은 함수 f(θ, X)가 Aθ − b로 선형화된 설정에서 분석되며, 노이즈는 마링갈 차분 시퀀스로 모델링된다.
  • 이론적 분석을 통해 PolSA가 최적의 渐近 공분산 Σ∗ = A−1Σ∆A−T를 달성함을 입증하였으며, 이는 SNR 방법과 동일하다.
  • 비선형 Q-학습 설정에서의 수치 실험 결과, PolSA와 NeSA는 계산 비용을 크게 줄였음에도 불구하고 SNR에 가까운 성능을 보였다.

실험 결과

연구 질문

  • RQ1행렬 역행렬 계산이나 각 단계에서의 헤시안 역행렬 계산 없이도, 행렬 모멘텀 기반 확률적 근사 알고리즘이 확률적 뉴턴-라프슨(SNR) 방법과 동일한 최적의 渐近 분산을 달성할 수 있는가?
  • RQ2비선형 동역학과 마코프 성질을 갖는 Q-학습과 같은 비선형 설정에서 제안된 PolSA 알고리즘이 SNR와 어떻게 결합되는가?
  • RQ3강화학습의 확률적 근사에 행렬 모멘텀을 사용할 경우, 계산 복잡도와 수렴 속도 사이의 성능 트레이드오프는 어떠한가?
  • RQ4PolSA의 단순화된 변형(NeSA)은 더 높은 계산 효율성과 구현 용이성에도 불구하고 SNR의 수렴 성능을 유지할 수 있는가?
  • RQ5PolSA와 NeSA의 행렬 모멘텀 구조는 표준 확률적 근사 및 고전적 Q-학습 알고리즘 대비 TD(0) 및 Q-학습에서 임시 및 渐近 성능을 얼마나 향상시키는가?

주요 결과

  • PolSA는 최적의 渐近 공분산 Σ∗ = A−1Σ∆A−T를 달성하여, 渐近 분산의 이론적 하한선과 일치하며, 이는 확률적 뉴턴-라프슨(SNR) 방법과 동일하다.
  • 비선형 Q-학습 설정에서 PolSA는 SNR와 강한 결합을 보이며, 문제의 비선형성에도 불구하고 거의 최적의 수렴 속도를 달성하고 있음을 나타낸다.
  • PolSA의 단순화된 변형인 NeSA는 Q-학습에서 뛰어난 성능을 보이며, 표준 및 최근의 변형 대비 수렴 속도 향상과 분산 감소에서 뛰어난 성능을 보였다.
  • PolSA와 NeSA의 행렬 모멘텀은 표준 확률적 근사 및 고전적 Q-학습 알고리즘 대비 더 빠른 수렴과 낮은 渐近 분산을 제공한다.
  • 이론적 분석을 통해 PolSA와 NeSA가 표준 가정(마링갈 차분 노이즈 및 선형화된 동역학 포함) 하에서 수렴을 보임을 확인하였다.
  • 수치 결과는 PolSA와 NeSA가 선형화된 가정에서 벗어나도 실질적인 강화학습 과제에서 뛰어난 성능을 유지함을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.