Skip to main content
QUICK REVIEW

[논문 리뷰] On the Stability of Random Matrix Product with Markovian Noise: Application to Linear Stochastic Approximation and TD Learning

Alain Durmus, Éric Moulines|arXiv (Cornell University)|2021. 01. 30.
Reinforcement Learning in Robotics참고 문헌 19인용 수 5
한 줄 요약

이 논문은 일반적인 마르코프 체인에 의해 구동되는 랜덤 행렬 곱에 대해 완화된 조건 하에서 지수 안정성을 확립한다: 초수리아프로프 드리프트 조건과 행렬 함수의 제어된 성장 조건. 선형 스토하스틱 근사와 마르코프 노이즈를 가진 TD 학습에 대해 유한 시간 내의 p차 모멘트 경계를 유도하며, 이는 이전 결과를 유계가 아닌 상태 공간과 유계가 아닌 행렬 함수로 확장한다.

ABSTRACT

This paper studies the exponential stability of random matrix products driven by a general (possibly unbounded) state space Markov chain. It is a cornerstone in the analysis of stochastic algorithms in machine learning (e.g. for parameter tracking in online learning or reinforcement learning). The existing results impose strong conditions such as uniform boundedness of the matrix-valued functions and uniform ergodicity of the Markov chains. Our main contribution is an exponential stability result for the $p$-th moment of random matrix product, provided that (i) the underlying Markov chain satisfies a super-Lyapunov drift condition, (ii) the growth of the matrix-valued functions is controlled by an appropriately defined function (related to the drift condition). Using this result, we give finite-time $p$-th moment bounds for constant and decreasing stepsize linear stochastic approximation schemes with Markovian noise on general state space. We illustrate these findings for linear value-function estimation in reinforcement learning. We provide finite-time $p$-th moment bound for various members of temporal difference (TD) family of algorithms.

연구 동기 및 목표

  • 일반적인 마르코프 노이즈 하에서 선형 스토하스틱 근사(LSA)와 시간 차분(TD) 학습에 대해 유한 시간 내의 모멘트 경계가 부족한 문제를 해결한다.
  • 이전 연구들이 균일 기하적 에르고딕성(UGE)과 행렬 함수의 균일 유계성 요구 조건을 필요로 하는 한계를 극복한다.
  • LSA와 TD 학습에서 유계가 아닌 상태 공간과 잠재적으로 유계가 아닌 행렬 값 함수로 안정성 분석을 확장한다.
  • 약한 에르고딕성 조건 하에서 랜덤 행렬 곱의 p차 모멘트 안정성 분석을 위한 일반적 프레임워크를 제공한다.
  • 실제로 유계가 아닌 설정에서 강화 학습 알고리즘의 유한 시간 성능 보장을 가능하게 한다.

제안 방법

  • 초수리아프로프 드리프트 조건에서 유도된 라플라스 함수 V를 사용한 (V,q)-지수 안정성 조건을 도입한다.
  • 드리프트 조건과 연결된 함수 W₁과 W₂를 사용하여 행렬 성장 경계를 정의하며, 이는 무한대가 될 수 있는 행렬을 허용한다.
  • 시간 동질 마르코프 커널과 기하 모멘트 생성 함수를 결합한 새로운 라플라스 함수 구성 기법을 사용한다.
  • 작은 집합에 대한 하향 집합 기법과 커플링 방법을 통해 랜덤 행렬 곱의 드리프트 조건을 수립한다.
  • 안정성 결과를 적용하여 LSA의 오차를 가중치가 부여된 행렬 곱과 초기 오차의 합으로 분해하고, 모멘트 경계를 도출한다.
  • 시간-수평 커플링 기법을 사용하여 행렬 곱의 尾행동을 제어하고, 지수 모멘트 부등식을 통해 모멘트 경계를 유도한다.

실험 결과

연구 질문

  • RQ1균일 기하적 에르고딕성을 요구하지 않고 초수리아프로프 드리프트 조건 하에서 랜덤 행렬 곱의 지수 안정성을 확립할 수 있는가?
  • RQ2행렬 함수가 무한대일 수 있는 경우, 일반적인 마르코프 노이즈 하에서 선형 스토하스틱 근사에 대해 유한 시간 내의 p차 모멘트 경계를 어떻게 도출할 수 있는가?
  • RQ3일반적인(유계가 아닐 수 있는) 상태 공간 마르코프 체인에서 행렬 함수의 성장 조건은 어떤 것이며, 이는 모멘트 안정성을 보장하는가?
  • RQ4제안된 프레임워크를 시간 차분 학습 알고리즘에 적용하여 유한 시간 성능 보장을 도출할 수 있는가?
  • RQ5라플라스 함수와 드리프트 조건은 고차 모멘트에서 행렬 곱의 성장 제어에 어떤 역할을 하는가?

주요 결과

  • 논문은 초수리아프로프 드리프트 조건과 제어된 행렬 성장 조건 하에서, 행렬 함수가 무한대일 수 있는 경우에도 (V,q)-지수 안정성을 확립한다.
  • 일반 상태 공간에서 일정 또는 감소하는 스텝 사이즈 선형 스토하스틱 근사 방법에 대해 유한 시간 내의 p차 모멘트 경계를 도출한다.
  • 이전 연구보다 더 약한 조건 하에서 유효하다: 균일 기하적 에르고딕성 또는 A(z)와 b(z)의 유계성이 필요로 하지 않는다.
  • TD 학습에 대해, TD(0), TD(λ), 함수 근사가 포함된 TD(λ) 등 TD 가족의 다양한 구성원에 대해 유한 시간 내의 p차 모멘트 경계를 도출한다.
  • 작은 집합 조건을 증명하기 위해 기하 모멘트 생성 함수와 하향 집합 기법을 결합한 새로운 라플라스 함수 구성 기법을 도입한다.
  • 핵심 기술적 혁신은 시간-수평 커플링과 정밀하게 조정된 매개변수 β₀를 사용하여 모멘트 경계에서의 지수 감쇠율을 제어하는 것이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.