Skip to main content
QUICK REVIEW

[논문 리뷰] Finite-Time Analysis of Stochastic Gradient Descent under Markov Randomness

Thinh T. Doan, Lam M. Nguyen|arXiv (Cornell University)|2020. 03. 24.
Stochastic Gradient Optimization Techniques참고 문헌 19인용 수 11
한 줄 요약

이 논문은 기울기가 마르코프 과정에서 샘플링될 때 확률적 경사하강법(SGD)의 유한 시간 수렴 분석을 제공하며, 수렴 속도가 i.i.d. 샘플링의 경우와 로그 인자 내에서 유사함을 보여준다. 주요 기여는 유한한 반복값 또는 유한한 기울기 가정 없이 수렴을 확립한 것으로, 로그 인자는 마르코프 체인의 혼합 시간과 연관되어 있다.

ABSTRACT

Motivated by broad applications in reinforcement learning and machine learning, this paper considers the popular stochastic gradient descent (SGD) when the gradients of the underlying objective function are sampled from Markov processes. This Markov sampling leads to the gradient samples being biased and not independent. The existing results for the convergence of SGD under Markov randomness are often established under the assumptions on the boundedness of either the iterates or the gradient samples. Our main focus is to study the finite-time convergence of SGD for different types of objective functions, without requiring these assumptions. We show that SGD converges nearly at the same rate with Markovian gradient samples as with independent gradient samples. The only difference is a logarithmic factor that accounts for the mixing time of the Markov chain.

연구 동기 및 목표

  • 기울기가 마르코프 과정에서 생성될 때 SGD의 유한 시간 수렴을 분석하는 것.
  • 강화학습과 같은 환경에서 흔히 비현실적인 경향이 있는, 유한한 반복값 또는 유한한 기울기 가정을 제거하는 것.
  • i.i.d. 샘플링의 경우와 거의 같은 수렴 속도를 확보하는 SGD의 수렴 속도를 확립하는 것. 혼합 시간으로 인한 로그 인자 외에는 거의 영향을 받지 않는다.
  • 강력한 볼록, 매끄럽고 오차가 있는, 비볼록 매끄러운 함수 등 여러 목적 함수 클래스에 대한 통합 분석을 제공하는 것.

제안 방법

  • 기울기의 마르코프 의존성을 고려하여 매 반복에서 목적 함수 값의 기대 감소를 제한하기 위해 새로운 리아푸노프 유형의 추론을 사용한다.
  • 수렴 속도와 노이즈 평균화 사이의 균형을 맞추기 위해 시간에 따라 변하는 스텝 사이즈 규칙 α_k = α₀ / √k 를 도입한다.
  • 최종 반복값 x_R 를 랜덤 선택하는 규칙을 도입하며, 선택 확률은 2α_k − Lα_k² 비례하게 설정하여 기대 기울기 노름을 유리하게 만든다.
  • 기본 마르코프 체인의 혼합 시간을 활용하여 기울기 샘플의 편향과 분산을 제어하고, 수렴 한계에 로그 인자를 도입한다.
  • 반복에 걸쳐 합산하는 재귀 부등식을 사용하여 기대 제곱 기울기 노름 ∥∇f(x_R)∥²_* 의 경계를 설정한다.
  • ∇f 의 리프시츠 연속성과 기울기 샘플의 유한성 가정을 사용하지만, 유한한 반복값이나 컴acts 가능한 타당 집합에 대한 가정은 회피한다.

실험 결과

연구 질문

  • RQ1기울기가 마르코프 과정에서 샘플링될 때, 종속성과 편향이 존재하더라도 SGD가 근사 최적의 수렴 속도를 달성할 수 있는가?
  • RQ2마르코프 체인의 혼합 시간이 SGD의 수렴 속도에 어떤 영향을 미치는가?
  • RQ3특히 강화학습 환경에서 이러한 가정이 흔히 성립하지 않는 바탕에서, 유한한 반복값이나 유한한 기울기 가정 없이 수렴을 확립할 수 있는가?
  • RQ4비볼록, 매끄럽고 강력한 볼록 목표 함수에 대해 마르코프 샘플링 하에서 SGD의 유한 시간 수렴 속도는 무엇인가?

주요 결과

  • 기대 제곱 기울기 노름 E[∥∇f(x_R)∥²_*] 는 O(1/√T) 에 더해 로그 항으로 제한되며, i.i.d. SGD 의 속도와 로그 인자 내에서 일치한다.
  • 수렴 속도는 i.i.d. 경우와 로그 인자 내에서 유사하며, 이 인자는 기울기를 생성하는 마르코프 체인의 혼합 시간에 따라 달라진다.
  • 유한한 반복값이나 유한한 기울기 가정 없이도 분석이 성립하여, 이러한 가정이 흔히 성립하지 않는 강화학습 환경 등에 적용 가능하다.
  • 비볼록 매끄러운 目적 함수에 대해, 방법은 E[∥∇f(x_R)∥²_*] ≤ O(1/√T) 를 달성하며, 혼합 시간으로 인한 로그 페널티가 있다.
  • 경계에는 최적 집합까지의 초기 거리와 기울기 샘플의 분산과 관련된 항이 포함되며, 이는 스텝 사이즈와 혼합 시간을 통해 제어된다.
  • 최종 반복값 x_R 는 2α_k − Lα_k² 비례하는 비균일 확률로 선택되며, 이는 균일 선택 대비 수렴 보장을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.