Skip to main content
QUICK REVIEW

[논문 리뷰] Convergence Rates of Stochastic Gradient Descent under Infinite Noise Variance

Hongjian Wang, Mert Gürbüzbalaban|arXiv (Cornell University)|2021. 02. 20.
Stochastic Gradient Optimization Techniques참고 문헌 40인용 수 10
한 줄 요약

이 논문은 분산이 무한대인 상태에 의존하는 무거운 尾 꼬리 노이즈를 가진 확률적 경사 하강법(SGD)의 수렴 속도를 설정한다. 여기서는 헤시안에 대한 새로운 조건인 'p-양의 (반)정규성'을 도입하며, 이 조건은 $L^p$ 수렴과 함께 다변수 $\alpha$-스테이블 분포로의 약한 수렴을 보여주는 일반화된 중심극한정리까지 도출한다. 이는 알고리즘 또는 손실 함수를 수정하지 않고도 강건한 분석이 가능하게 한다.

ABSTRACT

Recent studies have provided both empirical and theoretical evidence illustrating that heavy tails can emerge in stochastic gradient descent (SGD) in various scenarios. Such heavy tails potentially result in iterates with diverging variance, which hinders the use of conventional convergence analysis techniques that rely on the existence of the second-order moments. In this paper, we provide convergence guarantees for SGD under a state-dependent and heavy-tailed noise with a potentially infinite variance, for a class of strongly convex objectives. In the case where the $p$-th moment of the noise exists for some $p\in [1,2)$, we first identify a condition on the Hessian, coined '$p$-positive (semi-)definiteness', that leads to an interesting interpolation between positive semi-definite matrices ($p=2$) and diagonally dominant matrices with non-negative diagonal entries ($p=1$). Under this condition, we then provide a convergence rate for the distance to the global optimum in $L^p$. Furthermore, we provide a generalized central limit theorem, which shows that the properly scaled Polyak-Ruppert averaging converges weakly to a multivariate $α$-stable random vector. Our results indicate that even under heavy-tailed noise with infinite variance, SGD can converge to the global optimum without necessitating any modification neither to the loss function or to the algorithm itself, as typically required in robust statistics. We demonstrate the implications of our results to applications such as linear regression and generalized linear models subject to heavy-tailed data.

연구 동기 및 목표

  • 현대 머신러닝에서 흔한 분산이 무한대인 경향이 있는 경사 노이즈 상황에서 SGD의 수렴 보장을 부족한 문제를 해결하기 위해.
  • 분산이 존재하지 않는 $p$-번째 모멘트가 $p \in [1,2)$ 범위에서 존재하는 상태에 의존하는 중성 꼬리 노이즈 하에서 SGD를 분석하기 위해.
  • 분산이 무한대임에도 불구하고 강凸성 목표 함수에 대해 $L^p$ 수렴 속도를 확립하기 위해.
  • 중성 꼬리 노이즈 하에서 Polyak-Ruppert 평균화의 일반화된 중심극한정리를 유도하기 위해.
  • 선형 회귀 및 중성 꼬리 데이터를 가진 일반선형 모델에 적용 가능성을 보여주기 위해.

제안 방법

  • 헤시안의 'p-양의 (반)정규성' 개념을 도입하여, $p=2$일 때 양의 준정규성과 $p=1$일 때 대각 우세성 사이를 보간한다.
  • 분산이 무한대이지만 $p \in [1,2)$ 범위에서 $p$-번째 모멘트가 유한한 마팅게일 차분 노이즈 시퀀스 하에서 SGD의 동역학을 분석한다.
  • p-양의 정규성 조건을 사용하여 전역 최적해와의 거리에 대한 $L^p$-노름 수렴을 확립한다.
  • 정규화된 변화 이론과 $\alpha$-스테이블 분포의 도달 영역 결과를 활용하여 일반화된 중심극한정리를 도출한다.
  • Polyak-Ruppert 평균화 방법을 활용하고, $p$-양의 정규성 조건 하에서 다변수 $\alpha$-스테이블 분포로의 약한 수렴을 보여준다.
  • 결과를 선형 회귀 및 일반선형 모델에 적용하여, 손실 함수나 알고리즘을 수정하지 않더라도 중성 꼬리 데이터에 대해 강건함을 보여준다.

실험 결과

연구 질문

  • RQ1경사 노이즈의 분산이 무한대일 경우 SGD가 전역 최적해로 수렴할 수 있는가?
  • RQ2중성 꼬리 노이즈 하에서 $p \in [1,2)$ 조건을 만족할 때 $L^p$ 수렴을 보장하는 헤시안의 구조적 조건은 무엇인가?
  • RQ3분산이 무한대인 노이즈 하에서 Polyak-Ruppert 평균화가 약한 수렴을 통해 안정 분포로 수렴하는가?
  • RQ4노이즈의 尾 꼬리 지수 $\alpha$는 SGD의 수렴 행동과 어떻게 관련되는가?
  • RQ5중성 꼬리 노이즈 하에서 기존의 추론 방법(예: 신뢰구간)을 신뢰성 있게 적용할 수 있는가?

주요 결과

  • 'p-양의 (반)정규성' 조건은 분산이 무한대인 노이즈 하에서 SGD의 $L^p$ 수렴을 위한 충분조건임을 제안한다.
  • $p \in [1,2)$ 범위에서, $p$-양의 정규성 조건 하에서 전역 최적해와의 거리가 $L^p$-노름에서 수렴한다.
  • Polyak-Ruppert 평균화가 다변수 $\alpha$-스테이블 분포로 $\alpha = p$ 인 약한 수렴을 보이며, 일반화된 중심극한정리를 확립한다.
  • 이러한 수렴 결과는 두 번째 모멘트가 존재하지 않더라도 손실 함수나 알고리즘을 수정하지 않고도 성립한다.
  • 이 프레임워크는 중성 꼬리 데이터를 가진 선형 회귀 및 일반선형 모델에 적용 가능하며, 통계적 타당성을 유지한다.
  • 정규화된 변화 꼬리 및 $\alpha$-스테이블 분포로의 도달 영역 이론적 분석을 통해 결과의 타당성을 검증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.