Skip to main content
QUICK REVIEW

[논문 리뷰] Convergence of stochastic gradient descent schemes for Lojasiewicz-landscapes

Steffen Dereich, Sebastian Kassing|arXiv (Cornell University)|2021. 02. 16.
Stochastic Gradient Optimization Techniques참고 문헌 77인용 수 10
한 줄 요약

이 논문은 데스틸레프 불등식을 만족하는 목적 함수에 대해, 호일더 연속 기울기와 $L^p$-마링갈 소음이라는 약한 조건 하에서 확률적 경사 하강법(SGD) 및 모멘타움 SGD의 거의 확실 수렴을 확립한다. 핵심 결과는 목적 함수가 해석적일 경우—예를 들어 해석적 활성화를 가진 신경망에서처럼—입력 및 출력 데이터가 컴act하게 지지될 경우, SGD가 유계성 사건에서 거의 확실하게 수렴한다는 것이다.

ABSTRACT

In this article, we consider convergence of stochastic gradient descent schemes (SGD), including momentum stochastic gradient descent (MSGD), under weak assumptions on the underlying landscape. More explicitly, we show that on the event that the SGD stays bounded we have convergence of the SGD if there is only a countable number of critical points or if the objective function satisfies Lojasiewicz-inequalities around all critical levels as all analytic functions do. In particular, we show that for neural networks with analytic activation function such as softplus, sigmoid and the hyperbolic tangent, SGD converges on the event of staying bounded, if the random variables modelling the signal and response in the training are compactly supported.

연구 동기 및 목표

  • 목적 함수에 대한 약한 정규성 가정 하에서 확률적 경사 하강법(SGD) 및 모멘타움 SGD의 거의 확실 수렴을 확립하기 위해.
  • 기본 SGD를 초월하여 모멘타움을 가진 다양한 확률적 근사 방법에 대한 수렴 결과를 보다 광범위한 클래스로 확장하기 위해.
  • 신경망에 해석적 활성화 함수(예: 시그모이드, ReLU, 소프트플러스)를 사용할 경우, 훈련 데이터가 컴 pact하게 지지되고 반복값들이 유계일 경우 SGD가 거의 확실하게 수렴함을 보여주기 위해.
  • 딥 러닝에서 해석적 활성화를 사용할 경우 발생하는 목적 함수—예를 들어, 해석적 함수—가 국소적으로 데스틸레프 불등식을 만족함을 보여주어 수렴 분석이 가능하게 하기 위해.
  • 해석 함수를 초월하여 수치가 가산인 임계점들을 가진 함수들에도 적용 가능한, 데스틸레프 유형 불등식에 기반한 일반적 수렴 프레임워크를 제공하기 위해.

제안 방법

  • 업데이트 규칙이 $ X_n = X_{n-1} + \theta_n (\Gamma_n + D_n) $인 일반적인 확률적 근사 프레임워크를 사용하며, $ \Gamma_n $는 드리프트(예: $ -\nabla f(X_{n-1}) $)이고 $ D_n $는 $ L^p $-마링갈 차분 수열이다.
  • 목적 함수 $ f $ 에 대해 일반화된 데스틸레프 조건을 도입하여, 임계점 근처에서 기울기가 충분히 빠르게 증가하도록 보장한다.
  • 국소 해석성과 도함수에 대한 균일한 추정을 기반으로 한 새로운 증명 기법을 적용하여, 해석 함수가 국소적으로 데스틸레프 불등식을 만족함을 보여준다.
  • 아핀 변환과의 복합 함수로 구성된 해석 함수(예: ReLU, 시그모이드, 소프트플러스)는 해석 함수임을 이용하여, 네트워크 출력이 매개변수에 대해 해석적임을 보인다.
  • 활성화 함수 $ \rho $, 손실 함수 $ \mathcal{L} $, 입력/출력 분포가 모두 해석적이고 컴 pact하게 지지될 경우, 기대 손실 함수 $ f(\Theta) = \mathbb{E}[\mathcal{L}(\mathcal{R}(\Theta,X),Y)] $ 가 해석적임을 보인다.
  • 데스틸레프 불등식을 적용하여 기울기가 0으로 수렴하고, 유계성 조건 하에서 매개변수 수열의 수렴을 유도한다.

실험 결과

연구 질문

  • RQ1목적 함수가 강력한 볼록성이 없을 경우, 확률적 경사 하강법이 거의 확실하게 수렴하는 조건은 무엇인가?
  • RQ2모멘타움 SGD는 표준 SGD와 동일한 수렴 프레임워크로 분석될 수 있으며, 어떤 조건에서 수렴하는가?
  • RQ3해석적 활성화 함수를 가진 신경망이 데스틸레프 불등식을 만족하는가? 이는 수렴 보장을 가능하게 하는가?
  • RQ4기대 손실의 해석성과 따라서 수렴 보장을 보장하기 위해 필요한 데이터 분포에 대한 가정(예: 컴 pact 지지)은 무엇인가?
  • RQ5임계점의 연속체 존재가 수렴에 영향을 미치며, 이러한 경우에도 데스틸레프 불등식이 여전히 수렴을 보장할 수 있는가?

주요 결과

  • $ C^1 $ 목적 함수에 대해 호일더 연속 기울기와 $ L^p $-마링갈 소음($ p \in (1,2] $) 조건 하에서, $ \nabla f(X_n) \to 0 $ 거의 확실하게 수렴한다.
  • 임계점 집합이 가산일 경우이고 반복값들이 유계일 경우, $ X_n $ 는 거의 확실하게 수렴한다.
  • 데스틸레프 불등식을 만족하는 목적 함수(예: 해석 함수)에 대해, SGD는 수열 $ (X_n) $ 이 유계일 경우 거의 확실하게 수렴한다.
  • 활성화 함수 $ \rho $, 손실 함수 $ \mathcal{L} $, 입력/출력 분포가 모두 해석적이고 컴 pact하게 지지될 경우, 기대 손실 함수 $ f(\Theta) = \mathbb{E}[\mathcal{L}(\mathcal{R}(\Theta,X),Y)] $ 는 해석적이다.
  • 해석적 활성화(예: 시그모이드, 소프트플러스, 탄젠트 하이퍼볼릭)를 가진 신경망과 컴 pact하게 지지된 데이터를 사용할 경우, 목적 함수는 국소적으로 데스틸레프 불등식을 만족하며, 이는 수렴 보장을 가능하게 한다.
  • 이전 연구들(예: Tadic, 2015)과는 다름을 바탕으로, 리아프노프 함수나 미분방정식 근사가 아닌 해석성과 도함수 추정에 기반한 새로운 수렴 증명 프레임워크를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.