Skip to main content
QUICK REVIEW

[논문 리뷰] On the Heavy-Tailed Theory of Stochastic Gradient Descent for Deep Neural Networks

Umut Şimşekli, Mert Gürbüzbalaban|arXiv (Cornell University)|2019. 11. 29.
Stochastic Gradient Optimization Techniques참고 문헌 90인용 수 22
한 줄 요약

이 논문은 딥러닝에서 경사하강법의 확률적 노이즈(GN)가 일반적으로 가우시안이라고 가정하는 데 도전하며, 대신 GN이 무거운 尾를 가진 $\alpha$-안정 분포를 따른다고 제안한다. SGD를 레비-운동에 의해 구동되는 연속시간 확률미분방정식(SDE)의 이산화로 모델링함으로써, 더 무거운 尾(낮은 $\alpha$)는 수렴 속도를 느리게 한다고 보여주며, 메타안정성 이론을 통해 SGD가 넓은 최소값을 선호하는 이유를 설명한다. 이는 다양한 아키텍처, 데이터셋, 손실 함수에서 경험적으로 검증되었다.

ABSTRACT

The gradient noise (GN) in the stochastic gradient descent (SGD) algorithm is often considered to be Gaussian in the large data regime by assuming that the \emph{classical} central limit theorem (CLT) kicks in. This assumption is often made for mathematical convenience, since it enables SGD to be analyzed as a stochastic differential equation (SDE) driven by a Brownian motion. We argue that the Gaussianity assumption might fail to hold in deep learning settings and hence render the Brownian motion-based analyses inappropriate. Inspired by non-Gaussian natural phenomena, we consider the GN in a more general context and invoke the \emph{generalized} CLT, which suggests that the GN converges to a \emph{heavy-tailed} $α$-stable random vector, where \emph{tail-index} $α$ determines the heavy-tailedness of the distribution. Accordingly, we propose to analyze SGD as a discretization of an SDE driven by a Lévy motion. Such SDEs can incur `jumps', which force the SDE and its discretization \emph{transition} from narrow minima to wider minima, as proven by existing metastability theory and the extensions that we proved recently. In this study, under the $α$-stable GN assumption, we further establish an explicit connection between the convergence rate of SGD to a local minimum and the tail-index $α$. To validate the $α$-stable assumption, we conduct experiments on common deep learning scenarios and show that in all settings, the GN is highly non-Gaussian and admits heavy-tails. We investigate the tail behavior in varying network architectures and sizes, loss functions, and datasets. Our results open up a different perspective and shed more light on the belief that SGD prefers wide minima.

연구 동기 및 목표

  • SGD에서 경사하강법의 노이즈(GN)가 딥 네트워크에서 일반적으로 가우시안이라고 가정하는 데 도전하기 위해.
  • 일반화된 중심극한정리에 따라 GN이 가우시안 대신 $\alpha$-안정 분포로 수렴하는 새로운 이론적 프레임워크를 제안하기 위해.
  • SGD를 레비-운동에 의해 구동되는 SDE의 이산화로 모델링하여, 흩어짐이 아닌 점프 동역학을 허용함으로써 좁은 최소값에서의 탈출을 가능하게 하기 위해.
  • GN의 尾 지수 $\alpha$ 와 SGD의 국소 최소값 수렴 속도 사이의 정량적 연결 고리를 설정하기 위해.
  • 다양한 네트워크 아키텍처, 손실 함수, 데이터셋, 학습 제도에서 GN의 중성적 무거운 尾 성질을 경험적으로 검증하기 위해.

제안 방법

  • 일반화된 중심극한정리에 기반한 이론적 분석으로, 분산이 무한대일 경우 GN이 $\alpha$-안정 분포로 수렴함을 정당화한다.
  • SGD를 레비 운동에 의해 구동되는 연속시간 SDE의 이산시간 근사로 모델링하여, 확산 브라운 운동 대신 점프 동역학을 허용한다.
  • 메타안정성 이론을 적용하여, 큰 점프 덕분에 레비-운동에 의해 구동되는 SDE가 좁은 최소값에서 더 넓은 최소값으로 전이될 수 있음을 보여준다.
  • $\alpha$-안정 GN 가정 하에 수렴 속도 분석을 유도하여, $\alpha$가 감소할수록(무거운 尾일수록) 수렴 속도가 느려짐을 보여준다.
  • 경험적 경사하강 노이즈 샘플에서 유도된 $\alpha$의 추정치를 산출하기 위해 힐 추정기(Hill estimator)를 사용한다.
  • 실험적으로 네트워크 크기, 미니배치 크기, 학습 단계를 체계적으로 변화시켜 아키텍처와 데이터셋 전반에서 尾 행동을 평가한다.

실험 결과

연구 질문

  • RQ1딥 네트워크에서 SGD의 경사하강 노이즈가 중성적 무거운 尾 행동을 보이며, 전통적인 가우시안 가정과 모순되는가?
  • RQ2경사하강 노이즈 분포의 尾 지수 $\alpha$ 가 SGD의 수렴 속도에 어떤 영향을 미치는가?
  • RQ3SGD를 레비-운동에 의해 구동되는 SDE의 이산화로 모델링하면, 딥러닝에서 좁은 최소값을 선호하는 경향을 설명할 수 있는가?
  • RQ4GN의 중성적 무거운 尾 성질이 다양한 네트워크 아키텍처, 손실 함수, 데이터셋에서 얼마나 강인한가?
  • RQ5tail 지수 $\alpha$ 와 훈련된 모델의 일반화 성능 사이에 측정 가능한 연결 고리가 존재하는가?

주요 결과

  • 경험적 결과는 모든 테스트된 딥러닝 설정에서 경사하강 노이즈가 매우 비가우시안이며 중성적 무거운 尾 행동을 보임을 확인하였으며, 尾 지수 $\alpha$ 는 항상 2 이하로 나타났다.
  • 네트워크 크기, 아키텍처, 데이터셋의 변화에 관계없이 尾 지수 $\alpha$ 가 강인함을 확인하여 GN의 보편적인 중성적 무거운 尾 성질을 시사한다.
  • 작은 미니배치 크기는 더 무거운 尾(낮은 $\alpha$)를 초래함으로써, 확률적 성격과 중성적 무거운 노이즈 사이의 직접적인 연결 고리를 시사한다.
  • SGD의 수렴 속도가 $\alpha$ 에 명시적으로 의존하며, 무거운 尾일수록 수렴 속도가 느려짐을 보여주었으며, 이는 이론적 분석의 예측과 일치한다.
  • 이론적 및 경험적 결과는 레비-운동에 의해 구동되는 동역학이 좁은 최소값에서 벗어나 더 넓고 일반화 성능이 뛰어난 해로 수렴하는 데 기여함을 지지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.