Skip to main content
QUICK REVIEW

[논문 리뷰] Scaling Limit of Neural Networks with the Xavier Initialization and Convergence to a Global Minimum

Justin Sirignano, Konstantinos Spiliopoulos|arXiv (Cornell University)|2019. 07. 09.
Stochastic Gradient Optimization Techniques참고 문헌 16인용 수 7
한 줄 요약

이 논문은 단일층 신경망이 Xavier 초기화($1/\sqrt{N}$ 스케일링)를 사용할 때, 은닉 유닛 수 $N$과 학습 스텝 수 $TN$이 커짐에 따라 분포 수렴하여 랜덤 평범한 미분방정식(SDE)에 수렴함을 입증한다. 유한한 $N$에서 비볼록 최적화 지형이 존재하더라도, 한계 시스템은 볼록한 2차 목표 함수를 최소화하고, 미약한 조건 하에 영학습 손실을 가진 전역 최소점으로 수렴한다.

ABSTRACT

We analyze single-layer neural networks with the Xavier initialization in the asymptotic regime of large numbers of hidden units and large numbers of stochastic gradient descent training steps. The evolution of the neural network during training can be viewed as a stochastic system and, using techniques from stochastic analysis, we prove the neural network converges in distribution to a random ODE with a Gaussian distribution. The limit is completely different than in the typical mean-field results for neural networks due to the $\frac{1}{\sqrt{N}}$ normalization factor in the Xavier initialization (versus the $\frac{1}{N}$ factor in the typical mean-field framework). Although the pre-limit problem of optimizing a neural network is non-convex (and therefore the neural network may converge to a local minimum), the limit equation minimizes a (quadratic) convex objective function and therefore converges to a global minimum. Furthermore, under reasonable assumptions, the matrix in the limiting quadratic objective function is positive definite and thus the neural network (in the limit) will converge to a global minimum with zero loss on the training set.

연구 동기 및 목표

  • 스토케스틱 경사하강법으로 학습하는 단일층 신경망의 스케일링 극한을 엄밀히 분석하기 위해.
  • 유한한 $N$에서의 모델에서 매개변수 간 상관관계가 존재함에도 불구하고, 신경망 출력이 $N \to \infty$로 갈 때 수렴하는지 여부라는 열린 문제를 해결하기 위해.
  • 유한-$N$ 최적화가 비볼록임에도 불구하고, 한계 시스템이 볼록한 2차 목표 함수를 최소화함을 보여주기 위해.
  • 한계 시스템이 전역 최소점으로 수렴하고 영학습 손실을 가질 수 있는 조건을 설정하기 위해.
  • 딥러닝에서 Xavier 초기화의 경험적 성공을 이론적으로 뒷받침하기 위해, 이를 큰-$N$ 극한에서 전역 최적해로 수렴하는 것과 연결지어 이론적 기반을 마련하기 위해.

제안 방법

  • empirical measure $\nu_k^N$와 네트워크 출력 $g_k^N$의 동시 진화를 분석하기 위해 확률적 분석과 약한 수렴 기법을 사용한다.
  • 연속 시간에서의 시스템을 분석하기 위해 스케일된 과정 $h_t^N = g_{\lfloor Nt \rfloor}^N$과 $\mu_t^N = \nu_{\lfloor Nt \rfloor}^N$을 도입한다.
  • $(\mu_t^N, h_t^N)$의 분포 수렴을 증명하여, 가우시안 과정에 의해 구동되는 랜덤 ODE의 해로 수렴함을 보인다.
  • Prokhorov의 정리와 스토코로호드 공간 $D_E([0,T])$에서의 상대적 컴acts를 적용하여, 유한차원 분포의 약한 수렴을 확보한다.
  • 한계 목표 함수를 행렬 $A$를 사용한 이차형식으로 특성화하며, 미약한 가정 하에 $A$가 양의 정부호임을 보인다.
  • 한계 시스템이 볼록한 2차 목표 함수를 최소화함을 이용하여, 영손실을 가진 전역 최소점으로 수렴함을 증명한다.

실험 결과

연구 질문

  • RQ1유한한 $N$에서 매개변수 간 상관관계가 존재함에도 불구하고, 신경망 출력 $g^N(x)$는 $N \to \infty$로 갈 때 수렴하는가?
  • RQ2Xavier 초기화 하에 큰-$N$ 영역에서의 스 tochastic gradient descent 동역학의 한계 행동은 무엇인가?
  • RQ3$1/\sqrt{N}$ 스케일링을 사용하는 이 한계 시스템은 $1/N$ 스케일링을 사용하는 평균장 모델과 어떻게 다를까?
  • RQ4유한-$N$ 문제의 비볼록성에도 불구하고, 한계 시스템이 볼록한 목표 함수를 최소화함을 보일 수 있는가?
  • RQ5한계 2차 목표 함수가 양의 정부호가 되는 조건은 무엇이며, 이는 영학습 손실을 가진 전역 최소점으로의 수렴을 보장하는가?

주요 결과

  • 신경망 출력 $g_k^N(x)$는 $N \to \infty$일 때, 초기 분포 $\mu_0$와 데이터 분포 $\pi$에 따라 결정되는 랜덤 ODE의 해로 분포 수렴한다.
  • 한계 시스템은 볼록한 2차 목표 함수를 최소화하므로, 유한-$N$ 문제의 비볼록성에도 불구하고 전역 최소점으로 수렴함을 의미한다.
  • 한계 2차 목표 함수의 행렬 $A$는 선형 독립성 등의 미약한 가정 하에 양의 정부호이다.
  • 행렬 $A$가 양의 정부호일 경우, 목표 함수의 볼록성과 엄격한 최소화 성질 덕분에 한계 시스템은 거의 확실하게 영학습 손실을 달성한다.
  • 전역 최소점으로의 수렴은 극한에서 보장되며, 이는 Xavier 초기화가 딥러닝에서 성공하는 데 이론적 근거를 제공한다.
  • $1/\sqrt{N}$ 스케일링은 일반적인 평균장 모델에서의 $1/N$ 스케일링과 근본적으로 다른 한계를 유도하며, 비퇴화된 확률적 ODE 한계를 초래한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.