Skip to main content
QUICK REVIEW

[논문 리뷰] Analysis of the Gradient Descent Algorithm for a Deep Neural Network Model with Skip-connections

E Weinan, Chao Ma|arXiv (Cornell University)|2019. 04. 10.
Stochastic Gradient Optimization Techniques참고 문헌 34인용 수 18
한 줄 요약

이 논문은 스킵 커넥션을 갖는 딥 리소지드 네트워크에서 경사하강법(GD)을 분석하며, 과도한 파rameter화와 적절한 초기화 조건 하에서 GD가 지수적으로 빠르게 전역 최소값으로 수렴함을 증명한다. 또한 GD 경로가 무작위 특징 모델과 균일하게 가까이 유지됨을 보여, 목표 함수가 해당 복원핵 힐베르트 공간(RKHS)에 속해 있더라도, 무작위 특징 모델의 것 이상의 의미 있는 암묵적 정규화 효과는 없음을 시사한다.

ABSTRACT

The behavior of the gradient descent (GD) algorithm is analyzed for a deep neural network model with skip-connections. It is proved that in the over-parametrized regime, for a suitable initialization, with high probability GD can find a global minimum exponentially fast. Generalization error estimates along the GD path are also established. As a consequence, it is shown that when the target function is in the reproducing kernel Hilbert space (RKHS) with a kernel defined by the initialization, there exist generalizable early-stopping solutions along the GD path. In addition, it is also shown that the GD path is uniformly close to the functions given by the related random feature model. Consequently, in this "implicit regularization" setting, the deep neural network model deteriorates to a random feature model. Our results hold for neural networks of any width larger than the input dimension.

연구 동기 및 목표

  • 스킵 커넥션을 갖는 딥 네트워크에서 경사하강법(GD)이 전역 최소값을 찾는 조건을 이해하는 것.
  • 특히 과도한 파arameter화 영역에서 암묵적 정규화 없이도 GD가 일반화 가능한 해를 찾을 수 있는지 조사하는 것.
  • 딥 리소지드 네트워크에서 GD 역학이 무작위 특징 모델로 근사될 수 있는지, 이는 암묵적 정규화 효과를 의미하는지 확인하는 것.
  • 초기화로 정의된 복원핵 힐베르트 공간(RKHS)에 속하는 목표 함수에 대해 GD 경로를 따라 일반화 오차 추정치를 수립하는 것.
  • 딥 네트워크의 GD 경로와 관련된 무작위 특징 모델 간의 관계를 분석하며, 특히 균일한 근사성과 수렴 행동 측면에서의 특성 파악

제안 방법

  • 각 층에서 잔차 연결을 추가하는 스킵 커넥션을 갖는 딥 리소지드 네트워크 모델을 분석하며, $\bm{h}^{(l+1)} = \bm{h}^{(l)} + U^{(l)}\sigma(V^{(l)}\bm{h}^{(l)})$ 로 기술된다.
  • 네트워크의 너비가 입력 차원을 초과하는 과도한 파arameter화 영역을 사용하여, 초기화 근처의 국소 분석이 가능하도록 한다.
  • 활성화 함수 내외의 파라미터 간 시간 스케일 분리 기법을 적용하며, GD 업데이트 중 $V^{(l)}$ 를 약간의 고정된 값으로 간주한다.
  • 초기화 시 고정된 특징을 갖는 관련 무작위 특징 모델의 GD 경로에 의해 딥 네트워크의 GD 경로를 균일하게 근사함을 확립한다.
  • 신경 탄성 커널과 그라姆 행렬의 비특이성에 기반한 국소 분석 프레임워크를 도입하여 지수적 수렴을 증명한다.
  • 집중 불등식과 고확률 경계를 활용하여, 초기화 시 그라姆 행렬의 최소 고유값이 높은 확률로 0에서 멀리 떨어져 있음을 보여준다.

실험 결과

연구 질문

  • RQ1스킵 커넥션을 갖는 딥 리소지드 네트워크에서 경사하강법이 전역 최소값으로 수렴하는 조건은 무엇인가?
  • RQ2경사하강법이 암묵적 정규화 없이 일반화 가능한 해를 찾을 수 있으며, 그 조건은 목표 함수에 대해 어떤가?
  • RQ3딥 리소지드 네트워크의 GD 경로가 초기화 시 고정된 특징을 갖는 무작위 특징 모델의 경로와 얼마나 가까이 근사되는가?
  • RQ4딥 네트워크는 무작위 특징 모델의 것 이상의 비트리비얼한 암묵적 정규화 효과를 보이는가?
  • RQ5이러한 과도한 파arameter화 설정 하에서 경사하강법의 수렴 속도는 얼마이며, 네트워크의 깊이와 너비에 따라 어떻게 달라지는가?

주요 결과

  • 과도한 파arameter화 영역에서, 고확률로 경사하강법이 경험 위험의 전역 최소값으로 지수적으로 빠르게 수렴한다.
  • GD 경로를 따라 일반화 오차 추정치를 수립하였으며, 목표 함수가 초기화 커널로 정의된 RKHS에 속할 경우, 조기 정지 기법을 통해 일반화 가능한 해를 도출할 수 있음을 보여준다.
  • 딥 리소지드 네트워크의 GD 경로는 해당 무작위 특징 모델의 GD 경로와 균일하게 가까이 유지되며, 이는 암묵적 정규화 효과가 무작위 특징 모델과 동일함을 시사한다.
  • 수렴 속도는 지수적이며, $\eta L \lambda_n$ 비례하는 감쇠 인자로 표현되며, 여기서 $\eta$ 는 학습률, $L$ 은 깊이, $\lambda_n$ 은 그라姆 행렬의 최소 고유값이다.
  • 이 결과는 네트워크의 너비가 입력 차원을 초과하는 한, 깊이나 훈련 세트 크기에 따라 너비가 증가할 필요 없이 성립한다.
  • 초기화 시 그라姆 행렬의 최소 고유값이 0에서 멀리 떨어져 있음을 보장할 경우, 고확률로 분석 결과가 성립한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.