Skip to main content
QUICK REVIEW

[논문 리뷰] Provable Benefit of Orthogonal Initialization in Optimizing Deep Linear Networks

Wei Hu, Lechao Xiao|arXiv (Cornell University)|2020. 01. 16.
Speech Recognition and Synthesis참고 문헌 30인용 수 60
한 줄 요약

이 논문은 직교 초기화가 심층 선형 네트워크에서 gradient descent의 수렴 속도를 높이고, 너비 요구사항이 깊이에 독립적임을 보이며, 깊이에 따라 너비가 증가해야 하는 가우시안 초기화와 다름을 증명한다.

ABSTRACT

The selection of initial parameter values for gradient-based optimization of deep neural networks is one of the most impactful hyperparameter choices in deep learning systems, affecting both convergence times and model performance. Yet despite significant empirical and theoretical analysis, relatively little has been proved about the concrete effects of different initialization schemes. In this work, we analyze the effect of initialization in deep linear networks, and provide for the first time a rigorous proof that drawing the initial weights from the orthogonal group speeds up convergence relative to the standard Gaussian initialization with iid weights. We show that for deep networks, the width needed for efficient convergence to a global minimum with orthogonal initializations is independent of the depth, whereas the width needed for efficient convergence with Gaussian initializations scales linearly in the depth. Our results demonstrate how the benefits of a good initialization can persist throughout learning, suggesting an explanation for the recent empirical successes found by initializing very deep non-linear networks according to the principle of dynamical isometry.

연구 동기 및 목표

  • 초기화 방식이 심층 선형 네트워크에서 gradient descent 수렴에 미치는 영향을 평가한다.
  • 수렴 속도 측면에서 직교 초기화와 가우시안 초기화 간 엄밀한 비교를 제공한다.
  • 효율적인 학습을 달성하기 위해 서로 다른 초기화 아래에서 너비-깊이의 트레이드오프를 특성화한다.

제안 방법

  • W1,...,WL인 L-레이어 심층 선형 네트워크의 gradient descent 역학을 분석한다.
  • W...W1로 표현되는 f의 제곱 기대값이 ||x||^2가 되도록 특정 스케일링으로 가중치를 직교 초기화한다.
  • 충분한 너비 m에서 직교 초기화를 사용하면 학습 손실이 깊이에 의존하지 않는 속도로 글로벌 최소값으로 수렴한다는 것을 증명한다.
  • 가우시안 초기화와 대조적으로 가우시안 초기화의 경우 효율적인 수렴을 위해 필요한 너비가 깊이에 따라 선형으로 스케일링된다는 것을 보인다.
  • 학습 중 네트워크 출력의 진화를 추적하고 고유값을 경계하기 위해 시간-가변 PSD 행렬 프레임워크를 사용하여.

실험 결과

연구 질문

  • RQ1직교 초기화가 가우시안 초기화에 비해 심층 선형 네트워크에서 gradient descent의 수렴을 가속하는가?
  • RQ2직교 초기화 대 가우시안 초기화 하에서 효율적인 수렴을 보장하기 위해 레이어 너비(은닉 너비 m)가 깊이 L에 대해 어떻게 스케일링되어야 하는가?
  • RQ3초기화가 수렴 속도의 깊이 및 너비에 대한 의존성에 미치는 영향은 무엇인가?
  • RQ4직교 초기화가 깊이에 독립적인 너비 요건으로 효율적인 최적화를 달성할 수 있는가?

주요 결과

  • 직교 초기화는 깊이 L에 의존하지 않는 너비 m으로도 효율적인 수렴을 가능하게 한다.
  • 가우시안 초기화는 효율적인 수렴을 위해 깊이에 따라 선형으로 스케일링되는 너비가 필요하다(깊이가 작지 않은 한).
  • 적절한 학습률 하에서 직교 초기화와 함께 손실-최적해 비율이 반복(iteration)적으로 기하적 감소를 보인다.
  • 가우시안 초기화는 너비가 깊이에 비해 충분하지 않을 때 수렴 시간이 지수적으로 길어질 수 있다.
  • 실험 결과가 이론적 결과를 뒷받침하며, 직교 초기화의 경우 깊이 독립적 너비 요건을, 가우시안 초기화의 경우 깊이에 의존하는 너비를 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.