Skip to main content
QUICK REVIEW

[논문 리뷰] On the Neural Tangent Kernel of Deep Networks with Orthogonal Initialization

Wei Huang, Weitao Du|arXiv (Cornell University)|2020. 04. 13.
Model Reduction and Neural Networks참고 문헌 36인용 수 13
한 줄 요약

이 논문은 신경장력 커널(NTK)의 관점에서 깊은 신경망에서 직교 초기화의 역할을 조사하며, 무한한 넓이 근사에서 직교적으로 초기화된 네트워크가 가우시안 초기화된 네트워크와 동일한 NTK로 수렴함을 증명한다. 이는 NTK(지루한 학습) 영역에서 학습 속도 향상이 없다는 것을 의미한다. 그러나 실험 결과는 직교 초기화가 NTK 영역 외부에서 특히 큰 학습률이나 깊은 구조에서 학습을 크게 가속화함을 보여주며, 비선형 활성화 함수에서 선형 영역이 달성될 경우에 특히 그렇다.

ABSTRACT

The prevailing thinking is that orthogonal weights are crucial to enforcing dynamical isometry and speeding up training. The increase in learning speed that results from orthogonal initialization in linear networks has been well-proven. However, while the same is believed to also hold for nonlinear networks when the dynamical isometry condition is satisfied, the training dynamics behind this contention have not been thoroughly explored. In this work, we study the dynamics of ultra-wide networks across a range of architectures, including Fully Connected Networks (FCNs) and Convolutional Neural Networks (CNNs) with orthogonal initialization via neural tangent kernel (NTK). Through a series of propositions and lemmas, we prove that two NTKs, one corresponding to Gaussian weights and one to orthogonal weights, are equal when the network width is infinite. Further, during training, the NTK of an orthogonally-initialized infinite-width network should theoretically remain constant. This suggests that the orthogonal initialization cannot speed up training in the NTK (lazy training) regime, contrary to the prevailing thoughts. In order to explore under what circumstances can orthogonality accelerate training, we conduct a thorough empirical investigation outside the NTK regime. We find that when the hyper-parameters are set to achieve a linear regime in nonlinear activation, orthogonal initialization can improve the learning speed with a large learning rate or large depth.

연구 동기 및 목표

  • 직교 초기화가 선형 영역을 초월한 깊은 비선형 네트워크에서 학습 속도를 가속화하는지 조사하는 것.
  • 무한한 넓이 근사에서 직교 초기화 하에 신경장력 커널(NTK)의 행동을 분석하는 것.
  • 완전히 연결된 네트워크와 컨볼루션 네트워크 아키텍처에서 직교적으로 초기화된 네트워크의 NTK 동역학을 가우시안 초기화된 네트워크와 비교하는 것.
  • 특히 NTK 영역 외부에서 직교 초기화가 더 빠른 수렴을 이끌어내는 조건을 규명하는 것.
  • 이론적 NTK 분석과 직교 초기화로 인한 학습 속도 향상의 경험적 관찰을 통합하는 것.

제안 방법

  • 무한한 넓이 근사에서 랜덤 매트릭스 이론과 자유 확률론을 사용하여 직교적으로 초기화된 깊은 네트워크의 NTK에 대한 이론적 분석.
  • 직교적으로 초기화된 네트워크의 NTK가 가우시안 초기화된 네트워크와 동일한 극한으로 수렴하며, 무한한 넓이 영역에서 학습 중에도 NTK가 일정함을 증명.
  • 기존의 NTK 수렴 결과를 완전히 연결된 네트워크(FCNs)와 컨볼루션 신경망(CNNs) 전반에 걸쳐 직교 가중치 초기화로 확장.
  • 프리-액티베이션 노름을 제어하고 헤시안 변동성을 관리하기 위해 스텐의 방법과 교환 가능 쌍 기법을 사용.
  • CIFAR10에서 전체 배치 경사하강법을 사용하여 깊이, 넓이, 학습률, 초기화 유형을 다양하게 설정한 학습 동역학을 경험적으로 평가.
  • 다양한 아키텍처와 하이퍼파라미터 설정에서 직교적으로 초기화된 네트워크와 가우시안 초기화된 네트워크 간의 학습 속도와 일반화 성능을 비교.

실험 결과

연구 질문

  • RQ1깊은 네트워크에서 무한한 넓이 근사에서 직교 초기화가 가우시안 초기화와 다른 NTK를 가지는가?
  • RQ2무한한 넓이를 가진 직교적으로 초기화된 네트워크에서 학습 중 NTK가 일정한가, 가우시안 경우와 동일한가?
  • RQ3NTK 영역에서, 즉 초기화 주변에서 네트워크가 선형적으로 행동할 때, 직교 초기화가 학습을 가속화하는가?
  • RQ4큰 학습률이나 깊이 등의 조건에서 NTK 영역 외부에서 직교 초기화가 학습 속도 향상에 기여하는가?
  • RQ5깊고 넓은 아키텍처에서 직교적으로 초기화된 네트워크의 수렴 속도와 일반화 성능은 가우시안 초기화된 네트워크와 비교해 어떻게 되는가?

주요 결과

  • 무한한 넓이 근사에서 직교적으로 초기화된 깊은 네트워크의 NTK는 가우시안 초기화된 네트워크와 동일한 극한으로 수렴하며, 이는 NTK 영역에서 이론적 이점이 없다는 것을 의미한다.
  • 무한한 넓이 영역에서 직교적으로 초기화된 네트워크의 NTK는 학습 중에도 일정하게 유지되며, 가우시안 초기화된 네트워크에서 관찰된 지루한 학습 행동과 일치한다.
  • 경험적 결과는 학습률이 크거나 네트워크가 매우 깊을 경우, NTK 영역 외부에서 직교 초기화가 가우시안 초기화보다 더 빠른 수렴을 이끌어낸다는 것을 보여준다.
  • 네트워크 깊이가 증가할수록 직교 초기화와 가우시안 초기화 간의 성능 격차가 커지며, 특히 학습 속도와 최종 일반화 정확도 측면에서 뚜렷하다.
  • 비선형 활성화 함수에서 선형 영역을 달성하도록 하이퍼파라미터를 조정할 경우, 직교 초기화가 학습 동역학을 향상시킨다.
  • 큰 학습률과 깊은 네트워크 영역에서, 직교적으로 초기화된 네트워크는 가우시안 초기화된 네트워크보다 더 빠르게 수렴하고 더 높은 테스트 정확도를 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.