Skip to main content
QUICK REVIEW

[논문 리뷰] Initialization of ReLUs for Dynamical Isometry

Rebekka Burkholz, Alina Dubatovka|arXiv (Cornell University)|2018. 06. 17.
Adversarial Robustness in Machine Learning참고 문헌 25인용 수 5
한 줄 요약

이 논문은 ReLU 네트워크를 위한 새로운 초기화 기법을 제안하며, 파라미터 공유를 통해 완벽한 동적 등장성(동적 등장성)을 달성함으로써 기존 히 초기화 방식이 깊은 네트워크에서 신호 다양성을 유지하지 못하는 한계를 극복한다. 이 방법은 배치 정규화 없이도 안정적인 기울기 흐름을 보장하며, MNIST 및 CIFAR-10에서 특히 더 깊은 아키텍처에서 훈련 정확도를 크게 향상시킨다.

ABSTRACT

Deep learning relies on good initialization schemes and hyperparameter choices prior to training a neural network. Random weight initializations induce random network ensembles, which give rise to the trainability, training speed, and sometimes also generalization ability of an instance. In addition, such ensembles provide theoretical insights into the space of candidate models of which one is selected during training. The results obtained so far rely on mean field approximations that assume infinite layer width and that study average squared signals. We derive the joint signal output distribution exactly, without mean field assumptions, for fully-connected networks with Gaussian weights and biases, and analyze deviations from the mean field results. For rectified linear units, we further discuss limitations of the standard initialization scheme, such as its lack of dynamical isometry, and propose a simple alternative that overcomes these by initial parameter sharing.

연구 동기 및 목표

  • 표준 ReLU 가중치 초기화 기법(예: 히 초기화)이 깊은 네트워크에서 동적 등장성이 확보되지 않는 문제를 해결하기 위해.
  • 가우시안 가중치와 편향을 가진 완전 연결 ReLU 네트워크에서 신호 전파의 정확한 비점근 분석을 수립하기 위해.
  • 신호 상관관계를 유지하고 배치 정규화 없이도 깊은 네트워크에서 안정적인 훈련을 가능하게 하는 초기화 기법을 규명하기 위해.
  • 완벽한 동적 등장성을 보장하는 단순하면서도 효과적인 히 초기화의 대안으로서, 초기 가중치 공유를 통한 새로운 초기화 기법을 제안하기 위해.

제안 방법

  • 평균장 근사에 의존하지 않고, 가우시안 가중치와 편향을 가진 완전 연결 ReLU 네트워크의 정확한 공동 출력 신호 분포를 유도한다.
  • 입력 간의 신호 스칼라 곱의 계층 간 전파를 모델링하기 위한 선형 전이 연산자를 도입한다.
  • 이 연산자의 스펙트럼 성질을 분석하여 훈련 가능성과 신호 구별 가능성 평가를 수행한다.
  • 특정 가중치를 공유하거나 구조화하여 전체 신호 전달을 보장하는 새로운 초기화 기법(GSM: Gaussian with Shared Means 및 직교 가중치 초기화)을 제안한다.
  • 각 계층 간 입력의 구별 가능성 평가를 위해 출력 신호 간余弦 유사도를 메트릭으로 사용한다.
  • 동일한 훈련 조건에서 다양한 깊이와 너비를 가진 완전 연결 ReLU 네트워크를 사용해 MNIST 및 CIFAR-10에서 히, GSM, 직교 초기화 방식을 실험적으로 평가한다.

실험 결과

연구 질문

  • RQ1왜 표준 ReLU 초기화 기법(예: 히 초기화)이 깊은 네트워크에서 동적 등장성을 달성하지 못하는가?
  • RQ2깊은 ReLU 네트워크에서 신호 전파의 정확한 비점근 분석이 평균장 근사의 한계를 드러낼 수 있는가?
  • RQ3배치 정규화에 의존하지 않고도 ReLU 네트워크에서 완벽한 동적 등장성을 달성하는 초기화 기법은 무엇인가?
  • RQ4초기 가중치 공유가 깊은 완전 연결 네트워크에서 신호 다양성과 훈련 가능성에 어떻게 기여하는가?

주요 결과

  • 표준 히 초기화는 신호 분산을 유지하지만, 깊이가 증가할수록 신호 간 정렬도 증가하여 신호 다양성을 유지하지 못해 깊은 네트워크에서 훈련이 어려워진다.
  • 제안된 GSM 및 직교 초기화 기법은 MNIST 및 CIFAR-10에서 모두 히 초기화를 뛰어넘는 성능을 보이며, 특히 더 깊은 아키텍처에서 더 높은 테스트 정확도와 안정적인 훈련을 유지한다.
  • 더 깊은 네트워크(L ≥ 10)에서는 히 초기화 모델이 정확도가 감소하는 반면, GSM 및 직교 초기화 모델은 깊이가 증가함에 따라 성능을 유지하거나 향상시킨다.
  • 직교 초기화 변형은 다양한 너비에서 가장 안정적인 성능을 보이며, 너비가 증가할수록 정확도가 향상된다.
  • 정확한 신호 분포 분석 결과, 출력 분포는 입력 간 스칼라 곱에 의해 결정되며, 고차 상호작용은 영향을 주지 않는다.
  • 입력-출력 자코비안의 평균 스펙트럼 밀도보다도, 신호 전파 연산자의 스펙트럼 성질이 훈련 가능성 평가에 더 유용하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.