Skip to main content
QUICK REVIEW

[논문 리뷰] Collapse of Deep and Narrow Neural Nets

Lu Lu, Yanhui Su|arXiv (Cornell University)|2018. 08. 15.
Model Reduction and Neural Networks참고 문헌 46인용 수 11
한 줄 요약

이 논문은 깊고 좁은 ReLU 신경망이 대칭 가중치 초기화를 받을 경우, 최적화기나 손실 함수에 관계없이 훈련 도중 붕괴되어 목표 함수의 오류 있는 평균 또는 중앙값으로 수렴함을 보여준다. 붕괴 현상은 좁은 아키텍처에서 기울기 소실로 인해 발생하며, 배치 정규화나 SELU를 사용함으로써 완화될 수 있으나, 가중치 정규화와 드롭아웃은 이를 방지하지 못한다.

ABSTRACT

Recent theoretical work has demonstrated that deep neural networks have superior performance over shallow networks, but their training is more difficult, e.g., they suffer from the vanishing gradient problem. This problem can be typically resolved by the rectified linear unit (ReLU) activation. However, here we show that even for such activation, deep and narrow neural networks (NNs) will converge to erroneous mean or median states of the target function depending on the loss with high probability. Deep and narrow NNs are encountered in solving partial differential equations with high-order derivatives. We demonstrate this collapse of such NNs both numerically and theoretically, and provide estimates of the probability of collapse. We also construct a diagram of a safe region for designing NNs that avoid the collapse to erroneous states. Finally, we examine different ways of initialization and normalization that may avoid the collapse problem. Asymmetric initializations may reduce the probability of collapse but do not totally eliminate it.

연구 동기 및 목표

  • 이론적으로 장점이 있는 바에도 깊고 좁은 신경망이 복잡한 함수를 학습하지 못하는 이유를 조사한다.
  • ReLU 활성화 함수와 대칭 초기화를 갖는 좁은 네트워크에서 훈련 붕괴의 근본 원인을 규명한다.
  • 이러한 네트워크가 손실 함수에 따라 일정한 출력(평균 또는 중앙값)으로 수렴하는 이론적 및 수치적 증거를 제공한다.
  • 아키텍처 및 정규화 기법을 통해 깊고 좁은 네트워크에서 붕괴를 방지하기 위한 실용적 설계 지침을 수립한다.
  • 붕괴 방지를 위한 다양한 초기화 및 정규화 방법의 효과를 평가한다.

제안 방법

  • 이론적 분석을 통해 네트워크가 일정한 상태가 되면 모든 이전 레이어의 기울기가 소멸함을 증명하며, 이는 일정한 출력으로 수렴하게 된다.
  • 보조정리와 정리들을 도출하여 붕괴 확률을 분석하고, 깊이와 좁은 너비일수록 붕괴 확률이 증가함을 보여주며, 특히 너비 2인 네트워크에서 두드러진다.
  • 수치 실험을 통해 MSE 및 MAE 손실 하에서 C⁰, C∞ 및 L² 정규성 조건을 갖는 일차원 및 이차원 함수를 테스트한다.
  • 대칭 및 비대칭 가중치 초기화(직교 및 LSUV 포함)를 비교하고, 배치 정규화(BN), 가중치 정규화(WN), SELU, 드롭아웃을 평가한다.
  • 이론적 붕괴 확률 추정치를 바탕으로 안전 영역 다이어그램을 구성하여 네트워크 설계를 안내한다.
  • 정규화 기법의 효과를 평가하기 위해 정확한 함수 값으로의 수렴과 오류 있는 평균/중앙값 상태로의 수렴을 측정한다.

실험 결과

연구 질문

  • RQ1깊고 좁은 ReLU 네트워크가 이론적으로 복잡한 함수를 근사할 수 있음에도 불구하고, 왜 복잡한 함수를 학습하지 못하는가?
  • RQ2훈련 도중 네트워크가 목표 함수의 평균 또는 중앙값으로 붕괴되는 원인은 무엇인가?
  • RQ3대칭 가중치 초기화가 좁은 네트워크에서 붕괴 현상에 어떻게 기여하는가?
  • RQ4배치 정규화나 SELU와 같은 정규화 기법이 깊고 좁은 네트워크에서 붕괴를 방지할 수 있는가?
  • RQ5붕괴의 이론적 확률은 얼마이며, 다양한 네트워크 너비와 깊이에 대해 어떻게 추정할 수 있는가?

주요 결과

  • 대칭 초기화를 갖는 깊고 좁은 ReLU 네트워크는 최적화기나 훈련 기간에 관계없이, MSE 손실일 경우 목표 함수의 평균, MAE 손실일 경우 중앙값으로 수렴한다.
  • 이론적 분석에 따르면, 네트워크가 일정한 상태가 되면 모든 가중치와 편향의 기울기가 소멸하여 일정한 출력으로 수렴하게 된다.
  • 너비 2인 네트워크의 경우 붕괴 확률은 깊이 L과 입력 차원 d에 대해 1 - (1 - 2^{-d})^{L}로 추정되며, 깊고 좁은 설정에서 높은 위험을 가짐을 시사한다.
  • 배치 정규화와 SELU는 비영 기울기를 유지하고 포화를 방지함으로써 붕괴를 성공적으로 방지하지만, 가중치 정규화는 재매개변수화 불변성으로 인해 실패한다.
  • 드롭아웃은 붕괴를 방지하지 못하며, 희소성 증가와 함께 영향을 받는 영역의 활성화가 0이 되는 경향을 강화하여 좁은 아키텍처에서 문제를 악화시킨다.
  • 붕괴 위험을 최소화하는 너비-깊이 조합을 식별하기 위해 안전 영역 다이어그램을 구성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.