Skip to main content
QUICK REVIEW

[논문 리뷰] Channel Normalization in Convolutional Neural Network avoids Vanishing Gradients

Zhenwei Dai, Reinhard Heckel|arXiv (Cornell University)|2019. 07. 22.
Neural Networks and Applications참고 문헌 11인용 수 18
한 줄 요약

이 논문은 단일 예제로 훈련할 때 합성곱 신경망에서 채널 정규화가 기울기 소실을 방지함을 보여준다. 이는 딥 이미지 프리오르 및 딥 디코더 응용 분야에서 핵심적인 설정이다. 각 채널을 개별적으로 정규화함으로써 기울기는 유한하게 유지되어 효율적인 최적화를 가능하게 하며, 그렇지 않으면 표준 초기화 조건에서 수렴하기 위해 기하급수적으로 많은 단계가 필요하다.

ABSTRACT

Normalization layers are widely used in deep neural networks to stabilize training. In this paper, we consider the training of convolutional neural networks with gradient descent on a single training example. This optimization problem arises in recent approaches for solving inverse problems such as the deep image prior or the deep decoder. We show that for this setup, channel normalization, which centers and normalizes each channel individually, avoids vanishing gradients, whereas, without normalization, gradients vanish which prevents efficient optimization. This effect prevails in deep single-channel linear convolutional networks, and we show that without channel normalization, gradient descent takes at least exponentially many steps to come close to an optimum. Contrary, with channel normalization, the gradients remain bounded, thus avoiding exploding gradients.

연구 동기 및 목표

  • 단일 예제 훈련에서 합성곱 신경망의 기울기 하강법 안정화에 있어 채널 정규화의 역할을 조사한다.
  • 한 장의 이미지로 훈련할 때 깊이 있는 선형 합성곱 신경망에서 기울기 소실 문제를 다룬다.
  • 이론적으로 채널 정규화 없이 기울기 하강법이 수렴하기 위해 기하급수적으로 많은 단계가 필요함을 보여준다.
  • 채널 정규화가 기울기를 유한하게 유지하여 더 빠르고 안정적인 최적화를 가능하게 함을 보여준다.
  • 초기화 시점과 훈련 중 기울기 분포에 정규화가 미치는 영향을 평가한다.

제안 방법

  • 순환 가중치 행렬을 갖는 단일 채널 선형 합성곱 신경망을 사용하여 최적화 역학을 모델링한다.
  • 채널 정규화 유무에 따라 제곱 손실 함수에 기울기 하강법을 적용한다.
  • 푸리에 변환을 활용해 순환 행렬을 대각화함으로써 문제를 n개의 일차원 최적화 과제로 환원한다.
  • 손실 함수에서 유도된 해석적 표현을 사용해 초기화 시점과 훈련 중 기울기 노름과 분포를 분석한다.
  • n=100 및 d=6 층을 갖는 합성 데이터에서 경험적 분포를 통해 정규화된 및 비정규화된 기울기를 비교한다.
  • 채널 정규화의 스케일 및 시프트 파라미터(γ=1, β=0)를 고정하여 학습 가능한 파라미터의 영향을 분리한다.

실험 결과

연구 질문

  • RQ1채널 정규화는 단일 예제로 훈련하는 깊이 있는 합성곱 신경망에서 기울기 소실을 방지하는가?
  • RQ2정규화 없이 네트워크 깊이가 증가할수록 수렴하기 위해 필요한 최적화 단계 수는 어떻게 변화하는가?
  • RQ3채널 정규화 유무에 따라 초기화 시점의 기울기 분포는 어떻게 되는가?
  • RQ4정규화는 선형 합성곱 신경망에서 기울기 하강법의 안정성과 수렴 속도에 어떻게 영향을 주는가?
  • RQ5순환 가중치를 갖는 단순화된 선형 모델에서 이론적 수렴 한계를 해석적으로 유도할 수 있는가?

주요 결과

  • 채널 정규화 없이 기울기 하강법는 최적 해와의 거리가 c′ 이내가 되는 데 적어도 exp(Ω(d))회의 단계가 필요하며, 이는 큰 학습률 η ≤ exp(cd) 조건에서도 마찬가지다.
  • 채널 정규화가 적용된 경우 기울기는 유한하고 안정적으로 유지되어 기울기 소실 및 폭발 문제를 모두 방지한다.
  • 경험적 결과에 따르면, 정규화 없이 기울기 분포의 尾部가 정규화된 경우보다 현저히 두꺼운 편이다. 특히 초기화 시점에서 두드러진다.
  • 단일 채널 및 다중 채널 CNN 모두 ReLU 활성화 함수를 사용할 경우, 채널 정규화는 더 안정적이고 효율적인 훈련을 이끈다.
  • 이론적 분석은 정규화가 기울기를 현재 추정치의 정규직교 보완에 투영시킴으로써 최적화 경계를 안정화시킴을 확인한다.
  • 스케일 및 시프트 파라미터를 학습시키거나 γ=1, β=0로 고정하더라도 채널 정규화의 성능은 뛰어나게 유지된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.