Skip to main content
QUICK REVIEW

[논문 리뷰] Beyond BatchNorm: Towards a Unified Understanding of Normalization in Deep Learning

Ekdeep Singh Lubana, Robert P. Dick|arXiv (Cornell University)|2021. 06. 10.
Domain Adaptation and Few-Shot Learning인용 수 14
한 줄 요약

이 논문은 배치 정규화(BatchNorm)의 알려진 성질—예를 들어 활성화 분산 안정화 및 정보 전파 가능성 향상—을 현대적 정규화 레이어(예: 그룹 정규화(GroupNorm), 인스턴스 정규화(InstanceNorm), 레이어 정규화(LayerNorm))로 확장한다. 이는 활성화 안정성, 기울기 동역학, 활성화 유사성에 기반해 일부 정규화 기법이 성공하거나 실패하는 이유를 통합된 프레임워크로 설명하며, 그룹 정규화(GroupNorm)에서 그룹 크기가 training 안정성과 속도 사이의 핵심 트레이드오프를 이끄는 것을 밝혀낸다.

ABSTRACT

Inspired by BatchNorm, there has been an explosion of normalization layers in deep learning. Recent works have identified a multitude of beneficial properties in BatchNorm to explain its success. However, given the pursuit of alternative normalization layers, these properties need to be generalized so that any given layer's success/failure can be accurately predicted. In this work, we take a first step towards this goal by extending known properties of BatchNorm in randomly initialized deep neural networks (DNNs) to several recently proposed normalization layers. Our primary findings follow: (i) similar to BatchNorm, activations-based normalization layers can prevent exponential growth of activations in ResNets, but parametric techniques require explicit remedies; (ii) use of GroupNorm can ensure an informative forward propagation, with different samples being assigned dissimilar activations, but increasing group size results in increasingly indistinguishable activations for different samples, explaining slow convergence speed in models with LayerNorm; and (iii) small group sizes result in large gradient norm in earlier layers, hence explaining training instability issues in Instance Normalization and illustrating a speed-stability tradeoff in GroupNorm. Overall, our analysis reveals a unified set of mechanisms that underpin the success of normalization methods in deep learning, providing us with a compass to systematically explore the vast design space of DNN normalization layers.

연구 동기 및 목표

  • 배치 정규화의 유익한 성질—예를 들어 활성화 폭발 방지 및 정보 전파 가능성 향상—을 배치 정규화를 초월한 다양한 정규화 레이어로 일반화하는 것.
  • 다양한 아키텍처와 훈련 환경에서 딥 네ural 네트워크(DNN)에서 정규화 기법의 성공 또는 실패를 예측할 수 있는 체계적인 설계 원칙을 규명하는 것.
  • 어떤 정규화 레이어(예: 그룹 정규화)가 강력한 성능을 내는 반면 다른 레이어(예: 인스턴스 정규화, 레이어 정규화)는 불안정성 또는 느린 수렴을 겪는 이유를 설명하는 것.
  • 배치 크기, 모델 깊이, 데이터 분포 변화와 같은 애플리케이션 특화 제약 조건에 기반해 정규화 레이어를 선택하는 데 유용한 이론적 안내 원칙을 수립하는 것.

제안 방법

  • 초기화 시점에서의 배치 정규화 행동에 대한 이론적 분석을 여러 정규화 기법으로 확장하며, 활성화 기반(예: 배치 정규화, 그룹 정규화) 및 매개변수 기반(예: 가중치 정규화) 방법을 포함한다.
  • 잔차 네트워크에서 활성화 분산을 분석하여, 활성화 기반 정규화 기법만이 지수적 증가를 방지함을 보이며, 매개변수 기반 방법은 아키텍처 수정(예: 스킵초기화)이 필요함을 밝힌다.
  • 가장 깊은 층에서의 표현 행렬의 질량을 사용해 전방 전파의 정보성 정도를 정량화하며, 그룹 정규화의 경우 이 값이 Ω(√(너비/그룹 크기))의 비율로 증가함을 보인다.
  • 계층별 기울기 노름의 지수적 피팅을 통해 훈련 안정성을 측정하고, 초기화 시점에서의 마지막 층 활성화의 코사인 유사도를 통해 훈련 속도를 측정한다.
  • 다양한 네트워크 깊이, 배치 크기, 학습률을 가진 CIFAR-100 실험을 통해 다수의 랜덤 시드를 사용해 이론적 예측의 정확성을 실증적으로 검증한다.
  • 기울기 폭발(안정성)과 활성화 유사성(최적화 속도) 사이의 트레이드오프 분석을 도입하며, 그룹 정규화에서 중간 크기의 그룹 크기가 최적의 성능을 낼 수 있음을 보여준다.

실험 결과

연구 질문

  • RQ1배치 정규화를 초월한 다양한 정규화 레이어가 깊은 잔차 네트워크에서 전방 전파 동안 활성화 분산을 얼마나 잘 안정화하는가?
  • RQ2정규화 기법이 서로 다른 입력에 대해 구분 가능한 활성화를 생성할 수 있는 능력이 최적화 속도에 얼마나 영향을 미치는가?
  • RQ3왜 인스턴스 정규화나 레이어 정규화 같은 정규화 레이어는 훈련 불안정성 또는 느린 수렴을 보이며, 이는 기울기 동역학과 어떤 관련이 있는가?
  • RQ4그룹 정규화에서 그룹 크기가 수행하는 역할은 무엇이며, 이는 훈련 안정성과 최적화 속도 사이의 트레이드오프를 어떻게 조절하는가?
  • RQ5다양한 DNN 아키텍처와 훈련 조건에서 다양한 정규화 레이어의 성공 및 실패 모드를 통합된 이론적 프레임워크로 설명할 수 있는가?

주요 결과

  • 활성화 기반 정규화 레이어(예: 배치 정규화, 그룹 정규화)는 깊은 잔차 네트워크에서 활성화 분산의 지수적 증가를 방지하지만, 매개변수 기반 방법(예: 가중치 정규화)은 아키텍처 수정(예: 스킵초기화)이 적용되지 않으면 그렇지 않다.
  • 그룹 정규화는 가장 깊은 층에서 표현의 질량이 Ω(√(너비/그룹 크기)) 비율로 증가함으로써 정보 전파가 가능한 전방 전파를 보장한다. 더 높은 질량은 더 나은 정보 전파를 의미한다.
  • 그룹 정규화에서 그룹 크기가 증가할수록 서로 다른 입력에 대한 활성화가 점점 더 유사해지며, 이는 수렴 속도 저하와 관련이 있다. 이는 레이어 정규화가 깊은 네트워크에서 성능이 열 劣하는 이유를 설명한다.
  • 그룹 정규화에서 작은 그룹 크기는 초기 레이어에서 큰 기울기 노름을 유도하여, 특히 깊은 네트워크나 작은 배치 크기에서 훈련 불안정성을 초래함을 보여주며, 이는 속도-안정성 트레이드오프를 입증한다.
  • 그룹 정규화에서 최적의 그룹 크기는 기울기 폭발(안정성)과 활성화 유사성(속도) 사이의 균형을 이룹니다. 최고의 테스트 정확도는 이 두 트레이드오프의 교차점에서 발생한다.
  • 실증 결과는 제안된 이론적 프레임워크가 다양한 아키텍처와 설정에서 훈련 행동을 정확히 예측함을 확인하며, 그룹 크기를 적절히 조정하면 그룹 정규화가 다른 기법보다 뛰어난 성능을 낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.