Skip to main content
QUICK REVIEW

[논문 리뷰] Switchable Normalization for Learning-to-Normalize Deep Representation

Ping Luo, Ruimao Zhang|arXiv (Cornell University)|2019. 07. 22.
Domain Adaptation and Few-Shot Learning인용 수 8
한 줄 요약

이 논문은 각 레이어에서 배치 정규화(BN), 레이어 정규화(LN), 인스턴스 정규화(IN)의 통계 중에서 학습 가능한 가중치를 통해 동적으로 선택하는 학습 가능한 정규화 기법인 스위치블 정규화(Switchable Normalization, SN)를 제안한다. SN은 이미지 분류, 객체 검출, 세그멘테이션, 얼굴 인식, 스타일 전이 등 다양한 작업에서 성능을 향상시키며, 레이어별로 정규화 전략을 적응적으로 조정함으로써 BN, GN, IN을 초월한다. 특히 작은 배치 크기에서 뛰어난 성능을 보이며, 하이퍼파라미터 민감도를 제거한다.

ABSTRACT

We address a learning-to-normalize problem by proposing Switchable Normalization (SN), which learns to select different normalizers for different normalization layers of a deep neural network. SN employs three distinct scopes to compute statistics (means and variances) including a channel, a layer, and a minibatch. SN switches between them by learning their importance weights in an end-to-end manner. It has several good properties. First, it adapts to various network architectures and tasks. Second, it is robust to a wide range of batch sizes, maintaining high performance even when small minibatch is presented (e.g. 2 images/GPU). Third, SN does not have sensitive hyper-parameter, unlike group normalization that searches the number of groups as a hyper-parameter. Without bells and whistles, SN outperforms its counterparts on various challenging benchmarks, such as ImageNet, COCO, CityScapes, ADE20K, MegaFace, and Kinetics. Analyses of SN are also presented to answer the following three questions: (a) Is it useful to allow each normalization layer to select its own normalizer? (b) What impacts the choices of normalizers? (c) Do different tasks and datasets prefer different normalizers? We hope SN will help ease the usage and understand the normalization techniques in deep learning. The code of SN has been released at https://github.com/switchablenorms.

연구 동기 및 목표

  • 딥 네트워크의 모든 레이어에 동일한 정규화 유형을 사용할 경우 성능이 최적화되지 않는 문제를 해결하기 위해.
  • 예를 들어 그룹 정규화에서의 그룹 수와 같은 수동 하이퍼파라미터 조정이 필요 없도록 하기 위해.
  • 각 레이어에서 적응적으로 정규화 방식을 선택할 수 있도록 하여 다양한 아키텍처와 작업에서 일반화 능력과 성능을 향상시키기 위해.
  • 레이어별로 정규화 방식을 다르게 선택하는 것이 성능 향상에 기여하는지 분석하고, 이러한 선택에 영향을 주는 요인(아키텍처, 작업, 데이터 분포 등)을 규명하기 위해.

제안 방법

  • SN은 배치 정규화(BN), 레이어 정규화(LN), 인스턴스 정규화(IN)의 통계를 조합하여 각각 미니배치, 채널, 공간 차원을 기준으로 평균과 분산을 계산한다.
  • 다양이 가능한 게이팅 메커니즘을 사용해 각 정규화 유형의 중요도 가중치를 학습함으로써 선택 과정을 엔드 투 엔드로 훈련할 수 있도록 한다.
  • 최종 정규화된 출력은 세 가지 정규화된 특징의 가중합이며, 가중치는 채널 간 공유되지만 각 레이어에서 별도로 학습된다.
  • 이 방법은 CNN과 RNN(예: LSTMs) 모두에 적용 가능하며, 최소한의 계산 오버헤드로 훈련 및 추론 모두 지원한다.
  • 추론 비용을 줄이기 위해 하드 라우팅(예: 각 레이어에서 하나의 정규화기만 선택)을 탐색하였으며, 희소 SN에서는 50%의 레이어가 BN을 선택하여 선형 레이어로 변환 가능하게 하였다.
  • 특히 분산 훈련 환경에서 일반화 성능을 향상시키기 위해 SN에 동기화 배치 정규화를 적용하였다.

실험 결과

연구 질문

  • RQ1모든 레이어에서 고정된 정규화 방식을 사용하는 대신, 각 정규화 레이어가 자체적으로 정규화기를 독립적으로 선택하는 것이 성능 향상에 기여하는가?
  • RQ2각 레이어에서 정규화기 선택에 영향을 주는 요인은 아키텍처, 작업, 데이터 분포 중 무엇인가?
  • RQ3다양한 작업과 데이터셋은 서로 다른 정규화 기법 조합을 선호하는가?
  • RQ4작은 배치 크기에서 BN이 성능이 저하되는 상황에서 SN의 성능은 어떠한가?
  • RQ5SN은 CNN과 RNN(예: 아키텍처 서치에 포함된 LSTMs 포함) 모두에서 효과적으로 사용될 수 있는가?

주요 결과

  • ResNet50를 사용한 ImageNet 실험에서, (1,4) 배치 설정에서도 SN은 76.9%의 Top-1 정확도를 기록하여 BN(76.4%)과 GN(75.9%)을 능가했으며, 이상적인 BN 성능에 가까워졌다.
  • 매우 작은 배치 크기(예: GPU당 2장)에서도 SN은 BN과 GN이 심각하게 성능 저하를 보이는 상황에서 높은 정확도를 유지했다.
  • VGG16를 사용한 이미지 스타일 전이 실험에서, SN은 IN과 BN 모두보다 빠르게 수렴했으며, 이 작업에서 일반적으로 IN이 선호된다는 점을 고려할 때 자동으로 IN을 주요 정규화기로 선택했다.
  • LSTM 컨트롤러를 사용한 신경망 아키텍처 서치에서, SN은 CIFAR-10에서 LN과 GN보다 높은 검증 정확도를 달성하여, 서치 정책 학습에서 뛰어난 성능을 보였다.
  • SN 레이어 뒤에 작은 드롭아웃(0.1–0.2)을 적용했을 때 오버피팅이 감소했으며, ImageNet에서 일반화 능력 향상에 기여했다.
  • SN에서 하드 라우팅을 통해 희소 구성에서 추론 시간을 50% 감소시켰으며, 50%의 레이어가 BN을 선택함으로써 선형 변환을 통한 효율적 배포가 가능했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.