Skip to main content
QUICK REVIEW

[논문 리뷰] Do Normalization Layers in a Deep ConvNet Really Need to Be Distinct?

Ping Luo, Zhanglin Peng|arXiv (Cornell University)|2018. 11. 19.
Domain Adaptation and Few-Shot Learning참고 문헌 30인용 수 6
한 줄 요약

이 논문은 딥 컨volution 네트워크의 서로 다른 레이어가 동일한 정규화 방법을 사용할 것이 아니라 각각 다른 정규화 방법을 사용할 필요가 있는지 조사한다. 이를 위해 각 레이어에서 배치 정규화(BN), 인스턴스 정규화(IN), 레이어 정규화(LN) 중에서 학습을 통해 선택할 수 있는 스위처블 정규화(SN) 메커니즘을 제안한다. 결과적으로, ImageNet, COCO, Cityscapes, ADE20K에서 다양한 작업에 걸쳐 레이어별로 다른 정규화 방법을 선택할 수 있도록 허용함으로써 모델 성능과 일반화 성능이 향상됨을 보여주며, 이 선택은 주로 깊이와 배치 크기에 의해 영향을 받고 최적화 설정보다는 더 큰 영향을 받는다.

ABSTRACT

Yes, they do. This work investigates a perspective for deep learning: whether different normalization layers in a ConvNet require different normalizers. This is the first step towards understanding this phenomenon. We allow each convolutional layer to be stacked before a switchable normalization (SN) that learns to choose a normalizer from a pool of normalization methods. Through systematic experiments in ImageNet, COCO, Cityscapes, and ADE20K, we answer three questions: (a) Is it useful to allow each normalization layer to select its own normalizer? (b) What impacts the choices of normalizers? (c) Do different tasks and datasets prefer different normalizers? Our results suggest that (1) using distinct normalizers improves both learning and generalization of a ConvNet; (2) the choices of normalizers are more related to depth and batch size, but less relevant to parameter initialization, learning rate decay, and solver; (3) different tasks and datasets have different behaviors when learning to select normalizers.

연구 동기 및 목표

  • 딥 네트워크의 서로 다른 컨볼루션 레이어가 통일된 접근 방식이 아닌 각각 다른 정규화 방법을 사용해야 하는지 조사하기.
  • 깊은 네트워크에서 정규화 방법 선택에 영향을 주는 요인들, 예를 들어 깊이, 배치 크기, 학습 다이내믹스 등을 이해하기.
  • 학습된 정규화 방법 선택이 이미지 인식, 객체 검출, 세그멘테이션과 같은 다양한 비전 작업 간에 일반화되는지 평가하기.
  • 정규화 다양성이 모델의 일반화 능력과 학습 안정성에 미치는 영향에 대한 경험적 통찰을 제공하기.

제안 방법

  • 저자는 각 레이어에서 여러 정규화 방법(BN, IN, LN 등)의 가중 조합을 학습하여 사용하는 스위처블 정규화(SN)를 사용한다. 이는 각 정규화 방법의 중요도 비율을 학습 가능하게 한다.
  • SN은 다양한 정규화 방법에서 유도된 평균과 분산 추정치의 가중 평균을 사용하여 특징을 정규화하며, 이 가중치는 후보 정규화 방법들에 대해 소프트맥스를 통해 학습된다.
  • 이 방법은 각 컨볼루션 레이어 이후에 적용되며, 학습 중 각 레이어가 가장 적합한 정규화 방법을 동적으로 선택할 수 있도록 한다.
  • 성능 평가 및 선택 동역학 분석을 위해 ResNet, Mask R-CNN, DeepLabv2를 사용하여 ImageNet, COCO, Cityscapes, ADE20K에서 실험을 수행한다.
  • 저자는 네트워크 깊이, 배치 크기, 작업 유형에 따라 정규화 방법 비율의 학습 다이내믹스를 분석하여 영향을 주는 요인을 규명한다.
  • 재현 가능한 코드베이스와 사전 학습 및 미세조정된 모델을 공개하여 실험의 투명성과 재사용 가능성을 확보한다.

실험 결과

연구 질문

  • RQ1딥 컨볼루션 네트워크의 각 정규화 레이어가 정규화 방법 풀에서 자신만의 정규화 방법을 선택하는 것이 유익한가?
  • RQ2다양한 레이어와 학습 설정에서 정규화 방법 선택에 가장 크게 영향을 주는 요인은 무엇인가?
  • RQ3다른 컴퓨터 비전 작업과 데이터셋은 서로 다른 정규화 설정이나 동역학을 선호하는가?
  • RQ4학습 하이퍼파라미터, 예를 들어 학습률 감소, 최적화 알고리즘, 가중치 초기화 방식이 정규화 방법 선택에 어떤 영향을 미치는가?
  • RQ5학습된 정규화 방법 선택이 서로 다른 벤치마크에서 사전학습과 미세조정 간에 일반화되는가?

주요 결과

  • 레이어별로 다른 정규화 방법을 사용함으로써 ImageNet, COCO, Cityscapes, ADE20K에서 학습 수렴 속도와 일반화 성능이 향상된다.
  • 정규화 방법 선택은 네트워크 깊이와 배치 크기에 의해 가장 크게 영향을 받으며, 배치 크기가 증가함에 따라 BN 비율은 증가하고 IN/LN 비율은 감소한다.
  • BN 비율은 깊이에 반비례하며, LN 비율은 깊이가 증가함에 따라 증가함을 보여, 더 깊은 레이어에서 LN의 공간 통계에 대한 불변성의 이점이 더 크다는 것을 시사한다.
  • 정규화 방법 선택은 무작위 가중치 초기화, 학습률 감소 스케줄(예: 코즈인 감소), 최적화 알고리즘 유형(SGD with momentum 대비 RMSProp)에 대해 덜 민감함을 보였다.
  • 이미지 인식, 객체 검출, 세그멘테이션과 같은 다양한 작업은 서로 다른 정규화 방법 선택 동역학을 보이며, 특히 미세조정 중 객체 검출 작업에서는 중간 레이어에서 BN 사용 비율이 증가하는 경향이 있다.
  • 더 큰 배치 크기로 사전학습한 모델를 더 작은 배치 크기로 미세조정할 경우, 불안정한 배치 통계로 인해 성능이 열악해지는 경향이 있어, 사전학습과 미세조정 간의 배치 크기 일관성이 매우 중요하다는 점을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.