Skip to main content
QUICK REVIEW

[논문 리뷰] Extended Batch Normalization

Chunjie Luo, Jianfeng Zhan|arXiv (Cornell University)|2020. 03. 12.
Domain Adaptation and Few-Shot Learning참고 문헌 28인용 수 11
한 줄 요약

이 논문은 확장 배치 정규화(EBN)를 제안한다. EBN은 표준 배치 정규화와 유사하게 (N, H, W) 차원을 기준으로 배치 평균을 계산하지만, 표준편차는 전체 (N, C, H, W) 텐서를 기준으로 계산하여 소규모 배치 크기에서 통계 추정을 향상시킨다. EBN는 소규모 배치에서 BN보다 유의미하게 성능을 높이며, 대규모 배치 BN 수준에 가까운 성능을 달성하며, CIFAR, STL-10, ImageNet 벤치마크에서 GN과 동등하거나 이를 초월하는 정확도를 확보한다.

ABSTRACT

Batch normalization (BN) has become a standard technique for training the modern deep networks. However, its effectiveness diminishes when the batch size becomes smaller, since the batch statistics estimation becomes inaccurate. That hinders batch normalization's usage for 1) training larger model which requires small batches constrained by memory consumption, 2) training on mobile or embedded devices of which the memory resource is limited. In this paper, we propose a simple but effective method, called extended batch normalization (EBN). For NCHW format feature maps, extended batch normalization computes the mean along the (N, H, W) dimensions, as the same as batch normalization, to maintain the advantage of batch normalization. To alleviate the problem caused by small batch size, extended batch normalization computes the standard deviation along the (N, C, H, W) dimensions, thus enlarges the number of samples from which the standard deviation is computed. We compare extended batch normalization with batch normalization and group normalization on the datasets of MNIST, CIFAR-10/100, STL-10, and ImageNet, respectively. The experiments show that extended batch normalization alleviates the problem of batch normalization with small batch size while achieving close performances to batch normalization with large batch size.

연구 동기 및 목표

  • 작은 배치 크기에서 정확한 통계 추정이 어려워지면서 배치 정규화(BN) 성능이 떨어지는 문제를 해결하기 위해.
  • 모델 크기나 메모리 제약이 있는 환경, 특히 모바일 및 임베디드 디바이스에서 효과적인 학습을 가능하게 하기 위해.
  • 빠른 수렴과 내재된 정규화 등의 BN의 장점을 유지하면서도 소규모 배치 크기에 대한 강건성을 향상시키기 위해.
  • 그룹 정규화에서 요구되는 하이퍼파라미터 튜닝을 피할 수 있는 단순하고 파rameter-free 정규화 방법을 제공하기 위해.

제안 방법

  • EBN는 (N, H, W) 차원을 기준으로 평균을 계산하여 기존 BN의 특징 수준 정규화 방식을 유지한다.
  • EBN는 (N, C, H, W) 차원을 기준으로 표준편차를 계산하여 분산 추정에 사용되는 샘플 수를 증가시킨다.
  • 학습 중에는 평균과 표준편차의 이동 평균을 사용하며, 추론 시에는 이를 고정함으로써 컨볼루션과의 계산 융합을 가능하게 한다.
  • EBN는 추론 시 기존 BN과 동일한 계산 패tern을 유지하므로, 엣지 디바이스에 효율적으로 구현될 수 있다.
  • 배치 재정규화나 정규화 전파와 달리 새로운 학습 가능한 파라미터나 복잡한 의존성을 도입하지 않는다.

실험 결과

연구 질문

  • RQ1새로운 하이퍼파라미터를 도입하지 않고도 배치 정규화의 단순한 수정이 소규모 배치 크기에서의 성능 향상에 기여할 수 있는가?
  • RQ2다양한 데이터셋과 배치 크기에서 EBN가 BN과 GN에 비해 정확도와 학습 안정성 측면에서 어떻게 비교되는가?
  • RQ3EBN는 소규모 배치에 대한 강건성을 향상시키면서도 표준 BN의 계산 효율성과 모델 수렴 속도를 유지하는가?
  • RQ4매우 소규모 배치로 학습하더라도 EBN가 대규모 배치 BN 수준의 성능을 달성할 수 있는가?

주요 결과

  • 배치 크기 4로 CIFAR-10에서 EBN는 테스트 정확도 88.94%를 달성하여 BN(88.42%)과 GN(87.73%)을 모두 앞섰다.
  • 배치 크기 4로 CIFAR-100에서 EBN는 70.03%의 정확도를 기록하여 BN(69.41%)과 GN(68.91%)을 초월했다.
  • 배치 크기 2로 STL-10에서 EBN는 77.96%의 정확도를 달성하여 BN(76.91%)과 GN(76.17%)을 뛰어넘었다.
  • GPU당 배치 크기 4로 ImageNet에서 EBN는 68.54%의 Top-1 정확도를 기록하여 BN(65.78%)보다 2.76%p 높고, GN(69.08%)보다 0.54%p 높았다.
  • 대규모 배치 크기(1 GPU당 64)로 ImageNet에서 EBN는 70.12%의 정확도를 기록하여 BN(70.37%)과 0.25%p 이내였고, GN(68.77%)보다 1.35%p 높았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.