Skip to main content
QUICK REVIEW

[논문 리뷰] Batch Group Normalization

Xiao-Yun Zhou, Jiacheng Sun|arXiv (Cornell University)|2020. 12. 04.
Advanced Neural Network Applications참고 문헌 75인용 수 10
한 줄 요약

배치 그룹 정규화(BGN)는 채널, 높이, 너비 차원을 기반으로 한 통계 계산을 도입함으로써 소규모 및 극도로 큰 배치 크기에서 배치 정규화(BN)의 성능 저하 문제를 해결한다. 이는 하이퍼파라미터 G를 통해 그룹 크기를 제어한다. BGN은 다양한 비전 작업에서 최신 기준 성능을 달성하며, 배치 크기가 2인 조건에서 ImageNet에서 Top-1 정확도 76.096%를 기록하여 동일 조건에서 BN의 66.512%를 크게 뛰어넘었다.

ABSTRACT

Deep Convolutional Neural Networks (DCNNs) are hard and time-consuming to train. Normalization is one of the effective solutions. Among previous normalization methods, Batch Normalization (BN) performs well at medium and large batch sizes and is with good generalizability to multiple vision tasks, while its performance degrades significantly at small batch sizes. In this paper, we find that BN saturates at extreme large batch sizes, i.e., 128 images per worker, i.e., GPU, as well and propose that the degradation/saturation of BN at small/extreme large batch sizes is caused by noisy/confused statistic calculation. Hence without adding new trainable parameters, using multiple-layer or multi-iteration information, or introducing extra computation, Batch Group Normalization (BGN) is proposed to solve the noisy/confused statistic calculation of BN at small/extreme large batch sizes with introducing the channel, height and width dimension to compensate. The group technique in Group Normalization (GN) is used and a hyper-parameter G is used to control the number of feature instances used for statistic calculation, hence to offer neither noisy nor confused statistic for different batch sizes. We empirically demonstrate that BGN consistently outperforms BN, Instance Normalization (IN), Layer Normalization (LN), GN, and Positional Normalization (PN), across a wide spectrum of vision tasks, including image classification, Neural Architecture Search (NAS), adversarial learning, Few Shot Learning (FSL) and Unsupervised Domain Adaptation (UDA), indicating its good performance, robust stability to batch size and wide generalizability. For example, for training ResNet-50 on ImageNet with a batch size of 2, BN achieves Top1 accuracy of 66.512% while BGN achieves 76.096% with notable improvement.

연구 동기 및 목표

  • 소규모 및 극도로 큰 배치 크기에서 노이즈가 많거나 혼동되는 통계 추정으로 인해 발생하는 배치 정규화(BN)의 성능 저하 문제를 해결한다.
  • GN, IN, LN, PN 등 기존 정규화 방법의 한계를 극복한다. 이러한 방법들은 다양한 비전 작업에서 안정성이나 일반화 능력이 떨어진다.
  • 추가 학습 가능한 파라미터나 다층 정보 없이도 다양한 배치 크기에서 높은 성능을 유지할 수 있는 파라미터 및 계산 효율적인 정규화 방법을 제안한다.
  • 이미지 분류, 소수 학습, 비지도 도메인 적응을 포함한 여러 비전 벤치마크에서 일관된 성능 향상을 달성한다.

제안 방법

  • 채널, 높이, 너비 차원을 하나의 차원으로 통합하고 이를 G개의 그룹으로 나누어 그룹 기반 통계 계산을 도입한다.
  • 전체 미니배치 및 각 그룹 내에서 통계(평균 및 분산)를 계산함으로써 단일 또는 지나치게 큰 그룹에서 발생하는 노이즈가 많은 추정을 방지한다.
  • 통계 계산에 사용되는 특징 인스턴스 수를 제어하는 하이퍼파라미터 G를 사용하여 다양한 배치 크기에 적응 가능한 강건성을 확보한다.
  • BN과 동일한 재매aram터화(스케일 및 시프트)를 유지함으로써 표준 딥러닝 아키텍처와의 호환성을 확보한다.
  • 각 특징 그룹별로 정규화 연산을 적용하여 표현 능력을 유지하면서도 학습 안정성을 향상시킨다.
  • 기존 모델에 BN의 플러그인 대체로 BGN을 통합함으로써 아키텍처나 학습 절차의 변경 없이 적용 가능하다.

실험 결과

연구 질문

  • RQ1왜 배치 정규화(BN)는 소규모 및 극도로 큰 배치 크기에서 성능이 저하되는가?
  • RQ2학습 가능한 파라미터나 추가 계산 없이 통계 계산 방식을 수정함으로써 BN의 성능 저하를 완화할 수 있는가?
  • RQ3채널, 높이, 너비 차원에 걸쳐 특징 인스턴스를 그룹화하면 정규화 레이어에서 통계 추정이 어떻게 향상되는가?
  • RQ4제안된 배치 그룹 정규화(BGN)는 다양한 비전 작업과 배치 크기에서 BN, GN, IN, LN, PN보다 더 잘 일반화되는가?
  • RQ5BGN은 저자료 환경(예: 소수 학습)과 도메인 적응 시나리오에서 뛰어난 성능을 달성할 수 있는가?

주요 결과

  • BGN은 배치 크기가 2인 조건에서 ImageNet에서 Top-1 정확도 76.096%를 기록하여 동일 조건에서 BN의 66.512%를 크게 뛰어넘었다.
  • 5-way 1-shot 설정에서 mini-ImageNet에서의 소수 학습에서 BGN은 평균 정확도 59.50%를 달성하여 BN(59.30%), IN(52.17%), GN(56.55%)을 초월했다.
  • 5-way 5-shot 소수 학습에서는 BGN이 76.32%의 정확도를 기록하여 BN(76.22%), IN(70.49%), GN(73.20%)을 능가했다.
  • Office-31에서 비지도 도메인 적응 수행 시 BGN은 평균 정확도 90.9%를 기록하여 BN(90.1%), GN(88.6%) 및 기타 베이스라인을 능가했으며, wa 작업에서 1.5% 향상된 성능을 보였다.
  • BGN은 이미지 분류, NAS, 적대적 학습, 소수 학습, 도메인 적응 등 모든 평가된 작업에서 일관된 성능 향상을 보이며 강력한 일반화 능력을 입증했다.
  • BGN은 소규모 및 극도로 큰 배치 크기 모두에서 높은 성능를 유지하며, 추가 파라미터나 계산 없이도 BN의 포화 및 성능 저하 문제를 해결했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.