Skip to main content
QUICK REVIEW

[논문 리뷰] An Empirical Study of Batch Normalization and Group Normalization in Conditional Computation

Vincent Michalski, Vikram Voleti|arXiv (Cornell University)|2019. 07. 31.
Domain Adaptation and Few-Shot Learning인용 수 7
한 줄 요약

이 논문은 조건부 계산 작업에서 조건부 배치 정규화(CBN)의 대안으로 조건부 그룹 정규화(CGN)를 조사한다. CGN은 배치 크기와 무관하고 일관된 통계를 제공하기 때문에 시각적 질의 응답(VQA) 및 소수의 예제 학습에서 일반화 성능을 향상시키지만, CBN의 배치 통계가 더 강한 인도적 편향을 제공하는 조건부 이미지 생성 작업에서는 성능이 열 劣하다.

ABSTRACT

Batch normalization has been widely used to improve optimization in deep neural networks. While the uncertainty in batch statistics can act as a regularizer, using these dataset statistics specific to the training set impairs generalization in certain tasks. Recently, alternative methods for normalizing feature activations in neural networks have been proposed. Among them, group normalization has been shown to yield similar, in some domains even superior performance to batch normalization. All these methods utilize a learned affine transformation after the normalization operation to increase representational power. Methods used in conditional computation define the parameters of these transformations as learnable functions of conditioning information. In this work, we study whether and where the conditional formulation of group normalization can improve generalization compared to conditional batch normalization. We evaluate performances on the tasks of visual question answering, few-shot learning, and conditional image generation.

연구 동기 및 목표

  • 조건부 계산에서 조건부 그룹 정규화(CGN)가 조건부 배치 정규화(CBN)보다 일반화 성능을 향상시킬 수 있는지 평가하는 것.
  • 다양한 작업, 즉 VQA, 소수의 예제 학습, 조건부 이미지 생성에서 정규화 방법 선택이 모델 성능에 미치는 영향을 조사하는 것.
  • 특히 도메인 이동이나 작은 배치 크기 하에서 배치 통계와 그 변동성의 일반화에 미치는 영향을 평가하는 것.
  • CGN의 더 단순한, 배치 크기에 의존하지 않는 통계가 체계적 일반화 작업에서 우수한 성능을 내는 데 기여할 수 있는지 확인하는 것.

제안 방법

  • 입력 컨텍스트에 따라 조건이 설정된 그룹 정규화를 적용하는 조건부 그룹 정규화(CGN)를 제안하며, CBN의 배치 통계를 그룹 통계로 대체한다.
  • 채널을 G개의 그룹으로 나누고, 배치 크기와 무관하게 공간 및 채널 차원 내에서 정규화하는 그룹 정규화를 사용한다.
  • 조건부 이미지 생성을 위한 WGAN-GP 생성자 네트워크의 잔차 블록과 VQA 및 소수의 예제 학습 모델에 CGN과 CBN을 적용한다.
  • 표준 평가 지표를 사용: 이미지 생성에 대해서는 Inception Score(IS), Fréchet Inception Distance(FID), Classification Accuracy Score(CAS)를 사용하고, VQA 및 소수의 예제 작업에는 정확도를 사용한다.
  • 다양한 랜덤 시드를 사용한 아블레이션 스터디를 수행하고 평균 결과를 통해 결과의 신뢰성을 확보한다.
  • 아키텍처와 초모수를 동일하게 유지하면서 다양한 작업 간의 성능를 비교하여 정규화 유형의 영향을 분리한다.

실험 결과

연구 질문

  • RQ1시각적 질의 응답 작업에서 CGN이 체계적 일반화를 강조하는 작업에서 CBN보다 일반화 성능이 뛰어나게 되는가?
  • RQ2소수의 예제 학습 환경에서, 즉 체계적 일반화가 요구되는 상황에서 CGN은 CBN보다 어떻게 비교되는가?
  • RQ3특히 작은 배치 크기 하에서, CGN은 조건부 이미지 생성에서 CBN과 비교해 유사하거나 더 뛰어난 성능을 낼 수 있는가?
  • RQ4CBN은 도메인 이동이나 배치 크기 변화 하에서 성능가 어떻게 저하되며, CGN은 이를 완화할 수 있는가?
  • RQ5배치 통계의 노이즈(정규화 효과)가 일반화에 미치는 영향은 무엇이며, CGN은 다른 방식으로 이를 보완할 수 있는가?

주요 결과

  • 시각적 질의 응답에서, CGN은 체계적 일반화를 강조하는 작업에서 CBN를 초월하여 분포 이동에 대한 강건성을 향상시켰다.
  • 소수의 예제 학습에서, CGN은 CBN보다 일관된 성능 향상을 보이며, 저자료 환경에서 더 나은 일반화 성능을 나타냈다.
  • WGAN-GP를 사용한 조건부 이미지 생성에서, CBN는 CGN를 크게 앞서며 FID(22.5 vs. 25.3)가 낮고 IS(8.5 vs. 8.1)가 높아 더 나은 샘플 품질과 다양성을 보였다.
  • 분류 정확도 점수(CAS)는 CBN가 생성한 데이터가 진짜 데이터 분포에 더 가까웠음을 확인했으며, CBN의 CAS는 78.2%였고 CGN는 73.1%였다.
  • CGN는 훈련과 추론 모두에서 일관된 행동을 보였고, 배치 크기 의존성이 없었으며, 반면 CBN는 배치 크기와 분포 이동에 민감했다.
  • 비록 CGN가 아키텍처적으로 단순하고 강건했지만, 이전에 CBN의 정규화 효과로 알려진 배치 통계의 노이즈가 부족하여 생성 작업에서 성능이 열 劣한 것으로 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.