Skip to main content
QUICK REVIEW

[논문 리뷰] Parameter Re-Initialization through Cyclical Batch Size Schedules

Norman Mu, Zhewei Yao|arXiv (Cornell University)|2018. 12. 04.
Adversarial Robustness in Machine Learning참고 문헌 26인용 수 5
한 줄 요약

이 논문은 교차하는 큰 배치 크기와 작은 배치 크기를 통해 제어된 노이즈 주입을 통한 가중치 재초기화를 통해 신경망 학습을 향상시키기 위해 순환적 배치 크기(CBS) 스케줄을 제안한다. 이 방법은 언어 모델링의 난이도를 최대 7.91점 향상시키고 학습 반복 수를 최대 61% 감소시키며, 추가 비용이 거의 들지 않는 효율적인 앙상블 및 적대적 학습을 가능하게 한다.

ABSTRACT

Optimal parameter initialization remains a crucial problem for neural network training. A poor weight initialization may take longer to train and/or converge to sub-optimal solutions. Here, we propose a method of weight re-initialization by repeated annealing and injection of noise in the training process. We implement this through a cyclical batch size schedule motivated by a Bayesian perspective of neural network training. We evaluate our methods through extensive experiments on tasks in language modeling, natural language inference, and image classification. We demonstrate the ability of our method to improve language modeling performance by up to 7.91 perplexity and reduce training iterations by up to $61\%$, in addition to its flexibility in enabling snapshot ensembling and use with adversarial training.

연구 동기 및 목표

  • 깊은 신경망에서 최적화되지 않은 가중치 초기화 문제를 해결함으로써 수렴성과 일반화 성능이 열 劣할 수 있는 문제를 해결한다.
  • 학습 중에 노이즈 수준을 동적으로 조절할 수 있는 적응형 초기화 전략을 탐색하며, 배치 크기를 제어 장치로 사용한다.
  • 언어 모델링, NLP, 이미지 분류와 같은 다양한 작업에서 학습 효율성과 모델 성능을 향상시킨다.
  • 추가 학습 비용 없이 스냅샷 앙상블 및 적대적 학습과 같은 고급 기법과의 탄력적인 통합을 가능하게 한다.
  • 일반화 성능 향상과 열악한 국소 최소값 탈출을 돕는 동적 재초기화를 위한 베이지안 기반 프레임워크를 제공한다.

제안 방법

  • 이 방법은 순환적 배치 크기 스케줄을 사용하여 확률적 경사 하강법(SGD)의 노이즈 수준을 조절함으로써 제어된 온도 변화를 통해 베이지안 적응형 사전 분포를 모방한다.
  • SGD의 노이즈는 학습률과 배치 크기의 비율에 의해 결정되며, 배치 크기를 순환시킴으로써 학습률을 변경하지 않고도 노이즈 스케일을 동적으로 변경한다.
  • 이 방법은 확률적 미분 방정식의 오일러-마루야마 이산화에 기반하며, 배치 크기가 탐색을 제어하는 온도 조절 장치로 작용한다.
  • LSTM, ResNet, WResNet 등의 아키텍처에서 언어 모델링 및 이미지 분류 작업에 대해 다양한 순환 스케줄(CBS-10-3, CBS-15-2 등)을 평가한다.
  • 사이클의 정점에서 모델을 저장함으로써 스냅샷 앙상블를 가능하게 하여 추가 학습 비용 없이 앙상블 성능을 달성한다.
  • 적대적 정규화와 조합하여 강화된 내성과 정확도를 달성하며, 특히 이미지 분류에서 유의미한 성능 향상을 이룬다.

실험 결과

연구 질문

  • RQ1고정된 배치 크기 기반 모델 대비 순환적 배치 크기 스케줄링이 신경망 학습의 일반화 성능 향상에 기여하는가?
  • RQ2CBS 스케줄은 모델 정확도를 유지하거나 향상시키면서 학습 반복 수를 얼마나 줄일 수 있는가?
  • RQ3가중치 초기화가 열 劣하거나 최적화되지 않은 상황에서 CBS는 어떻게 작동하는가?
  • RQ4CBS는 스냅샷 앙상블 및 적대적 학습과 효과적으로 통합되어 모델 성능을 향상시킬 수 있는가?
  • RQ5CBS를 적응형 사전 분포 개선으로 간주하는 베이지안 해석이 손실 및 일반화 성능 향상에 측정 가능한 영향을 미치는가?

주요 결과

  • 이미지 분류 작업에서 CBS 스케줄은 최대 61%의 학습 반복 수 감소를 이끌어내며 런타임을 크게 단축시켰다.
  • 언어 모델링에서 CBS는 기준 모델 대비 최대 7.91점의 난이도 향상을 달성했다.
  • 자연어 추론 및 이미지 분류 작업에서 CBS는 미미하지만 일관된 정확도 향상을 이뤘다.
  • 다른 CBS 사이클에서 얻은 모델을 사용한 스냅샷 앙상블은 ImageNet에서 이미지 분류 정확도를 기준 학습 대비 75.336%에서 76.401%로 향상시켰다.
  • CBS를 적대적 학습과 조합함으로써 ImageNet에서 추가로 0.26%의 정확도 향상을 달성했다.
  • 나쁜 초기 가중치를 가진 경우에도 CBS는 기준 초기화 방식을 능가하는 성능을 보이며, 최적화되지 않은 초기화에 대한 강건성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.