Skip to main content
QUICK REVIEW

[논문 리뷰] Stagewise Enlargement of Batch Size for SGD-based Learning

Shen-Yi Zhao, Yin-Peng Xie|arXiv (Cornell University)|2020. 02. 26.
Machine Learning and Algorithms참고 문헌 27인용 수 4
한 줄 요약

이 논문은 SGD 기반 학습에서 단계 간에 기하급수적으로 증가하는 배치 크기의 방법인 Stagewise Enlargement of Batch Size (SEBS)를 제안한다. SEBS는 테스트 정확도를 유지하면서도 파라미터 업데이트를 최대 64% 감소시켜, CIFAR-10과 ImageNet에서 전통적인 단계별 SGD 및 대규모 배치 크기 기반 기준선보다 뛰어난 성능을 발휘한다.

ABSTRACT

Existing research shows that the batch size can seriously affect the performance of stochastic gradient descent~(SGD) based learning, including training speed and generalization ability. A larger batch size typically results in less parameter updates. In distributed training, a larger batch size also results in less frequent communication. However, a larger batch size can make a generalization gap more easily. Hence, how to set a proper batch size for SGD has recently attracted much attention. Although some methods about setting batch size have been proposed, the batch size problem has still not been well solved. In this paper, we first provide theory to show that a proper batch size is related to the gap between initialization and optimum of the model parameter. Then based on this theory, we propose a novel method, called \underline{s}tagewise \underline{e}nlargement of \underline{b}atch \underline{s}ize~(\mbox{SEBS}), to set proper batch size for SGD. More specifically, \mbox{SEBS} adopts a multi-stage scheme, and enlarges the batch size geometrically by stage. We theoretically prove that, compared to classical stagewise SGD which decreases learning rate by stage, \mbox{SEBS} can reduce the number of parameter updates without increasing generalization error. SEBS is suitable for \mbox{SGD}, momentum \mbox{SGD} and AdaGrad. Empirical results on real data successfully verify the theories of \mbox{SEBS}. Furthermore, empirical results also show that SEBS can outperform other baselines.

연구 동기 및 목표

  • 학습 속도와 일반화 성능를 균형 잡는 데 최적의 배치 크기를 선택하는 데 도전하는 것.
  • 이론적 보장이 없는 고정된 배치 크기 방법과 동적 배치 크기 전략의 한계를 극복하는 것.
  • 딥 러닝 학습에서 일반화 성능를 유지하면서도 파라미터 업데이트를 줄이는 방법을 개발하는 것.
  • 모델 파라미터의 초기화에서 최적값까지의 갭에 기반한 배치 크기 스케일링에 대한 이론적 근거를 제공하는 것.
  • SGD, 모멘타ム SGD, AdaGrad와 호환되는 보편적인 프레임워크를 설계하여 효율적인 학습을 가능하게 하는 것.

제안 방법

  • 각 단계에서 비율 ρ에 따라 기하급수적으로 증가하는 배치 크기를 갖는 다단계 학습 체계를 제안한다.
  • 모델 초기화와 최적 파라미터 간의 갭과 배치 크기 스케일링을 이론적으로 연결하여 일반화 오차가 증가하지 않도록 수렴 보장한다.
  • 각 단계에서 일정한 학습률을 유지하며, 기존의 단계별 SGD와 달리 학습률을 감소시키지 않는다.
  • 배치 크기 확장을 동안 수렴성과 일반화 안정성을 보장하기 위해 조건 η_s / b_s = O(ε_s)를 유도한다.
  • 표준 최적화 알고리즘인 SGD, 모멘타ム SGD(mSGD), AdaGrad에 이 방법을 적용하여 광범위한 적용 가능성을 입증한다.
  • 특정 에포크(예: 80, 120)에서 단계 전환을 수행하는 방식으로 SEBS를 구현하여 계산 효율성과 모델 성능의 균형을 맞춘다.

실험 결과

연구 질문

  • RQ1기하급수적으로 증가하는 배치 크기 전략이 일반화 성능을 떨어뜨리지 않고 파라미터 업데이트 수를 줄일 수 있는가?
  • RQ2배치 크기 스케일링 비율이 딥 네ural 네트워크 학습에서 수렴성과 테스트 정확도에 어떤 영향을 미치는가?
  • RQ3학습률을 감소시키는 전통적인 단계별 SGD보다 단계별 배치 크기 확장을 통해 성능이 뛰어날 수 있는가?
  • RQ4대규모 배치 크기 학습 방법에 비해 흔히 필요한 광범위한 하이퍼파ram터 튜닝 없이도 SEBS는 일반화 성능를 유지할 수 있는가?
  • RQ5제안된 방법은 SGD, 모멘타ム SGD, AdaGrad와 같은 다양한 최적화 알고리즘에 보편적으로 적용 가능한가?

주요 결과

  • ImageNet(ResNet50)에서 SEBS는 전통적인 mSGD 대비 파라미터 업데이트를 64% 감소시키며, 테스트 정확도 75.87%를 유지한다.
  • ResNet20를 사용한 CIFAR-10에서 SEBS는 ρ=12일 때 기존 단계별 학습 대비 파라미터 업데이트를 62.5k에서 32.6k로 줄여, 유사한 테스트 정확도를 달성한다.
  • SEBS는 매 에포크마다 배치 크기를 증가시키는 DB-SGD보다 성능이 뛰어나며, 일반화 성능가 떨어지는 문제를 피한다.
  • mSEBS는 160만 번의 파라미터 업데이트로 CIFAR-10에서 91.74%의 테스트 정확도를 달성하여, 더 적은 업데이트를 사용함에도 불구하고 LARS(90.97%)를 능가한다.
  • Smith 등(2018)이 제안한 방법은 배치 크기를 빠르게 증가시키지만 ResNet50에서 정확도가 73.44%로 떨어지지만, mSEBS는 75.87%의 정확도를 유지한다.
  • 실험 결과는 SEBS가 큰 배치 크기 스케일링 비율(예: ρ=12)에서도 일반화 성능를 유지함을 확인하였으며, 이는 이전의 동적 배치 크기 방법과는 다릅니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.