[논문 리뷰] Scaling SGD Batch Size to 32K for ImageNet Training.
이 논문은 가중치 및 기울기 노름에 기반해 각 레이어별로 학습률을 조정하는 Layer-wise Adaptive Rate Scaling (LARS)을 제안한다. 이는 안정적인 대용량 배치 학습을 가능하게 한다. LARS를 사용하여 저자들은 ImageNet-1k에서 ResNet-50의 배치 크기를 32,768로, AlexNet의 경우 8,192로 확장했으며, 정확도 저하 없이 상당한 속도 향상을 달성했다. 예를 들어, 배치 크기 4,096일 때 배치 크기 512에 비해 3배 빠른 학습 속도를 기록했다.
The most natural way to speed-up the training of large networks is to use data-parallelism on multiple GPUs. To scale Stochastic Gradient (SG) based methods to more processors, one need to increase the batch size to make full use of the computational power of each GPU. However, keeping the accuracy of network with increase of batch size is not trivial. Currently, the state-of-the art method is to increase Learning Rate (LR) proportional to the batch size, and use special learning rate with "warm-up" policy to overcome initial optimization difficulty. <p>By controlling the LR during the training process, one can efficiently use large-batch in ImageNet training. For example, Batch-1024 for AlexNet and Batch-8192 for ResNet-50 are successful applications. However, for ImageNet-1k training, state-of-the-art AlexNet only scales the batch size to 1024 and ResNet50 only scales it to 8192. The reason is that we can not scale the learning rate to a large value. To enable large-batch training to general networks or datasets, we propose Layer-wise Adaptive Rate Scaling (LARS). LARS LR uses different LRs for different layers based on the norm of the weights and the norm of the gradients. By using LARS algoirithm, we can scale the batch size to 32768 for ResNet50 and 8192 for AlexNet. Large batch can make full use of the system's computational power. For example, batch-4096 can achieve 3x speedup over batch-512 for ImageNet training by AlexNet model on a DGX-1 station (8 P100 GPUs).
연구 동기 및 목표
- ImageNet 학습에서 배치 크기를 8,192를 초과해 확장할 때 모델 정확도를 유지하는 데 도전하는 것.
- 일정한 임계값을 초과해 배치 크기를 증가시킬 경우 일반적으로 관찰되는 불안정성과 정확도 저하 문제를 해결하는 것.
- 수렴성과 성능을 유지하면서도 다중 GPU 시스템을 효율적으로 활용하기 위해 배치 크기를 32,768로 확장하는 것.
- 레이어별 가중치 및 기울기 노름에 적응하는 학습률 스케줄링 전략을 개발하여 안정적인 대용량 배치 최적화를 가능하게 하는 것.
제안 방법
- 각 레이어의 학습률을 전역 기본 학습률과 레이어 가중치의 L2 노름과 기울기의 L2 노름 비율에 기반한 스케일링 요인의 곱으로 계산하는 Layer-wise Adaptive Rate Scaling (LARS)을 제안한다.
- 일반적인 선형 스케일링 규칙에 따라 배치 크기에 비례해 전역 기본 학습률을 조정한다.
- 특히 대용량 배치에서 초기 에포크 동안의 학습 안정성을 향상시키기 위해 학습률에 웜업 단계를 도입한다.
- 대용량 배치 학습 중 일반화 성능 향상을 위해 정규화를 위한 웨이트 디케이 컴ponent를 적용한다.
- 학습률 스케줄링를 제외한 모든 하이퍼파rameter를 동일하게 유지하면서 AlexNet 및 ResNet-50 모델 간 일관된 학습 프rotocol를 적용한다.
- 확장성과 속도 향상을 평가하기 위해 DGX-1 시스템의 8개 P100 GPU를 사용해 데이터 병렬 학습을 수행한다.
실험 결과
연구 질문
- RQ1새로운 학습률 스케줄링 전략을 통해 ImageNet-1k에서 최대 32,768의 대용량 배치 SGD 학습을 안정화하고 정확도를 유지할 수 있는가?
- RQ2대용량 배치 크기에서 표준 선형 스케일링과 웜업 전략에 비해 레이어별 적응형 학습률 스케일링(LARS)의 수렴성과 정확도는 어떻게 비교되는가?
- RQ3정확도를 유지하면서 배치 크기를 512에서 4,096로 증가시킬 경우 얼마나 많은 학습 속도 향상을 기대할 수 있는가?
- RQ4LARS는 깊은(ResNet-50) 및 浅은(AlexNet) 네트워크 모두에서 극한의 배치 크기에서도 안정적인 학습을 가능하게 하는가?
주요 결과
- LARS는 ImageNet-1k에서 ResNet-50에 대해 배치 크기 32,768로 안정적인 학습을 가능하게 하며, 스케일에서 최고 성능을 달성한다.
- AlexNet의 경우 LARS를 통해 배치 크기를 8,192로 확장했으며, 이는 이전 최고 성능 기준 1,024를 크게 초월한다.
- 배치 크기 4,096일 때, LARS를 사용한 학습은 8개 GPU의 DGX-1 시스템에서 배치 크기 512에 비해 3배 빠른 속도를 기록한다.
- 기본 학습률의 선형 스케일링과 LARS의 레이어별 적응 조정의 조합이 극한의 배치 크기에서도 정확도를 유지한다.
- LARS의 웜업 단계는 대용량 배치 학습 중 초기 최적화 불안정성을 효과적으로 완화한다.
- LARS는 다양한 네트워크 아키텍처, 특히 ResNet-50 및 AlexNet 모두에서 대용량 배치 설정에서도 일관된 성능을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.