Skip to main content
QUICK REVIEW

[논문 리뷰] 100-epoch ImageNet Training with AlexNet in 24 Minutes.

Yang You, Zhao Zhang|arXiv (Cornell University)|2017. 09. 14.
Advanced Neural Network Applications참고 문헌 14인용 수 38
한 줄 요약

이 논문은 대용량 배치 데이터 병렬 동기적 SGD와 LARS 최적화 알고리즘을 사용하여 AlexNet을 이용해 ImageNet에서 100 에포크 훈련을 단 24분 만에 수행함으로써, 정확도 손실 없이 배치 크기를 최대 32,000까지 효율적으로 확장할 수 있음을 보여주며, 기존 훈련 방법 대비 100배 빠른 속도 향상을 달성한다.

ABSTRACT

Finishing 90-epoch ImageNet-1k training with ResNet-50 on a NVIDIA M40 GPU takes 14 days. This training requires 10^18 single precision operations in total. On the other hand, the world's current fastest supercomputer can finish 2 * 10^17 single precision operations per second (Dongarra et al 2017, https://www.top500.org/lists/2017/06/). If we can make full use of the supercomputer for DNN training, we should be able to finish the 90-epoch ResNet-50 training in five seconds. However, the current bottleneck for fast DNN training is in the algorithm level. Specifically, the current batch size (e.g. 512) is too small to make efficient use of many processors For large-scale DNN training, we focus on using large-batch data-parallelism synchronous SGD without losing accuracy in the fixed epochs. The LARS algorithm (You, Gitman, Ginsburg, 2017, arXiv:1708.03888) enables us to scale the batch size to extremely large case (e.g. 32K). We finish the 100-epoch ImageNet training with AlexNet in 24 minutes. Same as Facebook's result (Goyal et al 2017, arXiv:1706.02677), we finish the 90-epoch ImageNet training with ResNet-50 in one hour.

연구 동기 및 목표

  • 현대 하드웨어를 효율적으로 활용하지 못하는 작은 배치 크기로 인한 현재 딥 네트워크(DNN) 훈련의 비효율성 문제를 해결한다.
  • 대규모 DNN 훈련에서의 알고리즘적 한계를 극복하기 위해 대용량 배치 크기의 효과적인 사용을 가능하게 한다.
  • 정확도를 유지하면서 ImageNet에서 AlexNet과 ResNet-50에 대해 극적으로 단축된 시간 내에 훈련 수렴을 달성한다.
  • 대용량 배치 훈련과 LARS를 사용할 경우 표준 훈련 정확도를 고정된 에포크 동안 유지할 수 있음을 보여주어 정확도 손실 없이 더 빠른 훈련을 가능하게 한다.

제안 방법

  • 여러 프로세서에 걸쳐 훈련을 확장하기 위해 대용량 배치 데이터 병렬 동기적 경사 하강법(SGD)을 사용한다.
  • 32,000과 같은 극도로 큰 배치 크기에서 훈련을 안정화시키기 위해 LARS(Layer-wise Adaptive Rate Scaling) 최적화 알고리즘을 적용한다.
  • 기울기 및 가중치 노름에 기반해 각 레이어별로 학습률을 동적으로 조정하여 대용량 배치 훈련 중에도 모델 정확도를 유지한다.
  • 여러 GPU에서의 하드웨어 활용도를 극대화하여 계산 효율성을 높이고, 훈련 시간을 수일에서 수분으로 단축시킨다.
  • 일致한 성능 평가를 위해 동일한 훈련 설정을 AlexNet과 ResNet-50 모델에 모두 적용한다.
  • AlexNet의 경우 훈련 에포크 수를 100으로, ResNet-50의 경우 90으로 고정하여 공정한 비교 및 수렴 평가를 보장한다.

실험 결과

연구 질문

  • RQ1ImageNet에서 동기적 SGD를 사용한 대용량 배치 훈련이 배치 크기를 32,000까지 확대해도 모델 정확도를 유지할 수 있는가?
  • RQ2대용량 배치 데이터 병렬화와 LARS를 사용할 경우 ImageNet 분류 작업에서 얻을 수 있는 최대 훈련 속도 향상은 얼마인가?
  • RQ3LARS 최적화기 알고리즘이 정확도를 저하시키지 않고 극도로 큰 배치 크기에서 안정적인 훈련을 가능하게 하는 이유는 무엇인가?
  • RQ4DNN 훈련에서 배치 크기의 한계를 제거함으로써 하드웨어 활용도는 어느 정도 향상될 수 있는가?
  • RQ5동일한 훈련 설정이 하이퍼파rameter 재조정 없이도 AlexNet과 ResNet-50 양쪽 모두에서 최신 기술 수준의 빠른 훈련을 달성할 수 있는가?

주요 결과

  • 대용량 배치 데이터 병렬화와 LARS 최적화기를 사용하여 AlexNet으로 100-에포크 ImageNet 훈련을 24분 내로 완료하였다.
  • 동일한 설정으로 ResNet-50의 90-에포크 훈련을 1시간 내로 수행하여, 유사한 효율성으로 페이스북에서 보고한 결과를 그대로 재현하였다.
  • LARS를 사용한 대용량 배치 훈련이 고정된 에포크 동안 표준 소규모 배치 훈련과 유사한 모델 정확도를 유지하였다.
  • 기존 표준 훈련 대비 100배의 속도 향상을 달성하여, 14일이 걸리는 ResNet-50 훈련 작업을 단 1시간으로 단축시켰다.
  • 알고리즘적 한계인 작은 배치 크기 문제를 제거함으로써 고성능 하드웨어의 전면적 활용이 가능함을 입증하였다.
  • 결과적으로 LARS를 사용한 대용량 배치 훈련이 정확도나 수렴 성능을 희생시키지 않고 대규모 DNN에 대해 실현 가능하다는 점을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.