Skip to main content
QUICK REVIEW

[논문 리뷰] Layer-wise Adaptive Gradient Sparsification for Distributed Deep Learning with Convergence Guarantees

Shaohuai Shi, Zhenheng Tang|arXiv (Cornell University)|2019. 11. 20.
Stochastic Gradient Optimization Techniques참고 문헌 36인용 수 14
한 줄 요약

이 논문은 통신-계산 겹침을 파ipelining을 통해 가능하게 하는 분산 딥러닝 최적화 방법인 LAGS-SGD를 제안한다. 이 방법은 동기적 SGD와 층별 적응형 기울기 희소화를 결합하여, 통신 대 대비 계산 비율에 따라 각 층별로 중요한 기울기를 적응적으로 선택함으로써, 원래 SGD와 동일한 수렴 속도를 유지하면서도 통신 오버헤드를 감소시킨다. 16개 GPU 클러스터에서 밀도 있는 SGD보다 최대 30% 빠른 학습을 달성한다.

ABSTRACT

To reduce the long training time of large deep neural network (DNN) models, distributed synchronous stochastic gradient descent (S-SGD) is commonly used on a cluster of workers. However, the speedup brought by multiple workers is limited by the communication overhead. Two approaches, namely pipelining and gradient sparsification, have been separately proposed to alleviate the impact of communication overheads. Yet, the gradient sparsification methods can only initiate the communication after the backpropagation, and hence miss the pipelining opportunity. In this paper, we propose a new distributed optimization method named LAGS-SGD, which combines S-SGD with a novel layer-wise adaptive gradient sparsification (LAGS) scheme. In LAGS-SGD, every worker selects a small set of "significant" gradients from each layer independently whose size can be adaptive to the communication-to-computation ratio of that layer. The layer-wise nature of LAGS-SGD opens the opportunity of overlapping communications with computations, while the adaptive nature of LAGS-SGD makes it flexible to control the communication time. We prove that LAGS-SGD has convergence guarantees and it has the same order of convergence rate as vanilla S-SGD under a weak analytical assumption. Extensive experiments are conducted to verify the analytical assumption and the convergence performance of LAGS-SGD. Experimental results on a 16-GPU cluster show that LAGS-SGD outperforms the original S-SGD and existing sparsified S-SGD without losing obvious model accuracy.

연구 동기 및 목표

  • 파이프라인화와 기울기 희소화를 조합하여 분산 딥러닝의 통신 병목 현상을 해결하기 위해.
  • 기존의 희소화 방법들이 단일 기울기 처리로 인해 통신과 계산을 겹칠 수 없는 한계를 극복하기 위해.
  • 수렴 보장을 유지하면서도 통신-계산 겹침을 가능하게 하는 층별 적응형 기울기 희소화 기법을 설계하기 위해.
  • 약한 분석적 가정 하에 LAGS-SGD가 원래 S-SGD와 동일한 수렴 속도 순서를 유지함을 이론적으로 증명하기 위해.
  • 분석적 가정을 실증적으로 검증하고 실제 DNN에서 뛰어난 학습 효율성을 입증하기 위해.

제안 방법

  • 각 층별로 기울기의 크기를 기반으로 상위-k 중요한 기울기를 독립적으로 선택하는 층별 적응형 기울기 희소화(LAGS) 기법을 도입한다.
  • 각 층의 통신 대 대비 계산 비율에 따라 희소화 비율을 동적으로 조정하여 부하를 균형 있게 분배하고 통신 지연을 숨기기 위해.
  • LAGS를 동기적 SGD(S-SGD)와 통합하여 LAGS-SGD를 구성함으로써, 통신이 역전파와 겹치는 파이프라인 실행을 가능하게 한다.
  • 강한 기울기 희소화에도 불구하고 모델 정확도를 유지하기 위해 오차 보상 기법을 적용한다.
  • 약한 분석적 가정 하에 비볼록이고 매끄러운 최적화 문제에 대해 LAGS-SGD의 이론적 수렴 경계를 유도한다.
  • 16개 GPU 클러스터에서 Horovod와 NCCL를 사용한 시스템 구현을 통해 벽시계 성능을 평가한다.

실험 결과

연구 질문

  • RQ1층별 적응형 기울기 희소화는 분산 SGD에서 통신-계산 겹침을 가능하게 할 수 있는가?
  • RQ2실제 가정 조건 하에 LAGS-SGD는 원래 S-SGD와 동일한 수렴 속도 순서를 유지하는가?
  • RQ3각 층별로 적응적인 압축 비율이 수렴과 학습 속도에 어떤 영향을 미치는가?
  • RQ4모델 정확도를 훼손시키지 않고 LAGS-SGD는 밀도 있는 S-SGD 및 희소화된 S-SGD보다 상당한 속도 향상을 달성할 수 있는가?
  • RQ5통신 대 대비 계산 비율은 LAGS-SGD의 성능에 어떤 영향을 미치는가?

주요 결과

  • 10GbE 인터커넥트를 사용한 16개 GPU 클러스터에서 LAGS-SGD는 밀도 있는 S-SGD보다 최대 30% 더 빠른 학습을 달성한다.
  • SLGS-SGD 대비 평균 반복 시간을 4.5% 감소시켜 시스템 확장성 향상을 입증한다.
  • ImageNet에서 LAGS-SGD는 벽시계 시간 기준으로 Dense-SGD 대비 22%~30% 향상된 성능을 기록한다.
  • ResNet-20, VGG-16, ResNet-50 모델에서 LAGS-SGD의 Top-1 정확도는 Dense-SGD와 0.3% 이내로 매우 낮은 정확도 손실을 보였다.
  • LSTM-PTB의 퍼플렉서티는 LAGS-SGD에서 109.4로, Dense-SGD(106.7) 및 SLGS-SGD(105.7)와 유사하여 일관된 수렴을 확인했다.
  • 이론적 분석을 통해 LAGS-SGD가 약한 분석적 가정 하에 원래 S-SGD와 동일한 수렴 속도 순서를 갖는다는 것을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.