Skip to main content
QUICK REVIEW

[논문 리뷰] Faster Distributed Deep Net Training: Computation and Communication Decoupled Stochastic Gradient Descent

Shuheng Shen, Linli Xu|arXiv (Cornell University)|2019. 06. 28.
Stochastic Gradient Optimization Techniques참고 문헌 24인용 수 4
한 줄 요약

이 논문은 계산과 통신을 분리한 확률적 경사 하강법인 CoCoD-SGD를 제안한다. 이 알고리즘은 통신 빈도를 줄이며 계산과 통신을 병행하여, ResNet18과 VGG16을 사용할 때 16개 GPU 환경에서 기존의 동기식 SGD보다 최대 2-3배 빠른 훈련을 달성하며, 동일한 하드웨어 환경에서 선형적인 반복 속도 향상을 입증한다.

ABSTRACT

With the increase in the amount of data and the expansion of model scale, distributed parallel training becomes an important and successful technique to address the optimization challenges. Nevertheless, although distributed stochastic gradient descent (SGD) algorithms can achieve a linear iteration speedup, they are limited significantly in practice by the communication cost, making it difficult to achieve a linear time speedup. In this paper, we propose a computation and communication decoupled stochastic gradient descent (CoCoD-SGD) algorithm to run computation and communication in parallel to reduce the communication cost. We prove that CoCoD-SGD has a linear iteration speedup with respect to the total computation capability of the hardware resources. In addition, it has a lower communication complexity and better time speedup comparing with traditional distributed SGD algorithms. Experiments on deep neural network training demonstrate the significant improvements of CoCoD-SGD: when training ResNet18 and VGG16 with 16 Geforce GTX 1080Ti GPUs, CoCoD-SGD is up to 2-3$ imes$ faster than traditional synchronous SGD.

연구 동기 및 목표

  • 높은 계산 능력에도 불구하고 선형적인 시간 속도 향상을 제한하는 분산 딥 러닝의 통신 병목 현상을 해결한다.
  • 기존의 동기식 SGD에서 계산과 통신이 밀접하게 연결되어 있어 통신 중에 하드웨어 자원의 일부만 활용되는 비효율성을 해결한다.
  • 계산과 통신을 병행 실행할 수 있도록 분산 최적화 알고리즘을 개발하여 하드웨어 활용도를 향상시킨다.
  • 동일한 하드웨어 환경에서 전체 계산 능력에 비례한 선형적인 반복 속도 향상을 달성한다.
  • 모델 정확도를 희생시키지 않고 실제 환경에서 뛰어난 시간 속도 향상과 수렴 효율성을 입증한다.

제안 방법

  • 통신을 시작한 후 즉시 로컬 기울기 계산을 계속하도록 하여, 통신 완료를 기다리지 않고 계산과 통신을 분리한다.
  • 반복마다 통신하는 대신 주기적인 통신을 도입하여 전체 통신 복잡도를 감소시킨다.
  • 전역 기울기와 로컬 모델 및 전역 모델 간의 차이를 모두 사용하여 로컬 모델을 갱신함으로써 수렴 안정성을 유지한다.
  • 이론적 분석을 통해 동일한 환경에서는 선형적인 반복 속도 향상을 입증하고, 이질적 환경에서는 총 계산 능력에 비례한 선형적인 반복 속도 향상을 입증한다.
  • 작업자 속도에 따라 통신 빈도와 배치 크기를 동적으로 조정하여 동일한 환경과 이질적 환경을 모두 지원한다.
  • 계산과 통신 단계를 겹치는 통신 프로토콜을 구현하여 작업자에서의 유휴 시간을 최소화한다.

실험 결과

연구 질문

  • RQ1분산 SGD에서 계산과 통신을 효과적으로 분리하여 하드웨어 활용도를 향상시키고 통신 오버헤드를 줄일 수 있는가?
  • RQ2제안된 CoCoD-SGD 알고리즘이 동일한 환경에서 작업자 수에 비례해 선형적인 반복 속도 향상을 달성하는가?
  • RQ3이질적 환경에서 CoCoD-SGD가 총 계산 능력에 비례해 선형적인 반복 속도 향상을 유지하는가?
  • RQ4기존의 분산 SGD 변종인 S-SGD, Pipe-SGD, Local-SGD와 비교해 CoCoD-SGD의 실질적인 시간 속도 향상은 어느 정도인가?
  • RQ5CoCoD-SGD는 동일한 환경에서 빠른 수렴을 달성하면서도 모델 정확도를 유지하는가?

주요 결과

  • 16개 GPU에서 CoCoD-SGD는 ResNet18과 VGG16에 대해 기존의 동기식 SGD 대비 최대 2-3배 빠른 훈련을 달성한다.
  • 이질적 환경에서 CoCoD-SGD는 S-SGD 대비 ResNet18에서 2.5배, VGG16에서 3배의 속도 향상을 보였다.
  • S-SGD와 비교해 테스트 정확도를 유지하거나 略로 향상시켰으며, ResNet18을 사용한 CIFAR-10에서 최종 테스트 정확도는 94.33%였고, VGG16을 사용한 CIFAR-100에서는 75.74%였다.
  • 이질적 환경에서 CoCoD-SGD는 다양한 작업자 속도에 대해 강건하며, 비례 샘플링을 적용한 S-SGD와 Pipe-SGD를 초월하는 빠른 수렴을 유지한다.
  • 이론적 분석을 통해 CoCoD-SGD가 동일한 환경과 이질적 환경 모두에서 선형적인 반복 속도 향상을 달성함을 확인했다.
  • 실험 결과 CoCoD-SGD는 통신 복잡도를 감소시키면서도 계산과 통신을 겹치는 방식으로 하드웨어 자원을 전면 활용함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.