Skip to main content
QUICK REVIEW

[논문 리뷰] A Distributed Synchronous SGD Algorithm with Global Top-$k$ Sparsification for Low Bandwidth Networks

Shaohuai Shi, Qiang Wang|arXiv (Cornell University)|2019. 01. 14.
Stochastic Gradient Optimization Techniques참고 문헌 35인용 수 9
한 줄 요약

이 논문은 저대역폭 네트워크에서 통신 오버헤드를 줄이기 위해 글로벌 톱-k 기울기 희소화를 사용하는 분산 동기적 SGD(gTop-k S-SGD) 알고리즘을 제안한다. 모든 워커에서 가장 큰 크기를 가진 기울기 중 상위-k개를 선택함으로써 국소적 상위-k 기울기 집합과 달리 통신 복잡도를 O(kP)에서 O(k log P)로 감소시켜, 밀도 있는 SGD 대비 2.7–12배 높은 스케일링 효율성과 기존의 Top-k S-SGD 대비 1.1–1.7배 높은 성능을 달성한다. 이는 32개 GPU와 1Gbps 이더넷 클러스터에서 성현된다.

ABSTRACT

Distributed synchronous stochastic gradient descent (S-SGD) has been widely used in training large-scale deep neural networks (DNNs), but it typically requires very high communication bandwidth between computational workers (e.g., GPUs) to exchange gradients iteratively. Recently, Top-$k$ sparsification techniques have been proposed to reduce the volume of data to be exchanged among workers. Top-$k$ sparsification can zero-out a significant portion of gradients without impacting the model convergence. However, the sparse gradients should be transferred with their irregular indices, which makes the sparse gradients aggregation difficult. Current methods that use AllGather to accumulate the sparse gradients have a communication complexity of $O(kP)$, where $P$ is the number of workers, which is inefficient on low bandwidth networks with a large number of workers. We observe that not all top-$k$ gradients from $P$ workers are needed for the model update, and therefore we propose a novel global Top-$k$ (gTop-$k$) sparsification mechanism to address the problem. Specifically, we choose global top-$k$ largest absolute values of gradients from $P$ workers, instead of accumulating all local top-$k$ gradients to update the model in each iteration. The gradient aggregation method based on gTop-$k$ sparsification reduces the communication complexity from $O(kP)$ to $O(k\log P)$. Through extensive experiments on different DNNs, we verify that gTop-$k$ S-SGD has nearly consistent convergence performance with S-SGD, and it has only slight degradations on generalization performance. In terms of scaling efficiency, we evaluate gTop-$k$ on a cluster with 32 GPU machines which are interconnected with 1 Gbps Ethernet. The experimental results show that our method achieves $2.7-12 imes$ higher scaling efficiency than S-SGD and $1.1-1.7 imes$ improvement than the existing Top-$k$ S-SGD.

연구 동기 및 목표

  • 저대역폭 네트워크에서 분산 동기적 SGD(S-SGD)의 높은 통신 오버헤드 문제를 해결한다. 특히 많은 수의 워커가 참여할 경우에 초점을 맞춘다.
  • 기울기 색인의 비정규성으로 인해 AllGather 연산이 O(kP) 복잡도를 가지는 기존의 Top-k 희소화 방법의 비효율성을 해결한다.
  • 대규모 딥 네트워크 훈련에서 모델 수렴성과 일반화 성능을 유지하면서도 통신 복잡도를 감소시킨다.
  • 소비자용 1Gbps 이더넷 클러스터에서의 스케일링 효율성을 높이기 위해 반복적인 기울기 전송을 최소화한다.

제안 방법

  • 모든 워커에서 절대값이 가장 큰 상위-k 기울기를 선택하는 글로벌 상위-k(gTop-k) 희소화 메커니즘을 제안한다. 국소적 상위-k 기울기 집합을 집계하는 방식이 아니라, 전체 워커를 아우르는 글로벌 기준으로 선택한다.
  • 기존의 O(kP) 복잡도에서 O(k log P)로 감소시키는 통신 효율적인 집합 연산인 gTopKAllReduce 알고리즘을 도입한다.
  • O(log P) 라운드를 거쳐 토너먼트 기반 접근 방식을 사용해 P명의 워커 간 글로벌 상위-k 기울기를 식별하는 분산 선택 프로토콜을 구현한다.
  • 희소한 색인 정보는 선택된 글로벌 상위-k 값에 대해서만 유지하여 통신량을 최소화한다.
  • 수렴성과 정확도를 유지하기 위해 동작 보정 및 기울기 클리핑을 포함한 모멘타임 보정 기반의 S-SGD 프레임워크에 gTop-k 희소화를 통합한다.
  • 학습 루프에 대한 수정을 최소화하여 기존 딥 러닝 프레임워크와의 호환성을 확보한다.

실험 결과

연구 질문

  • RQ1글로벌 상위-k 기울기 선택이 모델 수렴성에 영향을 주지 않으면서도 분산 S-SGD에서 통신 복잡도를 감소시킬 수 있는가?
  • RQ2gTopKAllReduce의 통신 복잡도는 워커 수 증가에 따라 AllGather 기반의 Top-k 집합(즉, TopKAllReduce)과 비교해 어떻게 변화하는가?
  • RQ3gTop-k 희소화는 밀도 있는 SGD와 국소적 Top-k S-SGD 대비 모델 정확도와 수렴 속도에 어떤 영향을 미치는가?
  • RQ4저대역폭 네트워크에서 많은 수의 워커를 포함한 환경에서 gTop-k S-SGD의 스케일링 효율성은 어떻게 되는가?
  • RQ5gTop-k S-SGD는 ResNet, VGG, RNN 등 다양한 딥 네트워크 아키텍처에서 대역폭 제약 조건 하에서도 높은 훈련 효율성을 유지할 수 있는가?

주요 결과

  • gTop-k S-SGD는 통신 복잡도를 O(kP)에서 O(k log P)로 감소시켜 대규모 클러스터에서의 확장성 향상에 기여한다.
  • 1Gbps 이더넷으로 연결된 32개 GPU 클러스터에서 gTop-k S-SGD는 밀도 있는 S-SGD 대비 2.7–12배 높은 스케일링 효율성을 확보한다.
  • 동일한 하드웨어 환경에서 기존의 Top-k S-SGD 메서드 대비 gTop-k S-SGD는 스케일링 효율성을 1.1–1.7배 향상시킨다.
  • gTop-k S-SGD의 모델 수렴 성능는 S-SGD와 거의 동일하며, 일반화 성능에 약간의 저하가 발생한다.
  • ResNet-20에서 gTop-k S-SGD는 미니배치 크기가 1024일 경우 Top-k S-SGD 대비 약 9%의 정확도 저하를 보이지만, 더 작은 미니배치 크기에서는 이 값이 약 0.5%로 감소한다.
  • VGG-16에서 gTop-k S-SGD는 Top-k S-SGD 대비 약 1%의 정확도 저하를 보이며, 큰 미니배치 크기에서는 약 6%의 저하가 발생함을 확인하여 배치 크기 변화에 대해 더 뛰어난 내구성을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.