Skip to main content
QUICK REVIEW

[논문 리뷰] Dynamic Stale Synchronous Parallel Distributed Training for Deep Learning

Xing Zhao, Aijun An|arXiv (Cornell University)|2019. 08. 16.
Advanced Neural Network Applications참고 문헌 37인용 수 4
한 줄 요약

이 논문은 동적으로 처리 시간에 기반해 둔감도 임계값을 런타임에 조정하는 분산 학습 프레임워크인 동적 둔감 동기병렬(Dynamic Stale Synchronous Parallel, DSSP)을 제안한다. 이는 수동 하이퍼파라미터 튜닝이 필요 없도록 하며, 이로 인해 이질적인 GPU 환경에서 특히 빠른 수렴 속도와 정확도 향상을 이룬다. DSSP는 수렴 보장을 유지하면서도 동기화 대기 시간을 줄여 성능과 안정성 면에서 SSP, BSP, ASP를 모두 능가한다.

ABSTRACT

Deep learning is a popular machine learning technique and has been applied to many real-world problems. However, training a deep neural network is very time-consuming, especially on big data. It has become difficult for a single machine to train a large model over large datasets. A popular solution is to distribute and parallelize the training process across multiple machines using the parameter server framework. In this paper, we present a distributed paradigm on the parameter server framework called Dynamic Stale Synchronous Parallel (DSSP) which improves the state-of-the-art Stale Synchronous Parallel (SSP) paradigm by dynamically determining the staleness threshold at the run time. Conventionally to run distributed training in SSP, the user needs to specify a particular staleness threshold as a hyper-parameter. However, a user does not usually know how to set the threshold and thus often finds a threshold value through trial and error, which is time-consuming. Based on workers' recent processing time, our approach DSSP adaptively adjusts the threshold per iteration at running time to reduce the waiting time of faster workers for synchronization of the globally shared parameters, and consequently increases the frequency of parameters updates (increases iteration throughput), which speedups the convergence rate. We compare DSSP with other paradigms such as Bulk Synchronous Parallel (BSP), Asynchronous Parallel (ASP), and SSP by running deep neural networks (DNN) models over GPU clusters in both homogeneous and heterogeneous environments. The results show that in a heterogeneous environment where the cluster consists of mixed models of GPUs, DSSP converges to a higher accuracy much earlier than SSP and BSP and performs similarly to ASP. In a homogeneous distributed cluster, DSSP has more stable and slightly better performance than SSP and ASP, and converges much faster than BSP.

연구 동기 및 목표

  • 둔감 동기병렬(SSP) 학습에서 최적의 둔감도 임계값을 수동으로 선택하는 문제를 해결하기 위해, 이는 시간이 오래 걸리고 종종 최적화되지 않는다는 점.
  • 실시간 워커 성능 기반으로 둔감도 임계값을 런타임에 조정하여 빠른 워커의 동기화 대기 시간을 줄이기 위해.
  • GPU 처리 능력이 크게 다른 이질적 환경에서 학습 수렴 속도와 정확도를 향상시키기 위해.
  • 기존의 BSP, ASP, SSP와 같은 프레임워크에 비해 이론적 수렴 보장을 유지하면서도 실용적 유연성과 안정성을 향상시키기 위해.
  • 시스템의 이질성에 대한 사전 지식이 필요 없이 반복마다 임계값을 동적으로 조정하는 경량의 적응 메커니즘을 제공하기 위해.

제안 방법

  • DSSP는 매 반복마다 워커들로부터의 실시간 처리 시간 측정값을 기반으로 각 워커에 대해 둔감도 임계값을 동적으로 결정한다.
  • 알고리즘은 최근 처리 시간을 기반으로 각 워커별로 국소 둔감도 임계값 $ s_L $ 를 계산하여, 빠른 워커가 느린 워커를 기다리지 않고도 동적으로 조정된 한계를 넘지 않도록 한다.
  • 모든 워커에 대해 허용 가능한 최대 둔감도를 제한하는 글로벌 임계값 $ r $ 이 존재하여 수렴 안정성을 확보한다.
  • 이 방법은 워커들이 기울기 값을 푸시하고 업데이트된 전역 가중치를 풀어내는 파라미터 서버 프레임워크와 통합되며, 동적 임계값에 의해 동기화가 제어된다.
  • 비용이 많이 드는 재학습이나 하이퍼파라미터 탐색을 피하기 위해 경량의 런타임 적응 메커니즘이 사용된다.
  • 이론적 분석 결과 DSSP는 SSP의 위험 한계를 그대로 이어받아, 임계값 범위가 일정할 경우 수렴 보장을 보장한다.

실험 결과

연구 질문

  • RQ1SSP에서 둔감도 임계값을 수동 튜닝의 부담을 줄이기 위해 런타임에 자동으로 결정할 수 있는가?
  • RQ2동적 임계값 조정이 이질적인 GPU 클러스터에서 수렴 속도와 정확도 향상에 기여할 수 있는가?
  • RQ3DSSP는 동종 및 이종 환경에서 BSP, ASP, SSP와 비교해 학습 속도, 정확도, 안정성 면에서 어떻게 다른가?
  • RQ4완전 연결층이 다양한 분산 프레임워크의 수렴 추세에 미치는 영향은 무엇인가?
  • RQ5변동하는 네트워크 조건이나 불안정한 워커 속도 상황에서도 DSSP는 강력한 성능을 유지할 수 있는가?

주요 결과

  • GTX1060과 GTX1080 Ti로 구성된 이질적 GPU 클러스터에서 DSSP는 3046.3초 만에 0.68의 테스트 정확도에 도달했으며, $ s=15 $ 로 설정된 SSP는 7255.6초가 소요되어 훨씬 더 빠르게 수렴했다.
  • 이종 환경에서 DSSP는 SSP와 BSP보다 더 높은 테스트 정확도를 달성했으며, ASP는 가장 빠르게 수렴했지만 지나친 둔감도로 인해 더 낮은 정확도에 머물렀다.
  • 동종 클러스터에서는 DSSP가 SSP와 ASP보다 더 안정적이고 略로 뛰어난 성능을 보였으며, BSP보다 훨씬 더 빠르게 수렴했다.
  • DSSP는 3016.4초 만에 0.67의 정확도를 달성했으며, 이는 ASP의 속도를 따라가지만 더 높은 정확도와 수렴 안정성을 확보했다.
  • CIFAR-100에서 ResNet-110을 학습할 경우, DSSP는 $ s=3 $ 로 튜닝된 SSP보다 더 높은 정확도를 더 빠르게 달성했다.
  • 결과적으로 DSSP는 ASP가 균형 잡히지 않은 환경에서 과도한 둔감도로 인해 성능이 저하되는 것과는 달리, 다양한 하드웨어 구성에서도 일관된 성능을 유지함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.