Skip to main content
QUICK REVIEW

[논문 리뷰] On the Acceleration of Deep Learning Model Parallelism with Staleness

An Xu, Zhouyuan Huo|arXiv (Cornell University)|2019. 09. 05.
Advanced Neural Network Applications인용 수 7
한 줄 요약

이 논문은 분산 DNN 학습에서 순방향, 역방향, 업데이트 락킹을 해소하기 위해 계층별로 지연된(gradients) 값을 도입함으로써 딥러닝 학습을 가속화하는 새로운 모델 병렬화 방법인 Diversely Stale Parameters (DSP)를 제안한다. 하위 계층이 지연된 기울기를 사용하고 순방향 전파와 재계산을 겹침으로써, 정확도 손실이나 메모리 과잉 증가 없이도 상당한 속도 향상을 달성하며, SGD 및 모멘타ム SGD 하에서 비볼록 문제에 대해 수렴 보장을 이론적으로 보장한다.

ABSTRACT

Training the deep convolutional neural network for computer vision problems is slow and inefficient, especially when it is large and distributed across multiple devices. The inefficiency is caused by the backpropagation algorithm's forward locking, backward locking, and update locking problems. Existing solutions for acceleration either can only handle one locking problem or lead to severe accuracy loss or memory inefficiency. Moreover, none of them consider the straggler problem among devices. In this paper, we propose Layer-wise Staleness and a novel efficient training algorithm, Diversely Stale Parameters (DSP), to address these challenges. We also analyze the convergence of DSP with two popular gradient-based methods and prove that both of them are guaranteed to converge to critical points for non-convex problems. Finally, extensive experimental results on training deep learning models demonstrate that our proposed DSP algorithm can achieve significant training speedup with stronger robustness than compared methods.

연구 동기 및 목표

  • 역전파 과정에서 발생하는 순방향, 역방향, 업데이트 락킹으로 인한 모델 병렬화의 비효율성을 해결하기 위해.
  • 정확도 손실, 메모리 과잉 증가 또는 느린 장치(stragglers) 처리 불가 문제를 겪는 기존 방법의 한계를 극복하기 위해.
  • 세부적인 계층 기반 지연 수준을 도입함으로써 장치 간 이종성에 대응하는 비동기 학습을 효율적으로 가능하게 하기 위해.
  • SGD 및 모멘타ム SGD 하에서 비볼록 최적화 문제에 대해 수렴 보장을 이론적으로 제공하기 위해.
  • 분산 학습 환경에서 빠른 속도 향상과 느린 장치에 대한 강건성을 실증적으로 입증하기 위해.

제안 방법

  • 다양한 네트워크 블록이 다른 학습 스텝에서 기인한 기울기를 사용할 수 있도록 허용하는 세부적인 지연 메커니즘인 계층별 지연을 제안한다.
  • 하위 계층이 더 오래된 기울기를 사용함으로써 독립적이고 비동기적으로 업데이트가 가능한, Diversely Stale Parameters (DSP)라는 학습 알고리즘을 도입한다.
  • 중간 활성화값의 재계산을 순방향 전파와 겹침으로써 메모리 소비를 줄이며, 모든 중간 결과를 저장할 필요 없이도 된다.
  • 합성 기울기와 지연된 오차 전파를 사용하여 역방향과 순방향 전파를 분리함으로써, 역방향 및 순방향 락킹을 제거한다.
  • 리아파노프 함수 기반 분석 프레임워크와 모멘타ム를 적용한 확률적 기울기 하강법을 활용하여, 비볼록 문제에서 임계점으로의 수렴을 증명한다.
  • 다양한 지연 수준을 고려한 수정된 기울기 업데이트 규칙을 적용하여 안정성과 수렴성을 보장한다.

실험 결과

연구 질문

  • RQ1계층별 지연을 도입함으로써 모델 병렬 DNN 학습에서 순방향, 역방향, 업데이트 락킹을 해소할 수 있는가?
  • RQ2비볼록 환경에서 오래된 기울기를 사용함에도 불구하고 제안된 DSP 알고리즘이 학습 수렴성과 정확도를 유지하는가?
  • RQ3DSP는 메모리 사용량 증가 없이도 상당한 속도 향상을 달성할 수 있는가?
  • RQ4분산 학습 환경에서 느린 장치에 대해 DSP는 얼마나 강건한가?
  • RQ5다양한 지연 수준을 계층 간에 적용할 경우, 어떤 이론적 보장을 제공할 수 있는가?

주요 결과

  • DSP는 GPipe 및 DDG와 같은 기준 방법 대비 상당한 학습 속도 향상을 보이며, 정확도 저하 없이 성능을 유지한다.
  • 무작위로 발생하는 느린 장치에 대해 강력한 강건성을 보이며, 비동기 실행 조건에서도 안정적인 수렴을 유지한다.
  • 이론적 분석을 통해 SGD 및 모멘타임 SGD 하에서 비볼록 문제에 대해 DSP가 임계점으로 수렴함을 증명한다.
  • 순방향 전파와 재계산을 겹침으로써 메모리 소비가 감소하여 모든 중간 활성화값을 저장할 필요가 없어진다.
  • 실증 결과에 따르면, 깊은 CNN에서 DSP는 기존 방법 대비 학습 처리량과 확장성 면에서 뛰어난 성능을 보인다.
  • 수렴 경계는 지연 수준과 학습률에 따라 달라지며, 통제된 지연 수준과 최적의 하이퍼파rameter 설정을 통해 더 날카로운 경계를 달성할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.