Skip to main content
QUICK REVIEW

[논문 리뷰] Priority-based Parameter Propagation for Distributed DNN Training

Anand Jayarajan, Jinliang Wei|arXiv (Cornell University)|2019. 05. 10.
Advanced Neural Network Applications참고 문헌 22인용 수 42
한 줄 요약

P3는 파라미터 슬라이싱과 우선순위 기반 업데이트를 도입하여 통신과 계산을 겹치게 하고, 대역폭이 제한된 환경에서 데이터 병렬 DNN 학습의 수렴에 영향을 주지 않으면서 성능 향상을 가져다준다.

ABSTRACT

Data parallel training is widely used for scaling distributed deep neural network (DNN) training. However, the performance benefits are often limited by the communication-heavy parameter synchronization step. In this paper, we take advantage of the domain specific knowledge of DNN training and overlap parameter synchronization with computation in order to improve the training performance. We make two key observations: (1) the optimal data representation granularity for the communication may differ from that used by the underlying DNN model implementation and (2) different parameters can afford different synchronization delays. Based on these observations, we propose a new synchronization mechanism called Priority-based Parameter Propagation (P3). P3 synchronizes parameters at a finer granularity and schedules data transmission in such a way that the training process incurs minimal communication delay. We show that P3 can improve the training throughput of ResNet-50, Sockeye and VGG-19 by as much as 25%, 38% and 66% respectively on clusters with realistic network bandwidth

연구 동기 및 목표

  • 동기식 SGD를 사용하는 데이터병렬 DNN 학습에서 통신 병목 현상을 극복해야 할 필요성을 고무한다.
  • 파라미터 동기화를 계산과 겹치게 하려면 DNN 학습에 대한 도메인 특화 지식을 활용한다.
  • 대역폭 제약 하에서 더 세밀한 파라미터 동기화가 계층 단위 방법보다 우수하다는 것을 증명한다.
  • 통신 오버헤드를 줄이면서도 방법의 수렴성을 유지한다.

제안 방법

  • 파라미터 슬라이싱 제안: 계층을 더 작은 파라미터 슬라이스로 분할하고 독립적으로 동기화한다.
  • 우선순위 기반 업데이트 적용: 다음 이터레이션에서 필요할 때를 기준으로 슬라이스에 우선순위를 부여하고 높은 우선순위 슬라이스를 먼저 스케줄한다.
  • 슬라이스를 위한 생산자-소비자 우선순위 큐를 갖춘 P3 Worker와 P3 Server를 도입하여 MXNet KVStore 내에서 구현한다.
  • 슬라이스를 P3 Server에 라운드 로빈으로 할당하고 슬라이스별 업데이트 알림을 명시적으로 제거하여 양방향 대역폭 활용을 가능하게 한다.
  • 모델 수렴에 영향을 주지 않도록 전체 그래디언트 동기화를 유지한다.

실험 결과

연구 질문

  • RQ1제한된 대역폭 하에서 계층 수준 동기화에 비해 더 세밀한 파라미터 동기화가 통신 지연을 줄일 수 있는가?
  • RQ2스케줄링에 계층 소비 타이밍(전방향 패스 요구사항)을 반영하면 통신과 계산의 겹침을 더 향상시킬 수 있는가?
  • RQ3다양한 계층 세분화를 갖는 모델들에서도 P3가 학습 처리량을 향상시키면서 SGD 수렴을 보존하는가?

주요 결과

  • P3는 ResNet-50, Sockeye, VGG-19의 학습 처리량을 각각 최대 25%, 38%, 66% 향상시킨다.
  • P3는 여러 모델에서 기반대역폭보다 더 낮은 대역폭에서도 선형 처리량을 유지하여 대역폭 한계에 대한 더 나은 탄력성을 보인다.
  • 파라미터 슬라이싱은 피크 대역폭 사용량을 감소시키고 양방향 대역폭 활용을 더 효과적으로 가능하게 한다.
  • 압축 기반 방법인 DGC 등과 비교하여 P3는 더 나은 정확도를 달성하고 SGD 수렴 동작을 변경하지 않는다.
  • 매우 큰 계층을 가진 모델(예: VGG-19)에서 큰 처리량 향상을 제공하고, 일부 모델에서 이득이 작아지더라도 상당한 절감을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.