Skip to main content
QUICK REVIEW

[논문 리뷰] Parallax: Sparsity-aware Data Parallel Training of Deep Neural Networks

Soojeong Kim, Gyeong-In Yu|arXiv (Cornell University)|2018. 08. 08.
Advanced Neural Network Applications참고 문헌 37인용 수 6
한 줄 요약

Parallax는 모델 파rameter의 희소성에 따라 동적으로 Parameter Server와 AllReduce 아키텍처를 조합하는 스파arsity 인식 데이터 병렬 학습 프레임워크로, 통신 오버헤드를 최소화합니다. NLP 모델에서 48개 GPU에서 Horovod 대비 최대 6.02배 빠르고 TensorFlow 대비 2.8배 빠르며, 밀도 높은 모델에서 기존 프레임워크와 동일하거나 이를 초월하는 성능을 달성합니다.

ABSTRACT

The employment of high-performance servers and GPU accelerators for training deep neural network models have greatly accelerated recent advances in deep learning (DL). DL frameworks, such as TensorFlow, MXNet, and Caffe2, have emerged to assist DL researchers to train their models in a distributed manner. Although current DL frameworks scale well for image classification models, there remain opportunities for scalable distributed training on natural language processing (NLP) models. We found that current frameworks show relatively low scalability on training NLP models due to the lack of consideration to the difference in sparsity of model parameters. In this paper, we propose Parallax, a framework that optimizes data parallel training by utilizing the sparsity of model parameters. Parallax introduces a hybrid approach that combines Parameter Server and AllReduce architectures to optimize the amount of data transfer according to the sparsity. Experiments show that Parallax built atop TensorFlow achieves scalable training throughput on both dense and sparse models while requiring little effort from its users. Parallax achieves up to 2.8x, 6.02x speedup for NLP models than TensorFlow and Horovod with 48 GPUs, respectively. The training speed for the image classification models is equal to Horovod and 1.53x faster than TensorFlow.

연구 동기 및 목표

  • 기존 딥러닝 프레임워크가 희소 모델 파arameter를 최적화하지 못해 자연어 처리(NLP) 모델 학습 시 확장성에 뒷받침되지 않는 문제를 해결하기 위해.
  • 특히 큰 임bedding 레이어를 가진 NLP 모델에서 모델 변수의 희소성을 활용하여 분산 데이터 병렬 학습의 통신 오버헤드를 줄이기 위해.
  • 사용자 개입 없이 변수별 희소성에 따라 최적의 통신 패턴(Parame ter Server 또는 AllReduce)을 선택하는 하이브리드 통신 아키텍처를 설계하기 위해.
  • 사용자 노력 최소화로 단일 GPU 계산 그래프를 확장 가능한 분산 그래프로 자동 변환하여 원활하고 고성능의 분산 학습을 가능하게 하기 위해.
  • 희소(NLP 등) 및 밀도 높음(이미지 분류 등) 모델 모두에 대해 훈련 처리량과 확장 효율을 향상시키는 통합 프레임워크를 제공하기 위해.

제안 방법

  • Parallax는 변수별 희소성 추정에 기반해 희소 변수에는 Parameter Server(PS), 밀도 높은 변수에는 AllReduce를 사용하는 하이브리드 통신 아키텍처를 도입합니다.
  • 훈련 시점에 계산 그래프에서 변수의 희소성에 맞게 적절한 통신 연산(예: allreduce, push/pull)을 삽입하기 위해 자동 그래프 변환을 수행합니다.
  • 희소 변수의 경우, 이를 더 작은 조각으로 나누고 접근된 요소들만 전송하는 PS 스타일의 push/pull 연산을 사용하여 네트워크 트래픽을 최소화합니다.
  • 프레임워크는 그래프 분석 중 변수별 희소성 추정을 수행하고, 비용 모델에 기반해 희소한 경우 PS, 밀도 높은 경우 AllReduce를 선택하는 최적의 통신 패턴을 결정합니다.
  • TensorFlow와 통합되어 동기적 SGD를 지원하며, 기존 딥러닝 워크플로우와의 호환성을 유지하면서도 확장 가능한 학습을 가능하게 합니다.
  • 희소 변수에 대해 최적의 병렬성과 통신/계산 오버헤드를 최소화하는 새로운 파artition 전략을 사용합니다.

실험 결과

연구 질문

  • RQ1NLP에서 큰 임베딩 레이어가 통신 비용을 지배하는 경우, 희소 모델에 대해 데이터 병렬 학습을 어떻게 더 확장 가능하게 만들 수 있는가?
  • RQ2다른 종류의 모델 파arameter(희소 대비 밀도 높음)에 대해 Parameter Server 또는 AllReduce 중 어느 통신 아키텍처가 최적의 성능을 제공하는가?
  • RQ3변수별로 최적의 아키텍처를 선택하는 하이브리드 통신 모델이 단일 아키텍처 접근 방식보다 더 나은 종합적 확장성을 달성할 수 있는가?
  • RQ4자동 그래프 변환 기술이 사용자가 코드를 수정하지 않고도 고성능 분산 학습을 달성할 수 있는 정도는 어느 정도인가?
  • RQ5Parallax의 성능는 Horovod 및 TensorFlow와 같은 최신 프레임워크와 비교해 희소 및 밀도 높은 딥러닝 모델 모두에서 어떻게 비교되는가?

주요 결과

  • Parallax는 언어 모델 및 신경 기계 번역 모델과 같은 NLP 모델을 훈련할 때 48개 GPU에서 Horovod 대비 최대 6.02배 빠르고 TensorFlow 대비 2.8배 빠릅니다.
  • 이미지 분류 모델의 경우, Parallax는 Horovod의 성능을 유지하며, 48개 GPU에서 TensorFlow 대비 1.53배 빠릅니다. 이는 다양한 모델 유형에서의 뛰어난 확장성 잠재력을 보여줍니다.
  • 48개 GPU에서 NLP 모델의 확장 효율을 19.0%까지 향상시켰고, Horovod의 경우 7.0%에 불과하며 TensorFlow 역시 19.0%이므로 분산 학습 효율성 향상에 상당한 기여를 했습니다.
  • 희소 변수에는 PS를, 밀도 높은 변수에는 AllReduce를 선택적으로 사용함으로써 통신 오버헤드를 줄였으며, 학습 정확도를 훼손하지 않으면서도 데이터 전송을 최소화했습니다.
  • 자동 그래프 변환 메커니즘 덕분에 사용자는 기존 단일 GPU 모델을 최소한의 코드 수정으로 분산 환경에서 훈련시킬 수 있으며, 거의 최적의 성능을 달성할 수 있습니다.
  • Parallax는 오픈소스로 공개되어 있으며, https://github.com/snuspl/parallax 에서 공개되어 있어, 희소성 인식 분산 학습 분야의 보급과 향후 연구를 촉진합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.