Skip to main content
QUICK REVIEW

[논문 리뷰] Distributed SLIDE: Enabling Training Large Neural Networks on Low Bandwidth and Simple CPU-Clusters via Model Parallelism and Sparsity

Minghao Yan, Nicholas Meisburger|arXiv (Cornell University)|2022. 01. 29.
Advanced Neural Network Applications인용 수 4
한 줄 요약

이 논문은 SLIDE 알고리즘에서 유도된 적응형 희소성(스파arsity)을 활용하여 저대역폭, 저자원 CPU 클러스터에서 near-billion-파라미터 신경망을 훈련할 수 있도록 하는 분산 모델 병렬 훈련 프레임워크인 D-SLIDE를 제안한다. D-SLIDE는 희소한 가중치 업데이트와 해시 테이블을 노드 간에 분산시켜, 밀도 있는 방법 대비 통신량을 99% 감소시켰으며, Horovod 대비 최대 80배 빠른 훈련 속도를 달성했고, 1 Gbps 인터커넥트를 가진 4~16코어 CPU에서 GPU 성능을 재현하거나 초월한다.

ABSTRACT

More than 70% of cloud computing is paid for but sits idle. A large fraction of these idle compute are cheap CPUs with few cores that are not utilized during the less busy hours. This paper aims to enable those CPU cycles to train heavyweight AI models. Our goal is against mainstream frameworks, which focus on leveraging expensive specialized ultra-high bandwidth interconnect to address the communication bottleneck in distributed neural network training. This paper presents a distributed model-parallel training framework that enables training large neural networks on small CPU clusters with low Internet bandwidth. We build upon the adaptive sparse training framework introduced by the SLIDE algorithm. By carefully deploying sparsity over distributed nodes, we demonstrate several orders of magnitude faster model parallel training than Horovod, the main engine behind most commercial software. We show that with reduced communication, due to sparsity, we can train close to a billion parameter model on simple 4-16 core CPU nodes connected by basic low bandwidth interconnect. Moreover, the training time is at par with some of the best hardware accelerators.

연구 동기 및 목표

  • 클라우드 환경에서 흔히 비활성화되어 있는, 저자원 및 저대역폭 CPU 클러스터에서 대규모 신경망 훈련을 가능하게 하기 위해.
  • 적응형 희소성을 통해 분산 모델 병렬 훈련에서 발생하는 통신 병목 현상을 완화하여 자료 이동을 최소화하기 위해.
  • 소규모, 소코어 CPU에서 제한된 메모리와 낮은 노드 간 대역폭을 가진 환경에서도 확장 가능하고 효율적인 프레임워크를 설계하기 위해.
  • 저자원 및 저대역폭 환경에서 Horovod와 같은 최첨단 분산 훈련 프레임워크를 초월하기 위해.
  • CPU 기반 훈련이 고성능 GPU 가속기(예: A100, V100)와 동일하거나 빠른 에포크 단위 훈련 속도를 달성할 수 있음을 입증하기 위해.

제안 방법

  • D-SLIDE는 신경망 레이어를 여러 CPU 노드에 분할하여 모델 병렬성을 구현하며, 적응형 희소성에 사용되는 해시 테이블과 함께 모델 가중치도 분산한다.
  • SLIDE 알고리즘의 특성 덕분에 각 훈련 단계에서 95% 이상의 희소성을 달성하여, 노드 간 전송되는 기울기와 가중치의 양을 극적으로 감소시킨다.
  • MPI 기반 메시지 전달 방식을 통해 통신을 최적화하며, 노드 간 전송되는 것은 희소한 업데이트(99% 압축)에 국한되어 대역폭 사용을 최소화한다.
  • 해시 테이블과 모델 파라미터를 노드에 균형 있게 분배함으로써 부하 균형을 확보하고, 효율적인 계산 및 경쟁 감소를 달성한다.
  • 입력에 따라 동적으로 희소성을 결정하는 학습 가능한 해시 함수를 사용하여, 병렬 처리 능력이 제한된 CPU에서도 높은 훈련 효율성을 유지한다.
  • 구현은 MPI 기반이며, PyTorch 및 TensorFlow와 같은 일반적인 딥러닝 프레임워크와의 통합을 지원한다.

실험 결과

연구 질문

  • RQ1클라우드 환경에서 흔히 비활성화되어 있는 저대역폭, 저자원 CPU 클러스터에서 대규모 신경망을 효율적으로 훈련시킬 수 있는가?
  • RQ2적응형 희소성이 모델 정확도를 훼손하지 않으면서 분산 모델 병렬 훈련에서 통신 오버헤드를 얼마나 줄일 수 있는가?
  • RQ3저대역폭(≤1 Gbps) 및 저코어(4~16) 조건에서 D-SLIDE는 Horovod 대비 훈련 속도와 확장성 측면에서 어떻게 비교되는가?
  • RQ4CPU 기반 훈련이 고성능 GPU 가속기(예: A100, V100)와 동일하거나 빠른 에포크 단위 훈련 시간을 달성할 수 있는가?
  • RQ58~16 GB 메모리 노드에서 모델 병렬성과 희소성만을 사용하여 near-billion-파라미터 모델을 훈련시키는 것은 가능한가?

주요 결과

  • 16코어와 1 Gbps 대역폭을 가진 2노드 클러스터에서 D-SLIDE는 Horovod가 단일 노드를 초월하지 못할 정도로 통신 병목 현상으로 인해 스케일업에 실패한 것과는 달리, 대규모 모델을 Horovod 대비 80배 빠르게 훈련시켰다.
  • 각 노드에 4코어가 있는 8노드 환경에서 D-SLIDE는 에포크당 훈련 시간을 5,417초로 유지했고, 동일한 설정에서 Horovod는 280,000초 이상 소요되었다.
  • Text8 데이터셋에서 D-SLIDE는 2노드에서 단일 V100 GPU보다 6.7배 빠르고, 단일 A100 GPU보다 2.5배 빠르게 훈련했으며, 정확도는 유사한 수준을 기록했다.
  • Amazon670K 데이터셋에서 D-SLIDE는 2노드에서 2개의 V100 GPU보다 3.0배 빠르고, 단일 A100 GPU보다 2.1배 빠르게 훈련했으며, 테스트 정확도는 TensorFlow 기준선과 유사했다.
  • 99%의 통신 압축을 통해 D-SLIDE는 8노드에서 강력한 확장성을 유지했으며, 저대역폭 환경에서의 강인함을 입증했다.
  • 프레임워크는 각 노드에 8~16 GB 메모리만을 사용하여 800M파라미터 모델을 성공적으로 훈련시켰으며, 최소한의 하드웨어 환경에서도 가능함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.