Skip to main content
QUICK REVIEW

[논문 리뷰] MG-WFBP: Efficient Data Communication for Distributed Synchronous SGD Algorithms

Shaohuai Shi, Xiaowen Chu|arXiv (Cornell University)|2018. 11. 27.
Stochastic Gradient Optimization Techniques참고 문헌 25인용 수 4
한 줄 요약

이 논문은 네트워크 시작 오버헤드를 줄이기 위해 층 간에 작은 기울기 메시지를 병합하는 최적화된 통신 스케줄링 알고리즘인 MG-WFBP를 제안한다. 분산 동기적 SGD를 위한 것으로, 총 학습 반복 시간을 최소화하는 최적화 문제로 문제를 정식화함으로써, 64개 노드로 구성된 GPU 클러스터에서 WFBP 대비 최대 1.75배, SyncEASGD 대비 최대 1.45배의 성능 향상을 달성하며, 고통신비율 환경에서의 확장성 효율을 크게 향상시킨다.

ABSTRACT

Distributed synchronous stochastic gradient descent has been widely used to train deep neural networks on computer clusters. With the increase of computational power, network communications have become one limiting factor on system scalability. In this paper, we observe that many deep neural networks have a large number of layers with only a small amount of data to be communicated. Based on the fact that merging some short communication tasks into a single one may reduce the overall communication time, we formulate an optimization problem to minimize the training iteration time. We develop an optimal solution named merged-gradient WFBP (MG-WFBP) and implement it in our open-source deep learning platform B-Caffe. Our experimental results on an 8-node GPU cluster with 10GbE interconnect and trace-based simulation results on a 64-node cluster both show that the MG-WFBP algorithm can achieve much better scaling efficiency than existing methods WFBP and SyncEASGD.

연구 동기 및 목표

  • 고통신비율로 인해 발생하는 분산 딥러닝의 성능 저하 문제를 해결한다. 특히 고대역폭 클러스터와 고속 GPU 환경에서의 영향을 고려한다.
  • WFBP 및 SyncEASGD와 같은 기존 방법들이 작은 기울기 전송의 빈도가 높고 시작 오버헤드가 크기 때문에 비효율적인 처리를 한다는 점을 규명한다.
  • 계산-계산 겹침과 통신 효율성을 모두 고려하여 총 학습 반복 시간을 최소화하는 통신 스케줄링 문제를 최적화 문제로 정식화한다.
  • 계산과 통신을 적절히 겹치면서도 총 통신 시간을 최소화하기 위해 지능적인 메시지 병합을 통해 최적의 전역 통신 전략을 개발한다.
  • 현실 및 시뮬레이션 기반의 대규모 GPU 클러스터에서 MG-WFBP의 확장성과 성능 향상을 상태 기반 최신 통신 방법들과 비교하여 입증한다.

제안 방법

  • 각 층의 계산 및 통신 비용을 고려하여 총 학습 반복 시간을 최소화하는 통신 스케줄링 문제를 최적화 문제로 정식화한다.
  • MG-WFBP(Merged-Gradient Wait-Free Backpropagation)를 제안하며, 이는 층 간에 작은 기울기 통신을 그룹화하여 더 큰, 더 효율적인 메시지로 병합함으로써 네트워크 시작 오버헤드를 줄인다.
  • L개의 층에 대해 O(L²) 시간 복잡도를 가지는 동적 프로그래밍 기반 솔루션을 설계하여 사전에 학습을 시작하기 전에 최적의 병합 스케줄을 계산한다.
  • 오픈소스 B-Caffe 딥러닝 플랫폼에 MG-WFBP를 통합하여 최적화된 통신 기능을 갖춘 종단 간 분산 학습을 가능하게 한다.
  • 기울기가 가용해지는 즉시 통신을 시작할 수 있도록 wait-free 백프로파게이션 원칙을 활용하며, 병합된 메시지가 계산을 지연시키지 않도록 보장한다.
  • 64개 노드 클러스터에서 추적 기반 시뮬레이션을 수행하여 물리적 하드웨어의 한계를 초월한 확장성 평가를 수행하며, 고노드 수 조건에서의 성능을 검증한다.

실험 결과

연구 질문

  • RQ1층 간에 작은 기울기 통신을 병합함으로써 분산 동기적 SGD에서 총 학습 반복 시간을 줄일 수 있는가?
  • RQ2고통신비율 환경에서 네트워크 시작 오버헤드가 지배적일 경우, wait-free 백프로파게이션(WFBP) 전략이 비효율적인가?
  • RQ3고시작 오버헤드를 가진 대규모 클러스터에서 단일 층 통신 방식인 SyncEASGD가 WFBP를 초월할 수 있는가?
  • RQ4계산과 통신을 겹치는 것과 메시지 병합을 통한 총 통신 시간 최소화 사이의 최적의 트레이드오프는 무엇인가?
  • RQ5계산-계산 겹침과 통신 효율성을 모두 고려한 전역 최적의 통신 스케줄링 전략이 존재하는가? 이 전략은 층별 및 단일 층 통신 방법을 모두 능가하는가?

주요 결과

  • 10GbE 인터커넥트를 사용하는 8개 노드 GPU 클러스터에서 MG-WFBP는 WFBP 대비 최대 1.36배, SyncEASGD 대비 최대 1.2배의 성능 향상을 달성한다.
  • 64개 노드 클러스터에서 추적 기반 시뮬레이션을 수행한 결과, MG-WFBP는 WFBP 대비 1.7배 이상, SyncEASGD 대비 1.3배 이상의 성능 향상을 기록한다.
  • ResNet-50 학습 환경에서 MG-WFBP는 64노드 시뮬레이션 환경에서 WFBP 대비 약 1.75배, SyncEASGD 대비 약 1.45배의 성능 향상을 달성한다.
  • MG-WFBP는 64노드 클러스터에서 70% 이상의 우수한 확장성 효율을 유지하지만, WFBP와 SyncEASGD는 시작 오버헤드가 숨겨지지 않아 약 55% 수준으로 떨어진다.
  • 시뮬레이션에서 관찰된 WFBP와 SyncEASGD 간 성능 교차점은, 작은 클러스터에서는 WFBP가 겹침으로 인한 이점을 얻지만, 대규모 환경에서는 시작 오버헤드가 줄어든 SyncEASGD 및 MG-WFBP가 더 뛰어난 성능을 보임을 확인한다.
  • MG-WFBP의 최적 메시지 병합 전략은 네트워크 대역폭의 더 나은 활용과 정지 시간 감소를 가능하게 하여 고통신비율 환경에서 가장 우수한 확장성 솔루션으로 자리매김한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.