Skip to main content
QUICK REVIEW

[논문 리뷰] Distributed Learning of Deep Neural Networks using Independent Subnet Training

Binhang Yuan, Wolfe, Cameron R.|arXiv (Cornell University)|2019. 10. 04.
Stochastic Gradient Optimization Techniques참고 문헌 74인용 수 14
한 줄 요약

이 논문은 메모리 제약 또는 기밀성 요구가 있는 환경에서 통신 대역폭이 제한된 경우에 효과적으로 작동하는, 완전히 연결된 신경망을 위한 새로운 분산학습 방법인 독립 서브넷 훈련(IST)을 제안한다. 이 방법은 모델을 좁고 상호 독립적인 서브넷으로 분해하여 각각 별도의 장치에서 국지적으로 훈련함으로써 통신을 최소화하고 완전히 탈중앙화된 훈련을 가능하게 하여, 기존의 분산학습 방법보다 훨씬 더 빠른 수렴 속도를 달성한다.

ABSTRACT

Distributed machine learning (ML) can bring more computational resources to bear than single-machine learning, thus enabling reductions in training time. Distributed learning partitions models and data over many machines, allowing model and dataset sizes beyond the available compute power and memory of a single machine. In practice though, distributed ML is challenging when distribution is mandatory, rather than chosen by the practitioner. In such scenarios, data could unavoidably be separated among workers due to limited memory capacity per worker or even because of data privacy issues. There, existing distributed methods will utterly fail due to dominant transfer costs across workers, or do not even apply. We propose a new approach to distributed fully connected neural network learning, called independent subnet training (IST), to handle these cases. In IST, the original network is decomposed into a set of narrow subnetworks with the same depth. These subnetworks are then trained locally before parameters are exchanged to produce new subnets and the training cycle repeats. Such a naturally "model parallel" approach limits memory usage by storing only a portion of network parameters on each device. Additionally, no requirements exist for sharing data between workers (i.e., subnet training is local and independent) and communication volume and frequency are reduced by decomposing the original network into independent subnets. These properties of IST can cope with issues due to distributed data, slow interconnects, or limited device memory, making IST a suitable approach for cases of mandatory distribution. We show experimentally that IST results in training times that are much lower than common distributed learning approaches.

연구 동기 및 목표

  • 기밀성 또는 메모리 제약으로 인해 데이터가 장치 간에 분할되어 있는 필수 분산 환경에서 깊은 신경망을 훈련하는 데 도전하는 것.
  • 기존의 데이터 병렬 및 모델 병렬 방법이 비효율적인 하드웨어 환경에서 높은 통신 비용을 야기하거나 동기화된 업데이트를 요구하는 한계를 극복하는 것.
  • 데이터 공유나 고대역폭 인터커넥트를 요구하지 않는 효율적이고 탈중앙화된 훈련을 가능하게 하는 방법을 개발하는 것.
  • 실제 분산 제약 조건 하에서 완전히 연결된 신경망에 대해 확장성과 수렴 보장을 보장하는 것.
  • 모델 정확도와 훈련 속도를 유지하면서 동시에 장치당 메모리 사용량을 줄이는 훈련 프레임워크를 설계하는 것.

제안 방법

  • 완전히 연결된 신경망을 서로 깊이가 일치하는 다수의 좁은 서브넷으로 분해하여, 각각 별도의 장치에서 독립적으로 훈련하는 것.
  • 각 서브넷을 로컬 데이터를 사용하여 확률적 경사 하강법으로 국지적으로 훈련하여 장치 간 데이터 전송이 필요 없도록 하는 것.
  • 국지 훈련 후, 다음 반복을 위해 새로운 서브넷을 구성하기 위해 뿌리기만 갱신된 서브넷의 파라미터를 교환하는 것.
  • 드롭아웃과 근사 행렬 곱셈에 영감을 얻은 마스킹 메커니즘을 사용하여 효율적인 파라미터 갱신과 통신 오버헤드 감소를 가능하게 하는 것.
  • 압축된 반복 최적화 프레임워크를 정식화하여 IST의 수렴을 분석하고, 부드러움 조건과 노름 조건을 가정할 때 수렴을 증명하는 것.
  • 이론적 분석을 통해 IST가 통신 빈도와 볼륨에 대한 의존도를 줄이며, 부분선형 수렴 속도를 달성할 수 있음을 제시하는 것.

실험 결과

연구 질문

  • RQ1장치 간 데이터 전송을 피하면서도 모델 수렴과 성능을 유지할 수 있는 분산 훈련 방법을 설계할 수 있는가?
  • RQ2인터커넥트 대역폭이 제한된 환경에서 분산 훈련의 통신 볼륨과 빈도를 어떻게 최소화할 수 있는가?
  • RQ3독립적인 서브넷을 훈련하는 탈중앙화된 모델 병렬 접근법에 대해 어떤 이론적 수렴 보장을 설정할 수 있는가?
  • RQ4메모리와 네트워크 제약 조건 하에서 대규모 모델과 데이터셋에 대해 효율적으로 확장 가능한 방법을 개발할 수 있는가?
  • RQ5비이상적인 분산 환경에서 기존의 데이터 병렬 및 모델 병렬 방법과 비교해 볼 때, 제안된 IST 방법의 훈련 효율성은 어떠한가?

주요 결과

  • IST는 특히 통신 지연이 높거나 대역폭이 제한된 환경에서 기존의 표준 분산 학습 방법보다 훨씬 낮은 훈련 시간을 달성한다.
  • 장치당 저장하는 모델 파라미터의 부분 집합만으로도 메모리 사용량을 줄여 자원 제약이 있는 하드웨어에서의 훈련을 가능하게 한다.
  • 데이터 공유 없이 완전히 탈중앙화된 훈련을 가능하게 하여, 페더레이티드 러닝과 같은 기밀성에 민감한 응용 분야에 적합하다.
  • 이론적 분석 결과, IST는 모델의 부드러움, 압축 오차, 노름 조건에 따라 부분선형으로 수렴함을 보여주며, 이는 실용적 적용 가능성을 보장한다.
  • 실험 결과, IST는 통신 오버헤드를 극적으로 줄이면서도 중앙집중식 훈련과 비교해 유사한 모델 정확도를 유지함을 입증했다.
  • 수렴 한계는 유한한 기울기 노이즈와 압축 연산자에 대한 노름 조건과 같은 현실적인 가정 하에 유도되었으며, 실용성 보장을 위한 조건을 충족한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.