Skip to main content
QUICK REVIEW

[논문 리뷰] 99% of Distributed Optimization is a Waste of Time: The Issue and How to Fix it

Konstantin Mishchenko, Filip Hanzely|arXiv (Cornell University)|2019. 01. 27.
Stochastic Gradient Optimization Techniques참고 문헌 41인용 수 5
한 줄 요약

이 논문은 표준 분산 최적화에서 모든 워커를 통해 전체 기울기를 전송함으로써 발생하는 통신의 99%가 불필요하다는 점을 밝혀내며, 이는 비효율성을 초래한다. 이에 따라 각 워커가 전체 기울기 블록의 일부만 전송하는 블록 스parser 기울기 업데이트 방법을 제안한다. 이는 수렴 속도를 유지하면서도 통신량을 최대 99%까지 줄일 수 있으며, 이론적 분석과 합성 및 실세계 데이터셋에 대한 실험을 통해 검증되었다.

ABSTRACT

Many popular distributed optimization methods for training machine learning models fit the following template: a local gradient estimate is computed independently by each worker, then communicated to a master, which subsequently performs averaging. The average is broadcast back to the workers, which use it to perform a gradient-type step to update the local version of the model. It is also well known that many such methods, including SGD, SAGA, and accelerated SGD for over-parameterized models, do not scale well with the number of parallel workers. In this paper we observe that the above template is fundamentally inefficient in that too much data is unnecessarily communicated by the workers, which slows down the overall system. We propose a fix based on a new update-sparsification method we develop in this work, which we suggest be used on top of existing methods. Namely, we develop a new variant of parallel block coordinate descent based on independent sparsification of the local gradient estimates before communication. We demonstrate that with only $m/n$ blocks sent by each of $n$ workers, where $m$ is the total number of parameter blocks, the theoretical iteration complexity of the underlying distributed methods is essentially unaffected. As an illustration, this means that when $n=100$ parallel workers are used, the communication of $99\%$ blocks is redundant, and hence a waste of time. Our theoretical claims are supported through extensive numerical experiments which demonstrate an almost perfect match with our theory on a number of synthetic and real datasets.

연구 동기 및 목표

  • SGD, SAGA, 가속화된 SGD와 같은 인기 있는 분산 최적화 방법이 병렬 워커 수가 증가함에 따라 선형적으로 스케일업되지 않는 이유를 규명하는 것.
  • 모든 워커로부터 전체 기울기를 전송하는 표준 통신 패턴이 본질적으로 비효율적이고 불필요하다는 것을 입증하는 것.
  • 통신 오버헤드를 줄이되 이론적 수렴 속도를 유지하는 새로운 업데이트 스퍼스화 기법을 개발하는 것.
  • 각 워커당 m/n개의 블록만 전송하면 되며(전체 블록 수 m, 워커 수 n), n=100일 경우 통신의 99%가 불필요하다는 것을 보여주는 것.
  • 합성 및 실세계 데이터셋에 대한 광범위한 수치 실험을 통해 이론적 주장의 타당성을 검증하는 것.

제안 방법

  • 로컬 기울기 추정치에 대해 독립적인 스퍼스화를 적용한 후 통신하는 병렬 블록 좌표 강하의 새로운 변종을 제안한다.
  • 각 워커는 로컬 기울기 추정치를 계산한 후 총 파rameter 블록 수 m 중 m/n개의 블록만 마스터에게 전송한다.
  • 마스터는 스퍼스화된 블록을 집계하여 평균을 계산하고, 이를 모든 워커에게 브로드캐스트하여 모델 업데이트를 수행한다.
  • 분산 방법의 반복 복잡도가 통신량을 m/n개의 블록으로 줄여도 본질적으로 변화하지 않음을 보여주기 위해 분산 분산 감소 및 블록 단위 기대값 기반의 이론적 프레임워크를 사용한다.
  • SAGA 및 SGD와 같은 기존 알고리즘 위에 적용하여 통신량을 줄일 수 있으며, 핵심 최적화 논리에는 영향을 주지 않는다.
  • 기대 오차를 유한하게 제한하고 표준 가정(볼록성, 미분 가능성, 유한 분산) 하에서 수렴을 증명하기 위해 타워 성질과 조건부 기대값 분석을 활용한다.

실험 결과

연구 질문

  • RQ1표준 분산 최적화 방법이 병렬 워커 수 증가에 따라 선형적으로 스케일업되지 않는 이유는 무엇인가요?
  • RQ2분산 최적화에서 전체 기울기 통신이 얼마나 불필요한가요?
  • RQ3수렴 속도를 떨어뜨리지 않고 통신량을 99% 줄일 수 있나요?
  • RQ4어떤 스퍼스화 전략이 분산 블록 좌표 강하에서 수렴 보장을 유지합니까?
  • RQ5기존 방법과 비교할 때 제안된 방법은 통신 효율성과 반복 복잡도 측면에서 어떻게 다릅니까?

주요 결과

  • n=100명의 워커를 사용할 경우, 수렴 속도를 유지하기 위해 각 워커가 m/n개의 블록만 전송하면 되므로 기울기 블록의 99%가 불필요하다.
  • 이론적 분석 결과, 기존 분산 최적화 방법의 반복 복잡도는 통신량을 m/n개 블록으로 줄여도 본질적으로 영향을 받지 않는다.
  • 합성 및 실세계 데이터셋에 대한 수치 실험 결과 이론과 실무의 거의 완벽한 일치를 확인하였으며, 이는 제안된 방법의 효과성을 입증한다.
  • 제안된 스퍼스화 기법은 통신 오버헤드를 99% 줄일 수 있으며, 전체 기울기 방법과 동일한 수렴 속도를 유지한다.
  • SAGA, SGD, 가속화된 SGD와 같은 기존 알고리즘과 호환되어 즉각 통합이 가능하며 확장성을 향상시킬 수 있다.
  • 이론적 경계 분석 결과, 기대 오차는 전체 통신 방법과 유사한 속도로 감소하며, 스퍼스화로 인한 분산으로 인한 약간의 추가 항만 존재한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.