Skip to main content
QUICK REVIEW

[논문 리뷰] Communication-Efficient Distributed Learning via Lazily Aggregated Quantized Gradients

Jun Sun, Tianyi Chen|arXiv (Cornell University)|2019. 09. 17.
Stochastic Gradient Optimization Techniques인용 수 39
한 줄 요약

LAQ는 그래디언트 혁신 기반 양자화와 지연 집계를 도입하여 강하게 볼록한 손실에 대해 선형 수렴을 유지하면서 통신 비트수와 라운드를 모두 줄인다.

ABSTRACT

The present paper develops a novel aggregated gradient approach for distributed machine learning that adaptively compresses the gradient communication. The key idea is to first quantize the computed gradients, and then skip less informative quantized gradient communications by reusing outdated gradients. Quantizing and skipping result in `lazy' worker-server communications, which justifies the term Lazily Aggregated Quantized gradient that is henceforth abbreviated as LAQ. Our LAQ can provably attain the same linear convergence rate as the gradient descent in the strongly convex case, while effecting major savings in the communication overhead both in transmitted bits as well as in communication rounds. Empirically, experiments with real data corroborate a significant communication reduction compared to existing gradient- and stochastic gradient-based algorithms.

연구 동기 및 목표

  • 많은 작업자와 함께하는 분산 학습에서 의사소통 병목을 줄이고자 하는 동기 부여.
  • 수렴 보장을 잃지 않으면서 그래디언트를 압축하고 업로드 라운드를 줄이는 방법 개발.
  • 의사소통 자원을 절약하면서 경사하강법과 유사한 수렴을 달성.
  • 이론적 보장과 실제 데이터셋에 대한 실증 검증 제공.

제안 방법

  • 전체 그래디언트 대신 그래디언트 혁신을 양자화하여 업로드당 비트를 줄인다.
  • 서버에서 오래된 그래디언트를 재사용하고 선택된 일부 작업자의 그래디언트 혁신만 업로드한다(지연 집계).
  • 그래디언트 차이와 매개변수 차이를 기반으로 각 이터레이션에서 어떤 작업자가 업로드할지 결정하는 선택 기준을 정의한다.
  • 양자화 오차를 수반하는 강하게 볼록성 하에서 LAQ의 선형 수렴을 증명한다.
  • 과거 이터레이트와 양자화 오차를 포함하는 Lyapunov 함수를 통해 수렴을 분석한다.

실험 결과

연구 질문

  • RQ1강하게 볼록한 손실에 대해 그래디언트 양자화와 게으른 집계가 GD와 동일한 선형 수렴을 달성할 수 있는가?
  • RQ2그래디언트 혁신 기반 업로드가 통신 라운드와 전송 비트에 미치는 영향은 무엇인가?
  • RQ3수렴을 보존하면서 각 이터레이션에서 어떤 작업자가 업로드할지 결정할 신뢰할 수 있는 기준을 어떻게 설계할 것인가?
  • RQ4양자화 오차가 존재할 때 이론적 보장(수렴 속도)은 무엇인가?
  • RQ5실제 데이터셋에서 LAQ가 GD, QGD, LAG에 비해 어떤 성능을 보이는가?

주요 결과

  • LAQ는 양자화 및 업로드 건너뜀에도 불구하고 μ-강하게 볼록한 f(·)에서 최적점으로의 선형 수렴을 달성한다.
  • LAQ는 GD 및 QGD에 비해 통신 라운드와 총 비트를 모두 줄이면서 정확도를 유지한다.
  • 로지스틱 회귀 및 신경망에 대해 LAQ가 GD 및 QGD보다 더 적은 통신 라운드를 요구하고 LAG보다 적은 비트를 필요로 하며 비슷한 정확도를 보였다.
  • SLAQ(확률적 변형)은 추가로 통신 라운드와 비트를 줄여 주어진 시나리오에서 QSGD 및 SSGD를 능가한다.
  • 이론적 분석은 Lyapunov 기반의 수렴 보장과 양자화 오차 증가에 대한 상한을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.