Skip to main content
QUICK REVIEW

[논문 리뷰] LASG: Lazily Aggregated Stochastic Gradients for Communication-Efficient Distributed Learning

Tianyi Chen, Yuejiao Sun|arXiv (Cornell University)|2020. 02. 26.
Stochastic Gradient Optimization Techniques참고 문헌 31인용 수 14
한 줄 요약

이 논문은 동적 혁신 기반 조건에 기반해 신선한 또는 오래된 기울기를 선택적으로 사용함으로써 부정확한 기울기 전송을 적극적으로 생략하는 통신 효율적인 분산 학습을 위한 확률적 최적화 방법인 LASG를 제안한다. LASG는 표준 SGD와 유사한 수렴 속도를 확보하면서도 실질적으로 통신 비용이 10배까지 감소시키며, 특히 높은 통신 비용이 수반되는 페더레이티드 및 분산 학습 환경에서 매우 효과적이다.

ABSTRACT

This paper targets solving distributed machine learning problems such as federated learning in a communication-efficient fashion. A class of new stochastic gradient descent (SGD) approaches have been developed, which can be viewed as the stochastic generalization to the recently developed lazily aggregated gradient (LAG) method --- justifying the name LASG. LAG adaptively predicts the contribution of each round of communication and chooses only the significant ones to perform. It saves communication while also maintains the rate of convergence. However, LAG only works with deterministic gradients, and applying it to stochastic gradients yields poor performance. The key components of LASG are a set of new rules tailored for stochastic gradients that can be implemented either to save download, upload, or both. The new algorithms adaptively choose between fresh and stale stochastic gradients and have convergence rates comparable to the original SGD. LASG achieves impressive empirical performance --- it typically saves total communication by an order of magnitude.

연구 동기 및 목표

  • 서버와 워커 간 빈번한 모델 파라미터 교환으로 인해 성능이 저하되는 분산 및 페더레이티드 기계학습 환경에서 높은 통신 오버헤드 문제를 해결하기 위해.
  • 수렴 속도를 희생시키지 않고 무의미한 통신 라운드를 지능적으로 생략할 수 있는 확률적 기울기 방법을 개발하기 위해.
  • 서버 및 워커 측면의 계산에 맞게 조정된, 적응형이고 경량의 조건을 설계하여 언제 신선한 기울기를 전송할지, 언제 오래된 기울기를 재사용할지 결정하기 위해.
  • 분산 최적화에서 총 통신 비용을 크게 줄이면서도 표준 SGD와 유사한 수렴 보장을 유지하기 위해.
  • 동일한 데이터 분할 방식(균형 및 비균형)을 포함한 다양한 데이터셋과 환경에서 실험적으로 평가하기 위해.

제안 방법

  • LASG는 각 반복에서 워커로부터 유의미한 기울기 혁신(기존 기울기와의 차이)을 선택적으로 수신하여 글로벌 기울기 추정치를 유지하고 업데이트하는 게으른 집계 전략을 사용한다.
  • 이 방법은 현재 기울기와 이전에 사용된 기울기 간의 크기를 평가하는 조건에 기반해 어떤 워커와 통신할지를 동적으로 선택한다.
  • 두 가지 적응형 통신 규칙이 제안되며, 하나는 워커에서 실행되는 LASG-WK, 다른 하나는 서버에서 실행되는 LASG-PS로, 통신, 계산 및 메모리 사용에 유연성을 제공한다.
  • 기울기의 오래됨 정도는 각 워커별로 추적되며, 워커가 생략되면 그 기울기의 오래됨 정도가 증가하고 재접속 시 초기화된다.
  • 알고리즘은 유의미한 기울기 변화만 전송함으로써 수렴을 유지하며, 이는 불필요한 통신을 줄이고 최적화 진행 상황을 유지하는 데 기여한다.
  • 이론적 분석 결과, LASG는 약한 가정 하에 표준 SGD와 동일한 수렴 속도를 확보하며, 기대적 부적합도에 대한 명시적 경계를 제공한다.

실험 결과

연구 질문

  • RQ1수렴 성능 저하 없이 분산 학습에서 통신 오버헤드를 줄일 수 있는 확률적 기울기 방법을 설계할 수 있는가?
  • RQ2어떻게 적응형이고 경량적인 조건을 사용하여 분산 확률적 최적화 환경에서 기울기 업데이트를 생략하거나 전송할지를 결정할 수 있는가?
  • RQ3신선한 기울기 대신 오래된 기울기를 사용할 경우 수렴에 어떤 영향을 미치며, 이를 어떻게 제어하여 성능을 유지할 수 있는가?
  • RQ4SGD, 로컬 SGD, QSGD, LAG와 같은 기존 방법들과 비교할 때 LASG는 통신 효율성과 최종 목적 함수 값 측면에서 어떤가?
  • RQ5LASG는 균형 및 비균형 데이터 분할 환경 모두에서 수렴 보장을 유지할 수 있는가?

주요 결과

  • LASG는 ijcnn1, MNIST, covtype 등 다양한 데이터셋에서 표준 SGD 대비 총 통신량을 최대 한 단계 감소시킨다.
  • ijcnn1에서 로지스틱 회귀 작업에서 LASG는 1000라운드 후 목적 함수 값 0.2252를 달성하여 SGD(0.4276)와 LAG-WK(0.3352)를 모두 능가한다.
  • 신경망을 사용한 MNIST에서 LASG는 10,000회의 통신 라운드 후 테스트 목적 함수 값 0.0395를 기록하며, SGD(0.1612)와 로컬 SGD(0.2388)를 크게 앞서간다.
  • 비균형 데이터 환경에서는 LASG가 강력한 성능을 유지하며, ijcnn1에서 100,000비트 업로드 후 목적 함수 값 0.2296, MNIST에서는 0.1710을 기록하여 QSGD와 LAQSG를 능가한다.
  • 이론적 분석 결과, LASG는 표준 SGD와 동일한 수렴 속도를 확보하며, 일정 단계 크기일 경우 기대적 부적합도가 O(1/K)로 경계되고, 점차 감소하는 단계 크기일 경우 O(1/√K)로 경계된다.
  • 실험 결과, LASG-WK 및 LASG-PS 버전 모두 유사한 성능을 보이며, 특히 초기 반복에서 LASG-PS가 약간 더 뛰어난 수렴 성능를 나타낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.