Skip to main content
QUICK REVIEW

[논문 리뷰] Linearly Converging Error Compensated SGD

Eduard Gorbunov, Dmitry Kovalev|arXiv (Cornell University)|2020. 10. 23.
Stochastic Gradient Optimization Techniques참고 문헌 10인용 수 13
한 줄 요약

이 논문은 오차 보상, 압축, 지연 업데이트를 갖춘 분산 확률적 최적화 방법을 분석하기 위한 통합 이론적 프레임워크를 제안한다. EC-SGD-DIANA 및 EC-LSVRG-DIANA와 같은 새로운 변종에 대해 선형 수렴성을 증명하며, 일반적인 압축과 분산 감소 조건 하에서 강凸 및 강凸 문제에 대해 일정 학습률로 정확한 수렴을 달성한다.

ABSTRACT

In this paper, we propose a unified analysis of variants of distributed SGD with arbitrary compressions and delayed updates. Our framework is general enough to cover different variants of quantized SGD, Error-Compensated SGD (EC-SGD) and SGD with delayed updates (D-SGD). Via a single theorem, we derive the complexity results for all the methods that fit our framework. For the existing methods, this theorem gives the best-known complexity results. Moreover, using our general scheme, we develop new variants of SGD that combine variance reduction or arbitrary sampling with error feedback and quantization and derive the convergence rates for these methods beating the state-of-the-art results. In order to illustrate the strength of our framework, we develop 16 new methods that fit this. In particular, we propose the first method called EC-SGD-DIANA that is based on error-feedback for biased compression operator and quantization of gradient differences and prove the convergence guarantees showing that EC-SGD-DIANA converges to the exact optimum asymptotically in expectation with constant learning rate for both convex and strongly convex objectives when workers compute full gradients of their loss functions. Moreover, for the case when the loss function of the worker has the form of finite sum, we modified the method and got a new one called EC-LSVRG-DIANA which is the first distributed stochastic method with error feedback and variance reduction that converges to the exact optimum asymptotically in expectation with a constant learning rate.

연구 동기 및 목표

  • 분산 및 페더레이티드 학습에서의 통신 병목 현상을 해결하기 위해 효율적인 기울기 압축과 오차 피드백을 가능하게 한다.
  • 양자화된 SGD, EC-SGD, D-SGD와 같은 기존 방법들을 단일 이론적 프레임워크로 통합한다.
  • 오차 피드백과 분산 감소, 임의의 샘플링을 조합한 새로운 알고리즘을 개발하여 수렴 속도를 향상시킨다.
  • 일정 학습률 하에서 EC-SGD-DIANA 및 EC-LSVRG-DIANA와 같은 새로운 방법에 대해 선형 수렴 보장을 수립한다.
  • 모든 프레임워크 내 방법에 대해 날카로운 복잡도 상한을 제공하며, 기존 최고 수준의 결과를 향상시킨다.

제안 방법

  • 오차 피드백과 압축된 업데이트를 갖춘 일반적인 반복적 절차를 제안: $ x^{k+1} = x^k - \frac{1}{n}\sum_{i=1}^n v_i^k $, $ e_i^{k+1} = e_i^k + \gamma g_i^k - v_i^k $, 여기서 $ v_i^k $는 압축된 업데이트이다.
  • 모든 방법이 이 절차에 부합하는 경우를 수반하는 단일 정리 기반의 통합 분석 프레임워크를 도입한다.
  • 압축률 $ \delta $와 분산 파라미터 $ \omega $를 갖는 일반적인 압축기 클래스를 정의하여 편향 및 비편향 압축의 분석을 가능하게 한다.
  • 편향 압축 연산자와 기울기 차이의 양자화를 사용한 오차 피드백을 갖춘 EC-SGD-DIANA를 설계하여 정확한 수렴을 가능하게 한다.
  • 오차 피드백과 분산 감소(LSVRG) 및 압축을 조합한 EC-LSVRG-DIANA를 개발하여 일정 단계 크기로 선형 수렴을 달성한다.
  • 오차 허용도 $ \varepsilon $, 미세도 $ L $, 조건수 $ \kappa $, 기울기 분산을 바탕으로 복잡도 상한을 유도하며, 향상된 수렴 속도를 보여준다.

실험 결과

연구 질문

  • RQ1압축, 지연 업데이트, 오차 피드백를 갖춘 분산 SGD의 분석을 통합할 수 있는 단일 이론적 프레임워크가 존재하는가?
  • RQ2오차 보상과 분산 감소 및 압축을 조합한 새로운 방법의 수렴 속도는 어떠한가?
  • RQ3EC-SGD-DIANA는 일반적인 압축 조건 하에서 일정 학습률로 정확한 최적값으로 선형 수렴을 달성할 수 있는가?
  • RQ4EC-LSVRG-DIANA는 일정 단계 크기로 분산 감소와 오차 피드백를 유지하면서 정확한 최적값으로 선형 수렴을 달성할 수 있는가?
  • RQ5기존 최고 수준의 접근 방식과 비교해보았을 때, 새로운 방법들은 통신 효율성과 수렴 속도 측면에서 어떻게 성능을 내는가?

주요 결과

  • 제안된 프레임워크는 EC-SGD 및 D-SGD와 같은 기존 방법에 대해 가장 우수한 알려진 복잡도 상한을 도출한다.
  • EC-SGD-DIANA는 강凸 및 강凸 문제에 대해 일정 학습률로 정확한 최적값으로 선형 수렴을 달성하는 첫 번째 방법이며, 오차 피드백과 편향 압축을 갖춘다.
  • EC-LSVRG-DIANA는 워커가 전체 기울기를 계산할 경우, 오차 피드백과 분산 감소를 갖춘 첫 번째 분산 확률적 방법으로, 일정 단계 크기로 정확한 최적값으로 선형 수렴을 달성한다.
  • 프레임워크를 통해 날카로운 복잡도 상한을 도출할 수 있었으며, 강凸 설정에서 $ \varepsilon $-정확도를 확보하기 위해 $ \mathcal{O}\left(\frac{1}{\varepsilon}\right) $의 반복 복잡도를 보였다.
  • EC-LSVRG-DIANA 방법은 일정 단계 크기로 $ \mathcal{O}\left(\frac{1}{\varepsilon}\right) $의 복잡도를 달성하며, 이는 이전 방법들이 감소하는 단계 크기를 요구했던 것에 비해 향상된 결과이다.
  • 프레임워크는 임의의 샘플링과 양자화를 갖는 변종 포함 총 16개의 새로운 방법을 지원하며, 모두 증명 가능한 선형 수렴 보장을 갖춘다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.