Skip to main content
QUICK REVIEW

[논문 리뷰] Distributed Variance Reduction with Optimal Communication

Peter Maxwell Davies, Vijaykrishna Gurunathan|arXiv (Cornell University)|2020. 02. 21.
Stochastic Gradient Optimization Techniques참고 문헌 11인용 수 8
한 줄 요약

이 논문은 출력 분산이 입력 벡터 노름에 의존하지 않도록 분리하는 새로운 분산 분산 감소 방법을 제안한다. 이는 모든 영역에서 최적의 통신 효율성을 가능하게 한다. 노름에 영향을 받지 않는 양자화 기법을 도입함으로써, 출력 분산이 입력 분산에만 의존하는 결과를 이끌어내며, 이는 큰 노름에서 성능이 급격히 떨어지는 기존 방법들보다 뛰어나다.

ABSTRACT

We consider the problem of distributed variance reduction: $n$ machines each receive probabilistic estimates of an unknown true vector $\Delta$, and must cooperate to find a common estimate of $\Delta$ with lower variance, while minimizing communication. Variance reduction is closely related to the well-studied problem of distributed mean estimation, and is a key procedure in instances of distributed optimization, such as data-parallel stochastic gradient descent. Previous work typically assumes an upper bound on the norm of the input vectors, and achieves an output variance bound in terms of this norm. However, in real applications, the input vectors can be concentrated around the true vector $\Delta$, but $\Delta$ itself may have large norm. In this case, output variance bounds in terms of input norm perform poorly, and may even increase variance. In this paper, we show that output variance need not depend on input norm. We provide a method of quantization which allows variance reduction to be performed with solution quality dependent only on input variance, not on input norm, and show an analogous result for mean estimation. This method is effective over a wide range of communication regimes, from sublinear to superlinear in the dimension. We also provide lower bounds showing that in many cases the communication to output variance trade-off is asymptotically optimal. Further, we show experimentally that our method yields improvements for common optimization tasks, when compared to prior approaches to distributed mean estimation.

연구 동기 및 목표

  • 기존 분산 분산 감소 방법이 큰 입력 벡터 노름에서 성능이 급격히 떨어지는 한계를 해결하기 위해.
  • 출력 분산이 입력 분산에만 의존하고 입력 노름에 의존하지 않는 통신 효율적인 방법을 설계하기 위해.
  • 통신-분산 상호보완성의 이론적 하한을 설정하여, 점점 더 최적임을 증명하기 위해.
  • 데이터-병렬 SGD와 같은 일반적인 최적화 작업에서의 경험적 우수성을 입증하기 위해.

제안 방법

  • 출력 분산이 입력 벡터 노름에 의존하지 않는 새로운 양자화 기법을 제안한다.
  • 하향선형에서 초선형 통신 영역에 걸쳐 효과적으로 작동하는 노름에 영향을 받지 않는 분산 감소 프로토콜을 도입한다.
  • 분산 성질을 유지하면서 통신량을 최소화하기 위해 랜덤화된 양자화 메커니즘을 사용한다.
  • 분산 평균 추정에 적용하여 성능 보장을 동일하게 유지함을 보여준다.
  • 통신 복잡도와 출력 분산에 대한 이론적 경계를 유도하며, 많은 영역에서 최적임을 증명한다.
  • 제한된 통신 환경에서도 정확도를 유지하기 위해 양자화된 업데이트를 사용하는 재귀적 평균 전략을 활용한다.

실험 결과

연구 질문

  • RQ1진정한 벡터의 노름이 크더라도, 분산 감소가 입력 벡터 노름에 영향을 받지 않도록 만들 수 있는가?
  • RQ2분산 평균 추정에서 통신 비용과 출력 분산 사이의 최적 상호보완성은 무엇인가?
  • RQ3양자화 기반 방법이 다양한 통신 영역에서 통신-분산 상호보완성의 점근적 최적성을 달성할 수 있는가?
  • RQ4제안된 방법은 실제 최적화 워크로드에서 기존 방법들과 비교해 경험적으로 어떻게 성능을 냅니다?

주요 결과

  • 제안된 방법은 출력 분산이 진짜 벡터 Δ의 노름에 의존하지 않고 입력 분산에만 의존함을 입증한다.
  • 이론적 하한을 통해 많은 영역에서 점점 더 최적의 통신-분산 상호보완성을 제공함을 확인하였다.
  • 경험적 결과는 기존 방법들보다 데이터-병렬 SGD와 같은 분산 최적화 작업에서 일관된 개선을 보였다.
  • 이 방법은 차원에 대해 하향선형에서 초선형에 이르기까지 광범위한 통신 영역에서 효과적이다.
  • 입력 벡터가 Δ 주변에 집중되어 있어도, 양자화가 노름에 의존하는 분산의 급격한 증가를 제거하는 데 충분함을 입증하였다.
  • 이론적 분석을 통해 이 방법이 분산 감소에서 통신 효율의 기본 한계에 부합함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.