Skip to main content
QUICK REVIEW

[논문 리뷰] DAve-QN: A Distributed Averaged Quasi-Newton Method with Local Superlinear Convergence Rate

Saeed Soori, Konstantin Mischenko|arXiv (Cornell University)|2019. 06. 03.
Stochastic Gradient Optimization Techniques참고 문헌 46인용 수 14
한 줄 요약

이 논문은 마스터/워커 아키텍처 하에서 경험적 리스크 최소화를 위한 초기의 분산 비동기 퀼-뉴턴 알고리즘인 DAve-QN을 제안한다. 국소 헤시안 근사와 기울기 평균화를 활용하고, 통신 효율적인 $O(p)$ 벡터 교환을 통해, 작은 스텝사이즈가 필요 없이 큰 지연 상황에서도 초선형 수렴을 달성한다. 실험적으로 최신 기술을 능가한다.

ABSTRACT

In this paper, we consider distributed algorithms for solving the empirical risk minimization problem under the master/worker communication model. We develop a distributed asynchronous quasi-Newton algorithm that can achieve superlinear convergence. To our knowledge, this is the first distributed asynchronous algorithm with superlinear convergence guarantees. Our algorithm is communication-efficient in the sense that at every iteration the master node and workers communicate vectors of size $O(p)$, where $p$ is the dimension of the decision variable. The proposed method is based on a distributed asynchronous averaging scheme of decision vectors and gradients in a way to effectively capture the local Hessian information of the objective function. Our convergence theory supports asynchronous computations subject to both bounded delays and unbounded delays with a bounded time-average. Unlike in the majority of asynchronous optimization literature, we do not require choosing smaller stepsize when delays are huge. We provide numerical experiments that match our theoretical results and showcase significant improvement comparing to state-of-the-art distributed algorithms.

연구 동기 및 목표

  • 마스터/워커 아키텍처 하에서 대규모 경험적 리스크 최소화를 위한 통신 효율적인 분산 최적화 알고리즘을 개발하는 것.
  • 기존 문헌에서 드물게 나타나는 분산 비동기 설정에서 초선형 수렴을 달성하는 것.
  • 작은 스텝사이즈가 필요 없이, 유한한 평균 시간 지연이 있는 경우 유한한 지연과 무한한 지연 모두를 지원하는 것.
  • 각 반복에서 $O(p)$의 통신 비용을 유지하면서 기울기 평균화를 통해 국소 헤시안 정보를 포착하는 것.
  • 수치 실험에서 최신 기술적 분산 알고리즘보다 뚜렷한 성능 향상을 보여주는 것.

제안 방법

  • 알고리즘은 워커와 마스터 노드 간의 결합된 결정 벡터와 기울기 정보를 통합하기 위해 분산 비동기 평균화 기반의 방식을 사용한다.
  • 기울기 차이를 이용해 각 워커의 목적 함수에 대한 국소 헤시안 정보를 근사함으로써, 퀼-뉴턴 업데이트를 가능하게 한다.
  • 마스터 노드는 전역 반복값을 유지하고, 집계된 기울기 및 변수 차이를 기반으로 BFGS 유사 업데이트 규칙을 적용하여 업데이트한다.
  • 통신은 각 반복에서 오직 $O(p)$ 크기의 벡터만을 전송함으로써 통신 효율성을 확보한다.
  • 알고리즘은 유한 지연과 유한 평균 시간 지연이 있는 무한 지연 모두를 지원하며, 스텝사이즈 조정이 필요 없이 작동한다.
  • 초기 단계에서 반복 복잡도를 향상시키기 위해 선 탐색 기법을 사용하여 초기 스텝사이즈를 조정한다.

실험 결과

연구 질문

  • RQ1분산 비동기 퀸-뉴턴 방법이 경험적 리스크 최소화에서 초선형 수렴을 달성할 수 있는가?
  • RQ2유한한 평균 시간 지연이 있는 무한 지연 상황에서도 스텝사이즈를 줄이지 않고 초선형 수렴을 유지할 수 있는가?
  • RQ3분산 환경에서 초선형 수렴을 달성하면서도 $O(p)$의 통신 비용을 유지할 수 있는가?
  • RQ4수렴 속도와 통신 비용 측면에서, DANE와 DAve-RPG와 같은 1차 방법에 비해 알고리즘이 어떻게 성능을 발휘하는가?
  • RQ5국소 샘플 크기 $m_i$가 수렴과 통신 복잡도에 미치는 영향은 무엇인가?

주요 결과

  • DAve-QN은 분산 비동기 설정에서 최초로 초선형 수렴을 달성하여, 선형 수렴을 보이는 1차 방법보다 뛰어난 성능을 보였다.
  • 알고리즘은 유한 지연과 유한 평균 시간 지연이 있는 무한 지연 상황 모두에서 초선형 수렴을 유지하며, 고지연 상황에서도 작은 스텝사이즈가 필요하지 않다.
  • 수치 실험 결과, cifar10를 제외한 모든 데이터셋에서 DANE와 DAve-RPG를 뛰어넘는 성능 향상을 보였다. cifar10에서는 초기 진전이 더 빠르지만, 각 반복 비용이 높아 성능이 저하되었다.
  • mnist8m와 epsilon 데이터셋에서는 DANE와 DAve-RPG보다 더 빠른 수렴 속도를 보였으며, 이는 이론적 초선형 수렴 속도를 검증하는 데 기여했다.
  • 알고리즘의 각 반복당 $O(p^2)$ 계산 비용은, 특히 조건이 나쁜 문제에서 더 빠른 수렴으로 인해 상쇄된다.
  • 코드는 GitHub에 공개되어 있어 재현성과 향후 벤치마킹을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.