Skip to main content
QUICK REVIEW

[논문 리뷰] Fast Asynchronous Parallel Stochastic Gradient Decent

Shen-Yi Zhao, Wu-Jun Li|arXiv (Cornell University)|2015. 08. 24.
Stochastic Gradient Optimization Techniques참고 문헌 7인용 수 5
한 줄 요약

이 논문은 다중코어 환경에서 효율적인 다중코어 훈련을 가능하게 하기 위해 분산된 변동성 감소(SVRG) 프레임워크를 활용한 빠른 비동기 병렬 확률적 경사 하강법인 AsySVRG를 제안한다. 일관된 독서 및 일관되지 않은 독서 전략을 도입함으로써 AsySVRG는 선형 수렴성을 확보하고 실제 데이터셋에서 수렴 속도와 계산 비용 측면에서 Hogwild!를 능가한다.

ABSTRACT

Stochastic gradient descent~(SGD) and its variants have become more and more popular in machine learning due to their efficiency and effectiveness. To handle large-scale problems, researchers have recently proposed several parallel SGD methods for multicore systems. However, existing parallel SGD methods cannot achieve satisfactory performance in real applications. In this paper, we propose a fast asynchronous parallel SGD method, called AsySVRG, by designing an asynchronous strategy to parallelize the recently proposed SGD variant called stochastic variance reduced gradient~(SVRG). Both theoretical and empirical results show that AsySVRG can outperform existing state-of-the-art parallel SGD methods like Hogwild! in terms of convergence rate and computation cost.

연구 동기 및 목표

  • 다중코어 시스템에서 기존 병렬 SGD 방법의 성능 한계, 특히 최적화되지 않은 수렴 속도를 해결한다.
  • 대규모 경험적 리스크 최소화 문제의 수렴 속도와 계산 효율성을 향상시킨다.
  • 동기화 병목 현상은 피하면서도 수렴 보장을 유지하는 SVRG 알고리즘을 위한 비동기 병렬 전략을 설계한다.
  • 이론적 수렴 속도와 실증적 런타임 면에서 최신 기술인 Hogwild!를 능가하는 성능을 입증한다.

제안 방법

  • 잠금 없이 공유 파라미터를 업데이트하는 다수의 스레드를 조율하기 위해 일관된 독서 및 일관되지 않은 독서 전략을 포함한 두 가지 비동기 스킴을 제안한다.
  • 주기적으로 전체 기울기의 스냅샷을 사용해 제어 변수를 계산함으로써 SVRG 알고리즘을 적응시킨다.
  • 비동기 환경에서 오래된 기울기를 보정하기 위해 업데이트 규칙 $\mathbf{v}_m = \nabla f_{i_m}(\mathbf{u}_{k(m)}) - \nabla f_{i_m}(\mathbf{u}_0) + \nabla f(\mathbf{u}_0)$ 를 사용한다.
  • 스레드들이 독립적으로 데이터 인스턴스를 샘플링하고 공유 메모리 모델에서 글로벌 파라미터 벡터를 비동기적으로 업데이트한다.
  • p개의 스레드에서 수렴성과 계산 비용을 균형 있게 유지하기 위해 내부 루프 길이 $M = \frac{2n}{p}$ 로 설정한다.
  • 일정한 단계 크기 $\gamma$ 를 사용하며, 에포크마다 적응적으로 감쇠($\gamma \leftarrow 0.9\gamma$)하여 실용적 수렴성을 향상시킨다.

실험 결과

연구 질문

  • RQ1비동기 SVRG의 변종은 다중코어 시스템에서 기존의 병렬 SGD 방법들, 예를 들어 Hogwild!보다 더 빠른 수렴을 달성할 수 있는가?
  • RQ2AsySVRG의 일관된 독서 및 일관되지 않은 독서 전략은 비동기 상태에서도 선형 수렴성을 유지하는가?
  • RQ3실제 데이터셋에서 AsySVRG는 계산 비용과 수렴 속도 측면에서 Hogwild!와 비교해 어떻게 다른가?
  • RQ4잠금 없는 업데이트 전략과 잠금이 있는 업데이트 전략은 비동기 SVRG의 성능에 어떤 영향을 미치는가?
  • RQ5AsySVRG는 Hogwild!보다 더 적은 데이터 통과 횟수로 더 빠른 수렴을 달성할 수 있는가?

주요 결과

  • rcv1 데이터셋에서 AsySVRG-unlock(일관되지 않은 독서)는 10개 스레드에서 5.77배의 속도 향상을 기록했으며, 동일 작업에서 Hogwild!는 200초 이상 소요되어 이를 능가했다.
  • news20 데이터셋에서 AsySVRG-unlock는 $10^{-4}$의 갭을 달성하는 데 514.50초가 소요되었고, Hogwild!는 2000초를 초과하여 런타임 면에서 뚜렷한 우위를 보였다.
  • rcv1에서 AsySVRG-lock는 8개 스레드에서 4.92배의 속도 향상을 기록했고, Hogwild!는 10개 스레드에서 500초 이상 소요되어 AsySVRG의 뛰어난 효율성을 입증했다.
  • 그림 1에서 볼 수 있듯이, AsySVRG의 수렴 속도는 Hogwild!보다 빠르며, 더 적은 유효 통과 횟수로 낮은 목적 함수 값을 달성한다.
  • 실제로 일관된 독서 전략은 가장 낮은 성능을 보였으며, AsySVRG-lock와 AsySVRG-unlock보다 더 긴 런타임을 기록하여 비동기 환경에서의 비효율성을 보여주었다.
  • 이론적으로 증명된 Liner convergence는 AsySVRG가 일관된 독서 및 일관되지 않은 독서 모두에서 유지되며, 반면 Hogwild!는 선형 수렴이 아닌 부분선형 수렴에 그친다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.