Skip to main content
QUICK REVIEW

[논문 리뷰] Consistent Bounded-Asynchronous Parameter Servers for Distributed ML

Jinliang Wei, Wei Dai|arXiv (Cornell University)|2013. 12. 30.
Interconnection Networks and Systems참고 문헌 10인용 수 6
한 줄 요약

이 논문은 분산 기계 학습에서 이방성 파라미터 서버를 위한 유연한 일致성 모델(CAP, VAP, CVAP)을 제안하며, 이는 높은 처리량을 유지하면서도 이론적 수렴을 보장한다. 정지 시간을 제한하고 벡터 시계를 사용하여 반복적 기계 학습 알고리즘(예: LDA)에서 알고리즘적 정확성을 유지하며, 최대 32개의 코어를 가진 소규모 클러스터에서 강력한 확장성을 달성한다.

ABSTRACT

In distributed ML applications, shared parameters are usually replicated among computing nodes to minimize network overhead. Therefore, proper consistency model must be carefully chosen to ensure algorithm's correctness and provide high throughput. Existing consistency models used in general-purpose databases and modern distributed ML systems are either too loose to guarantee correctness of the ML algorithms or too strict and thus fail to fully exploit the computing power of the underlying distributed system. Many ML algorithms fall into the category of \emph{iterative convergent algorithms} which start from a randomly chosen initial point and converge to optima by repeating iteratively a set of procedures. We've found that many such algorithms are to a bounded amount of inconsistency and still converge correctly. This property allows distributed ML to relax strict consistency models to improve system performance while theoretically guarantees algorithmic correctness. In this paper, we present several relaxed consistency models for asynchronous parallel computation and theoretically prove their algorithmic correctness. The proposed consistency models are implemented in a distributed parameter server and evaluated in the context of a popular ML application: topic modeling.

연구 동기 및 목표

  • 분산 기계 학습에서 시스템 처리량과 알고리즘 정확성 간의 상충 관계를 완화하기 위해 일치성 모델을 유연화함으로써 해결하고자 한다.
  • 반복적 기계 학습 알고리즘에서 수렴 보장을 유지하면서도 고성능 비동기 계산을 가능하게 하고자 한다.
  • 정지 시간을 제한하고 실질적인 배포를 가능하게 하는 일치성 모델을 설계하고자 한다.
  • 주제 모델링(LDA)에서 제안된 모델을 평가하여 클러스터에서 강력한 확장성을 입증하고자 한다.

제안 방법

  • 모든 시점에 업데이트를 允가하면서 벡터 시계를 사용해 정지 시간을 제한하는 Clock-bounded Asynchronous Parallel (CAP) 모델을 제안한다.
  • 진행 상황을 추적하고 일치성의 유계를 보장하기 위해 벡터 시계를 사용하는 Vector-based Asynchronous Parallel (VAP)을 도입한다.
  • 일致성 보장을 결합한 고처리량을 실현하는 강력한 변종인 Consistent Vector-based Asynchronous Parallel (CVAP)을 개발한다.
  • 네트워크 오버헤드를 줄이기 위해 이중 캐시 계층과 메시지 배치 기능을 갖춘 Petuum PS에 모델을 구현한다.
  • 각 테이블에 대해 다른 일치성 모델을 모듈러하게 지원하기 위해 일치성 제어기와 정책 기반 API 의미 체계를 사용한다.
  • 우선순위 기반 배치를 사용해 클라이언트 푸시, 클라이언트 풀, 서버 푸시 메시징을 최적화하여 네트워크 활용도를 향상시킨다.

실험 결과

연구 질문

  • RQ1정지 시간을 유계로 제한하는 유연한 일치성 모델이 LDA와 같은 분산 기계 학습 알고리즘에서 수렴을 보장할 수 있는가?
  • RQ2엄격한 모델(예: SSP 또는 순차 일치성)과 비교했을 때, 유계 비동기 일치성은 처리량과 수렴 속도 측면에서 어떻게 성능을 내는가?
  • RQ3알고리즘적 정확성을 훼손하지 않으면서도 일치성의 유연화로 얼마나 높은 시스템 성능 향상을 기대할 수 있는가?
  • RQ4제안된 모델은 실제 워크로드를 가진 실세계 클러스터에서 효율적으로 확장 가능한가?

주요 결과

  • 제안된 일치성 모델(CAP, VAP, CVAP)은 반복적 기계 학습 알고리즘에서 고처리량 비동기 계산을 가능하게 하며, 수렴 보장을 보장한다.
  • 8개 노드 클러스터에서 최대 32개의 코어를 사용하여 주제 모델링 워크로드에서 선형 확장에 가까운 속도 향상을 달성한다.
  • 2,000개 주제와 11,269개 문서를 가진 20News 데이터셋에서의 실험 결과, 약한 일치성 모델 하에서도 안정적인 수렴이 관찰되었다.
  • 벡터 시계와 정지 시간의 유계 제한 덕분에 모든 업데이트가 결국 모두가 인지하게 되어, 비동기성에도 불구하고 발산을 방지한다.
  • 메시지 배치와 이중 캐시 계층이 네트워크 경쟁을 크게 줄이고 지연을 숨기는 데 기여했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.