Skip to main content
QUICK REVIEW

[논문 리뷰] Sparse Allreduce: Efficient Scalable Communication for Power-Law Data

Huasha Zhao, John Canny|arXiv (Cornell University)|2013. 12. 11.
Graph Theory and Algorithms참고 문헌 24인용 수 10
한 줄 요약

이 논문은 힘의 법칙 분포를 따르는 데이터를 위한 분산 기계학습에서 통신 최적화를 위한 프리미티브인 Sparse Allreduce를 제안한다. 하이브리드 버블리-라운드로빈 네트워크 아키텍처를 사용하며, 중첩된 통신 및 이질적인 노드 차수를 적용한다. 이는 희소한 특성 인식 기반의 데이터 전송을 통해 통신 오버헤드를 줄여, Hadoop 및 PowerGraph 대비 최대 10배의 성능 향상을 달성한다.

ABSTRACT

Many large datasets exhibit power-law statistics: The web graph, social networks, text data, click through data etc. Their adjacency graphs are termed natural graphs, and are known to be difficult to partition. As a consequence most distributed algorithms on these graphs are communication intensive. Many algorithms on natural graphs involve an Allreduce: a sum or average of partitioned data which is then shared back to the cluster nodes. Examples include PageRank, spectral partitioning, and many machine learning algorithms including regression, factor (topic) models, and clustering. In this paper we describe an efficient and scalable Allreduce primitive for power-law data. We point out scaling problems with existing butterfly and round-robin networks for Sparse Allreduce, and show that a hybrid approach improves on both. Furthermore, we show that Sparse Allreduce stages should be nested instead of cascaded (as in the dense case). And that the optimum throughput Allreduce network should be a butterfly of heterogeneous degree where degree decreases with depth into the network. Finally, a simple replication scheme is introduced to deal with node failures. We present experiments showing significant improvements over existing systems such as PowerGraph and Hadoop.

연구 동기 및 목표

  • 웹 그래프, 소셜 네트워크, 텍스트 데이터 등에서 흔히 볼 수 있는 힘의 법칙 데이터셋에서 분산 기계학습 및 그래프 알고리즘의 통신 병목 현상을 해결한다.
  • 불필요한 데이터 전송을 최소화하여 희소하고 비정규적인 데이터에 대해 Allreduce 성능을 향상시킨다.
  • 희소 행렬 연산과 PageRank, 확률적 경사 하강법과 같은 반복 알고리즘에 특화된 확장성 있고 장애 내성 있는 통신 프리미티브를 설계한다.
  • 네트워크 토폴로지와 통신 패턴을 최적화하여 일반 장비 클러스터에서 지연 시간을 줄이고 처리량을 향상시킨다.

제안 방법

  • 희소 Allreduce에서 부하 균형과 혼잡도 감소를 위해 버블리와 라운드로빈 아키텍처를 융합한 하이브리드 네트워크 토폴로지를 제안한다.
  • 연속된 스테이지 대신 중첩된 통신 패턴을 도입하여 통신 라운드 수를 줄이고 확장성을 향상시킨다.
  • 깊이에 따라 노드 차수를 감소시키는 비균일한 버블리 네트워크를 설계하여 힘의 법칙 데이터의 희소성 분포와 더 잘 부합한다.
  • 노드 장애를 처리하기 위해 최소한의 성능 오버헤드로도 가능한 복제 기반 전략을 구현하여 생산 환경에서의 장애 내성을 확보한다.
  • 각 노드가 필요로 하는 비영 특성만 전송하는 희소 데이터 전송 방식을 사용하여 전체 벡터 집계를 방지한다.
  • PageRank, 스펙트럴 클러스터링, 미니배치 SGD 등의 실세계 워크로드를 대상으로 프리미티브를 평가하며, Hadoop, PowerGraph, GraphX와의 비교를 수행한다.

실험 결과

연구 질문

  • RQ1대규모 기계학습에서 힘의 법칙 분포를 따르는 희소 데이터에 대해 Allreduce를 어떻게 최적화하여 통신 오버헤드를 줄일 수 있는가?
  • RQ2버블리, 라운드로빈, 또는 하이브리드 네트워크 토폴로지 중에서 희소 Allreduce에 대해 부하 균형과 처리량 사이의 최적 균형을 이루는 것은 무엇인가?
  • RQ3희소 Allreduce에서 연속된 스테이지 대비 중첩된 통신 스테이지가 성능 향상에 기여하는가?
  • RQ4위계적으로 감소하는 각 층의 차수를 가진 비균일 버블리 네트워크가 확장성 향상과 지연 감소에 기여하는가?
  • RQ5실세계 그래프 및 기계학습 워크로드에서 기존 시스템인 Hadoop, PowerGraph, GraphX와 비교해 본다면 제안된 Sparse Allreduce는 성능적으로 어떻게 다른가?

주요 결과

  • Sparse Allreduce는 비영 특성만 전송함으로써 통신 오버헤드를 줄여, 대규모 그래프 워크로드에서 Hadoop 및 PowerGraph 대비 최대 10배의 성능 향상을 달성한다.
  • 하이브리드 버블리-라운드로빈 네트워크 토폴로지가 순수한 버블리 또는 라운드로빈 네트워크보다 부하 균형과 혼잡도 감소 측면에서 뛰어나 성능이 뛰어나다.
  • 중첩된 통신 스테이지가 밀도 있는 Allreduce에서 사용하는 연속된 스테이지 대비 통신 라운드 수를 줄여 확장성 향상에 기여한다.
  • 상단에서 하단으로 향해 차수를 점진적으로 감소시키는 비균일 버블리 네트워크는 힘의 법칙 데이터 분포에 최적의 처리량을 달성한다.
  • 트위터 팔로워 그래프에서 10회의 PageRank 반복을 6초 내에 완료하고, 야후 그래프에서는 23초를 기록하여 Hadoop 및 PowerGraph를 크게 앞서나간다.
  • 현재 성능은 자바 소켓에 의해 제한되어 있으나, 향후 RDMA(예: RoCE 또는 Sockets Direct) 통합을 통해 추가적인 성능 향상이 기대된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.