Skip to main content
QUICK REVIEW

[논문 리뷰] GraphHP: A Hybrid Platform for Iterative Graph Processing

Qun Chen, Song Bai|arXiv (Cornell University)|2017. 06. 22.
Graph Theory and Algorithms참고 문헌 27인용 수 7
한 줄 요약

GraphHP는 반복적 그래프 처리를 최적화하기 위해 그래프 파artitions 내에서 의사-초기단계(execution model)를 도입한 하이브리드 플랫폼이다. 이는 전역 동기화 및 통신 오버헤드를 줄이며, Bulk Synchronous Parallel(BSP) 시스템에서 정점 중심 프로그래밍 모델을 손상시키지 않으면서도 성능을 향상시킨다. 표준 그래프 워크로드에서 평가한 결과, Giraph++ 및 GraphLab과 같은 최신 BSP 시스템보다 전반적으로 전역 반복 수와 네트워크 메시지 수를 크게 감소시켜 성능을 뛰어나게 개선한다.

ABSTRACT

The Bulk Synchronous Parallel(BSP) computational model has emerged as the dominant distributed framework to build large-scale iterative graph processing systems. While its implementations(e.g., Pregel, Giraph, and Hama) achieve high scalability, frequent synchronization and communication among the workers can cause substantial parallel inefficiency. To help address this critical concern, this paper introduces the GraphHP(Graph Hybrid Processing) platform which inherits the friendly vertex-centric BSP programming interface and optimizes its synchronization and communication overhead. To achieve the goal, we first propose a hybrid execution model which differentiates between the computations within a graph partition and across the partitions, and decouples the computations within a partition from distributed synchronization and communication. By implementing the computations within a partition by pseudo-superstep iteration in memory, the hybrid execution model can effectively reduce synchronization and communication overhead while not requiring heavy scheduling overhead or graph-centric sequential algorithms. We then demonstrate how the hybrid execution model can be easily implemented within the BSP abstraction to preserve its simple programming interface. Finally, we evaluate our implementation of the GraphHP platform on classical BSP applications and show that it performs significantly better than the state-of-the-art BSP implementations. Our GraphHP implementation is based on Hama, but can easily generalize to other BSP platforms.

연구 동기 및 목표

  • 반복적 그래프 처리를 위한 표준 BSP 플랫폼에서 높은 동기화 및 통신 오버헤드 문제를 해결한다.
  • 성능 향상과 함께 정점 중심 BSP 프로그래밍 모델의 단순성과 사용 편의성을 유지한다.
  • 전역 동기화 이전에 그래프 파artitions 내에서 국소 수렴을 가능하게 함으로써 전역 반복 수와 네트워크 메시지 수를 줄인다.
  • 기존의 Hama와 같은 BSP 프레임워크에 통합될 수 있는 일반 목적 플랫폼을 설계하며, 주요 아키텍처 변경 없이 구현 가능하도록 한다.

제안 방법

  • 내부 파artition 및 외부 파artition 계산을 분리하는 하이브리드 실행 모델을 제안하여, 국소 계산과 분산 동기화를 분리한다.
  • 메인 메모리 내에서 의사-초기단계 반복을 통해 내부 파artition 계산을 구현하여 전역 동기화 이전에 다수의 국소 반복을 허용한다.
  • 기존의 BSP 추상화에 하이브리드 모델을 통합하여 후행 호환성과 간단한 프로그래밍 인터페이스를 유지한다.
  • 워커 내부에서 메모리 기반 메시지 전달을 사용하여 국소 수렴을 가속화하고 네트워크 트래픽을 감소시킨다.
  • 스케줄링 오버헤드를 최소화하면서도 효율적인 로드 밸런싱 및 장애 복구 기능을 제공하도록 시스템을 설계한다.
  • 실제 세계 및 합성 데이터셋을 사용하여 표준 그래프 알고리즘(PageRank, SSSP 등)에 대해 평가하여 성능 향상을 측정한다.

실험 결과

연구 질문

  • RQ1정점 중심 프로그래밍 모델을 손상시키지 않으면서도, 하이브리드 실행 모델이 BSP 기반 그래프 처리에서 동기화 및 통신 오버헤드를 줄일 수 있는가?
  • RQ2표준 BSP와 비교했을 때, 내부 파artition 의사-초기단계 반복은 수렴 속도와 전역 반복 수에 어떤 영향을 미치는가?
  • RQ3Giraph++ 및 GraphLab과 같은 기존 BSP 시스템에 비해 GraphHP는 네트워크 메시지 수를 얼마나 줄이고 성능 향상을 이룰 수 있는가?
  • RQ4이러한 하이브리드 모델은 다양한 그래프 알고리즘과 워크로드에 대해 확장 가능하고 일반화 가능한가?
  • RQ5이러한 하이브리드 모델에서 국소 계산 오버헤드와 전역 통신 감소 사이의 상호 상충 관계는 어떠한가?

주요 결과

  • GraphHP는 Giraph++ 및 GraphLab Sync와 비교해 PageRank 및 SSSP 알고리즘에서 수렴을 위한 전역 반복 수를 감소시켰다.
  • 전역 동기화 이전에 국소 수렴을 가능하게 함으로써, 특히 파artition 간 통신 메시지 수를 크게 줄였다.
  • PageRank 및 SSSP 워크로드에서 Giraph++보다 최대 3.5배 빠른 실행 시간을 기록하여 전역 반복 수 감소와 낮은 통신 부하로 인한 성능 향상을 달성했다.
  • GraphHP는 잠금 메커니즘으로 인해 병렬성 감소를 겪는 GraphLab의 Async 모드보다 뛰어난 성능을 보였다.
  • 표준 BSP 시스템보다 더 빠른 수렴 속도를 달성하면서도, 간단하고 통일된 정점 중심 프로그래밍 인터페이스를 유지했다.
  • 실제 세계 및 합성 데이터셋을 모두 통해 일관된 성능 향상이 관찰되어, 이 접근 방식의 일반 적용 가능성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.