Skip to main content
QUICK REVIEW

[논문 리뷰] Algorithms and Heuristics for Scalable Betweenness Centrality Computation on Multi-GPU Systems

Flavio Vella, Giancarlo Carbone|arXiv (Cornell University)|2016. 02. 02.
Graph Theory and Algorithms참고 문헌 41인용 수 7
한 줄 요약

이 논문은 2D 그래프 분해, 접두어 합을 통한 최적화된 스레드-데이터 매핑, 그리고 1도 및 2도 정점에 대한 새로운 히وري스틱을 조합한 확장 가능한 다중 GPU 알고리즘을 제안한다. 이는 대규모 무방향 그래프에서 정확한 중심성 중심성(BC) 계산을 가능하게 하며, 실제 그래프에서 최대 2.8배의 성능 향상을 달성한다. 또한 스케일 28(예: R-MAT EF32)까지의 그래프에서도 BC 계산을 수행할 수 있도록 하며, 히وري스틱 기반의 자르기와 2도 정점에 대한 새로운 DFM 알고리즘을 통해 시간과 메모리 소비를 크게 줄였다.

ABSTRACT

Betweenness Centrality (BC) is steadily growing in popularity as a metrics of the influence of a vertex in a graph. The BC score of a vertex is proportional to the number of all-pairs-shortest-paths passing through it. However, complete and exact BC computation for a large-scale graph is an extraordinary challenge that requires high performance computing techniques to provide results in a reasonable amount of time. Our approach combines bi-dimensional (2-D) decomposition of the graph and multi-level parallelism together with a suitable data-thread mapping that overcomes most of the difficulties caused by the irregularity of the computation on GPUs. Furthermore, we propose novel heuristics which exploit the topology information of the graph in order to reduce time and space requirements of BC computation. Experimental results on synthetic and real-world graphs show that the proposed techniques allow the BC computation of graphs which are too large to fit in the memory of a single computational node along with a significant reduction of the computing time.

연구 동기 및 목표

  • 다중 GPU 시스템을 활용한 대규모 그래프에서 정확한 중심성 중심성(BC) 계산의 확장성과 메모리 제약을 해결한다.
  • 비정규 그래프 워크로드에서 발생하는 GPU 고유의 병목 현상(예: 로드 불균형, 비연속 메모리 접근)을 극복한다.
  • 이웃 행렬의 분산 2D 분해를 통해 단일 GPU 메모리에 들어가지 않는 크기의 그래프에서도 정확한 BC 계산을 가능하게 한다.
  • 낮은 차수의 정점에 대해 비용이 많이 드는 Brandes 알고리즘 단계를 건너뛰는 데 목적이 있는 새로운 히وري스틱을 통해 계산 및 통신 오버헤드를 감소시킨다.
  • 기존의 1도 정점 감소 히وري스틱을 분산 시스템으로 확장하고, 최단경로 트리 재구성 기반으로 새로운 2도 정점 히وري스틱을 제안한다.

제안 방법

  • 희소 인접 행렬의 2D 분해를 활용해 그래프 데이터를 다수의 GPU에 분산 배치함으로써 상호 GPU 통신을 최소화하고 로드 밸런싱을 가능하게 한다.
  • 접두어 합 연산 기반의 스레드-데이터 매핑 전략을 사용하여 BFS 탐색 및 최단경로 수 계산을 효율적으로 관리함으로써 연속된 메모리 접근과 균형 잡힌 로드를 확보한다.
  • 다중 GPU BFS 및 BC 계산 중 데이터 전송과 계산을 겹치는 오버랩 최적화 기법을 도입하여 통신 지연을 숨긴다.
  • 이웃 정점의 최단경로 트리에서 직접 중심성 기여도를 계산할 수 있도록, 2도 정점에 대한 새로운 히وري스틱(DFM 알고리즘)을 제안한다. 이는 전체 Brandes 실행을 피할 수 있도록 한다.
  • 예비 조건 전파를 방지함으로써 단계당 데이터 교환을 O(m)에서 O(n)으로 줄이는 통신 최적화 전략을 구현한다.
  • 1도 정점 감소 히وري스틱을 분산 시스템에 확장하기 위해, BC 계산 이전에 1도 정점을 신속하게 식별하고 제거하는 전처리 알고리즘을 도입한다.

실험 결과

연구 질문

  • RQ1다중 GPU를 활용해 무방향 그래프에서 중심성 중심성 계산을 효율적이고 확장 가능하게 수행할 수 있는 방법은 무엇인가? 이때 통신 및 메모리 오버헤드를 최소화할 수 있는가?
  • RQ21도 정점 감소 히وري스틱은 분산 다중 GPU 환경으로 얼마나 효과적으로 확장될 수 있으며, 계산 및 통신 비용을 얼마나 줄일 수 있는가?
  • RQ3완전한 Brandes 알고리즘을 실행하지 않고도 2도 정점의 중심성 기여도를 계산할 수 있는 새로운 히وري스틱을 설계할 수 있는가?
  • RQ41도 및 2도 정점 히وري스틱을 결합했을 때의 이론적 및 실용적 영향은 전체 BC 계산 시간과 확장성에 어떤 영향을 미치는가?
  • RQ5제안된 2D 분해 및 통신 최적화 프레임워크는 실제 및 합성 그래프에서 최대 256개 GPU에 대해 어떻게 확장되는가?

주요 결과

  • 제안된 다중 GPU 알고리즘은 com-Youtube 그래프에서 단일 GPU 기준 대비 최대 2.8배의 성능 향상을 달성했으며, 총 처리 시간이 크게 감소했다.
  • R-MAT EF32 그래프(스케일 23)에서 알고리즘은 5.0시간(단일 GPU 대비 1.3배 향상)에 BC 계산을 완료했고, 1도 히وري스틱을 통해 전체 정점의 12.1%가 감소했다.
  • RoadNet-PA에서 2도 정점 히وري스틱(DFM)을 적용하여 Brandes 계산을 건너뛴 정점 수가 77,265개에 이르렀고, 1도 감소와 조합했을 때 총 실행 시간이 21.8시간에서 15.9시간으로 감소했다.
  • 오버랩 최적화 기법은 데이터 전송과 계산을 겹쳐 통신 지연을 줄였으며, 다중 GPU 시스템에서의 성능 향상에 기여했다.
  • 스케일 28(예: R-MAT EF32)까지의 그래프에서도 BC 계산을 성공적으로 수행했으며, 이는 단일 노드 메모리로는 처리할 수 없는 크기의 그래프임을 입증했다. 256개 GPU에서의 강력한 확장성을 보였다.
  • DFM 알고리즘의 이론적 기반은 2도 정점의 최단경로 트리를 그 이웃 정점의 트리로부터 재구성할 수 있음을 증명하며, 이는 직접적인 중심성 기여도 계산을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.