Skip to main content
QUICK REVIEW

[论文解读] Algorithms and Heuristics for Scalable Betweenness Centrality Computation on Multi-GPU Systems

Flavio Vella, Giancarlo Carbone|arXiv (Cornell University)|Feb 2, 2016
Graph Theory and Algorithms参考文献 41被引用 7
一句话总结

本文提出了一种可扩展的多GPU算法,用于在大规模无权图上精确计算介于中心性(BC),结合了二维图分解、基于前缀和的优化线程-数据映射,以及针对1度和2度顶点的新启发式方法。该方法在真实图上实现了最高2.8倍的加速比,并实现了对规模达28(例如R-MAT EF32)图的BC计算,通过基于启发式的剪枝和针对2度顶点的新DFM算法,显著降低了时间和内存开销。

ABSTRACT

Betweenness Centrality (BC) is steadily growing in popularity as a metrics of the influence of a vertex in a graph. The BC score of a vertex is proportional to the number of all-pairs-shortest-paths passing through it. However, complete and exact BC computation for a large-scale graph is an extraordinary challenge that requires high performance computing techniques to provide results in a reasonable amount of time. Our approach combines bi-dimensional (2-D) decomposition of the graph and multi-level parallelism together with a suitable data-thread mapping that overcomes most of the difficulties caused by the irregularity of the computation on GPUs. Furthermore, we propose novel heuristics which exploit the topology information of the graph in order to reduce time and space requirements of BC computation. Experimental results on synthetic and real-world graphs show that the proposed techniques allow the BC computation of graphs which are too large to fit in the memory of a single computational node along with a significant reduction of the computing time.

研究动机与目标

  • 解决在多GPU系统上大规模图的精确介于中心性(BC)计算中的可扩展性和内存限制问题。
  • 克服不规则图工作负载中GPU特有的瓶颈,如负载不平衡和非合并内存访问。
  • 通过邻接矩阵的分布式二维分解,实现单个GPU内存无法容纳的图的精确BC计算。
  • 通过新颖的启发式方法跳过低度顶点的昂贵Brandes算法步骤,降低计算和通信开销。
  • 将现有的1度顶点约简启发式方法扩展至分布式系统,并提出一种基于最短路径树重构的新2度顶点启发式方法。

提出的方法

  • 采用稀疏邻接矩阵的二维分解,将图数据分布到多个GPU上,最小化GPU间通信并实现负载均衡。
  • 采用基于前缀和操作的线程-数据映射策略,高效管理BFS遍历和最短路径计数,确保合并内存访问和负载均衡。
  • 提出一种重叠优化技术,在多GPU的BFS和BC计算过程中,通过重叠数据传输与计算来隐藏通信延迟。
  • 提出一种新颖的2度顶点启发式方法(DFM算法),直接从邻居的最短路径树计算介于中心性贡献,避免完整运行Brandes算法。
  • 实现一种通信优化策略,通过避免前驱传播,将每步的数据交换从O(m)减少到O(n)。
  • 将1度顶点约简启发式方法扩展至分布式系统,通过一种快速预处理算法在BC计算前识别并移除1度顶点。

实验结果

研究问题

  • RQ1如何在使用多GPU时高效且可扩展地计算无权图的介于中心性,同时最小化通信和内存开销?
  • RQ21度顶点约简启发式方法在多GPU分布式系统中能多大程度上扩展,以降低计算和通信成本?
  • RQ3能否设计一种新启发式方法,在不运行完整Brandes算法的情况下计算2度顶点的介于中心性贡献?
  • RQ4结合1度和2度顶点启发式方法对整体BC计算时间和可扩展性在理论和实践上的影响是什么?
  • RQ5所提出的二维分解和通信优化框架在真实图和合成图上,最多支持256块GPU时的可扩展性如何?

主要发现

  • 所提出的多GPU算法在com-Youtube图上相比单GPU基线实现了最高2.8倍的加速比,总处理时间显著减少。
  • 在R-MAT EF32图(规模23)上,算法在5.0小时内完成BC计算(相比单GPU加速1.3倍),通过1度启发式方法约简了12.1%的顶点。
  • 2度顶点启发式方法(DFM)在RoadNet-PA图上使77,265个顶点跳过了Brandes计算,结合1度约简后,总执行时间从21.8小时减少至15.9小时。
  • 重叠优化通过将数据传输与计算重叠,减少了通信延迟,提升了多GPU系统的性能。
  • 该算法成功在规模达28(如R-MAT EF32)的图上完成BC计算,这些图超出了单节点内存容量,证明了在256块GPU上的强可扩展性。
  • DFM算法的理论基础证明了可以从两个邻居的最短路径树重构2度顶点的最短路径树,从而实现介于中心性贡献的直接计算。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。