QUICK REVIEW
[论文解读] Distributed-Memory Breadth-First Search on Massive Graphs
Aydın Buluç, Scott Beamer|arXiv (Cornell University)|May 10, 2017
Graph Theory and Algorithms参考文献 6被引用 22
一句话总结
本文提出了一种高性能、可扩展的基于分布式内存的BFS算法,适用于大规模图计算,采用广义的二维处理器网格分解与方向优化技术。通过结合超稀疏DCSC存储、多线程计算和自适应的自顶向下/自底向上遍历策略,显著降低了Cray架构等大规模系统中的通信开销与内存使用,实现了卓越的性能表现。
ABSTRACT
This chapter studies the problem of traversing large graphs using the breadth-first search order on distributed-memory supercomputers. We consider both the traditional level-synchronous top-down algorithm as well as the recently discovered direction optimizing algorithm. We analyze the performance and scalability trade-offs in using different local data structures such as CSR and DCSC, enabling in-node multithreading, and graph decompositions such as 1D and 2D decomposition.
研究动机与目标
- 解决在计算强度低、内存访问不规则的分布式内存系统中,对大规模不规则图进行高效BFS计算的挑战。
- 通过将二维处理器网格分解从正方形网格推广至任意矩形配置,提升并行BFS的可扩展性与性能。
- 评估节点内多线程与稀疏矩阵存储格式(DCSC与CSR)对通信、计算与内存使用的影响。
- 证明方向优化BFS的有效性,该算法根据前沿大小动态切换自顶向下与自底向上遍历,以最小化边的重复检查。
- 在真实图数据与大规模HPC平台(包括Cray系统与Twitter图)上验证实现效果。
提出的方法
- 采用广义的$p_r \times p_c$矩形二维处理器网格分布图的邻接矩阵,实现灵活的负载均衡与通信优化。
- 实现方向优化BFS,动态切换自顶向下与自底向上遍历:早期/晚期阶段采用自顶向下,前沿较大时采用自底向上以减少冗余边检查。
- 对本地子图采用双重压缩稀疏列(DCSC)格式,相比CSR格式可显著降低内存占用并提升内存带宽效率。
- 使用Alltoallv与Allgatherv操作进行全局通信:沿列方向使用Alltoallv交换前沿数据,沿行方向使用Allgatherv实现全局同步。
- 集成节点内多线程技术,以提升计算利用率并隐藏通信延迟,尤其在大核心数系统中效果显著。
- 采用混合方法,结合自顶向下与自底向上BFS的优势,以最小化总边检查次数并改善负载均衡。
实验结果
研究问题
- RQ1处理器网格的偏斜程度(如正方形、矩形或扁平网格)如何影响分布式BFS中的通信、计算与整体性能?
- RQ2在内存受限的大规模分布式BFS中,使用DCSC与CSR稀疏矩阵格式对性能有何影响?
- RQ3节点内多线程在提升分布式BFS可扩展性与隐藏通信延迟方面的有效性如何?
- RQ4方向优化BFS(根据前沿大小在自顶向下与自底向上间切换)在多大程度上减少了冗余边检查并提升了运行时间?
- RQ5该算法在Twitter等真实图上的可扩展性如何?需要多少核心数才能实现亚秒级遍历时间?
主要发现
- 采用矩形配置的二维处理器网格分解(尤其是正方形或略高/略窄的网格)相比扁平、短胖的网格表现更优,原因在于更好的负载均衡与更低的Allgatherv通信开销。
- DCSC存储格式相比CSR显著降低了内存使用,支持更大规模的图遍历——例如,在1×110×440网格上,CSR在规模33时因内存不足而崩溃,而DCSC成功避免了该问题。
- 多线程技术提升了性能与可扩展性,尤其在大核心系统中,通过隐藏通信延迟与提升计算利用率实现优化。
- 方向优化BFS算法在遍历中段(前沿最大时)可将冗余边检查减少高达90%,带来显著的运行时间收益。
- 在Twitter图(1440个核心)上,方向优化BFS仅耗时0.08秒,所需核心数比基线方法低一个数量级即可实现亚0.2秒性能。
- 尽管输入规模从32增至33时通信开销增加了2.5倍,但性能下降主要由本地计算量增加引起,凸显了CSR在二维网格上的可扩展性局限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。