QUICK REVIEW
[论文解读] Adaptive Work-Efficient Connected Components on the GPU
Michael Sutton, Tal Ben‐Nun|arXiv (Cornell University)|Dec 4, 2016
Parallel Computing and Optimization Techniques参考文献 3被引用 3
一句话总结
本文提出了一种自适应、工作高效(work-efficient)的GPU实现Connected Components算法,采用改进的Hook-Compress方法。通过将Compress操作融合为单个Multi-Jump内核,并基于图的度数动态分割边列表,有效减少了原子操作争用和CPU-GPU上下文切换,相较于现有最先进的GPU CC实现,在多种图类型上实现了最高达6.76倍的加速。
ABSTRACT
This report presents an adaptive work-efficient approach for implementing the Connected Components algorithm on GPUs. The results show a considerable increase in performance (up to 6.8$ imes$) over current state-of-the-art solutions.
研究动机与目标
- 解决现有GPU连通分量算法因原子操作争用过高和频繁CPU-GPU同步导致的性能瓶颈问题。
- 通过最小化冗余操作和减少内存访问开销,提升并行图处理中的工作效率。
- 设计一种原生GPU自适应算法,能够根据图的特征(如平均度数和连通性模式)动态调整。
- 通过将Compress操作融合为单个可扩展的内核,消除对多个顺序内核启动的需求。
提出的方法
- 提出一种Multi-Jump内核,将多个Jump操作融合为单个并行内核,降低内核启动开销并提升内存合并访问效率。
- 提出一种Atomic-Hook内核,利用原子比较并交换操作执行钩连(hooking),在无全局同步的情况下保证正确性。
- 采用动态分割策略,根据平均度数将边列表划分为约2|E|/|V|个段,以平衡原子操作争用与Compress开销。
- 在Multi-Jump中采用部分顺序调度,优先处理索引较高的顶点(更接近根节点),改善内存访问模式并减少线程发散。
- 采用启发式分割大小2|E|/|V|,在原子操作成本与Compress开销之间取得平衡,适应图的密度变化。
- 将优化后的内核集成到主机端循环中,交替执行分段的Atomic-Hook与完整的Multi-Jump阶段,实现自适应收敛。
实验结果
研究问题
- RQ1如何通过减少原子操作和内核启动开销,提升基于GPU的连通分量算法的工作效率?
- RQ2在Hook-Compress算法中,平衡原子争用与Compress开销的最优边段数量是多少?
- RQ3能否通过将多个Compress操作融合为单个内核,显著缓解不规则图工作负载中的性能瓶颈?
- RQ4基于图度数的动态分割策略如何影响不同图类型下的收敛速度与可扩展性?
- RQ5设备中心的内核设计在多大程度上能减少CPU-GPU上下文切换,提升不规则图算法的整体性能?
主要发现
- 所提出的自适应算法在多种图工作负载上相较基线Soman et al. [3]实现最高达6.76倍的加速。
- Multi-Jump优化在所有图类型中均持续提升性能,通过降低内核启动开销和改善内存访问模式。
- Atomic-Hook结合动态分割在低度图中效果最显著(如USA OSM图中达4.15倍加速),此时原子争用问题最为严重。
- 最优分割大小2|E|/|V|在所有测试图中均能最大化性能,验证了启发式设计的有效性。
- 对于高度图(如kron-logn21和soc-live-journal),Multi-Jump优化影响较小(加速比分别为1.02×和1.14×),因为相对于O(|E|)的Hook开销,O(|V|)的Compress开销相对较小。
- 自适应方法通过在GPU上完成全部计算,将CPU-GPU上下文切换降至最低,显著提升可扩展性并降低延迟。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。