Skip to main content
QUICK REVIEW

[论文解读] Fast Gunrock Subgraph Matching (GSM) on GPUs

Leyuan Wang, John D. Owens|arXiv (Cornell University)|Mar 1, 2020
Graph Theory and Algorithms参考文献 23被引用 8
一句话总结

本文提出GSM(Gunrock子图同构),一种针对GPU优化的子图同构算法,采用广度优先搜索(BFS)以利用大规模并行性,通过剪枝和压缩技术减轻内存压力。该算法通过最小化中间结果,在大规模图和高标签数据集上实现可扩展匹配,相比先前的GPU最先进方法,最高可提升4倍性能。

ABSTRACT

In this paper, we propose a GPU-efficient subgraph isomorphism algorithm using the Gunrock graph analytic framework, GSM (Gunrock Subgraph Matching), to compute graph matching on GPUs. In contrast to previous approaches on the CPU which are based on depth-first traversal, GSM is BFS-based: possible matches are explored simultaneously in a breadth-first strategy. The advantage of using BFS-based traversal is that we can leverage the massively parallel processing capabilities of the GPU. The disadvantage is the generation of more intermediate results. We propose several optimization techniques to cope with the problem. Our implementation follows a filtering-and-verification strategy. While most previous work on GPUs requires one-/two-step joining, we use one-step verification to decide the candidates in current frontier of nodes. Our implementation has a speedup up to 4x over previous GPU state-of-the-art implementation.

研究动机与目标

  • 解决CPU基于深度优先回溯算法在GPU上效率低下的问题,原因在于并行性差和线程束发散。
  • 通过智能剪枝和压缩技术,最小化中间结果生成,缓解GPU内存限制。
  • 在无需预处理的前提下,实现对大规模图和高标签数据集的可扩展子图匹配,区别于图索引方法。
  • 设计一种GPU友好的算法,在速度和可扩展性方面超越现有GPU和CPU子图匹配方案。
  • 验证k-前瞻剪枝和一步验证在减少候选集并提升性能方面的有效性。

提出的方法

  • GSM采用基于BFS的遍历策略,以在GPU上实现大规模并行性,与传统CPU深度优先回溯方法形成对比。
  • 采用过滤-验证流水线,结合一步验证机制,用于验证候选节点映射,减少冗余计算。
  • 算法应用k-前瞻剪枝,提前剔除无意义的候选,尤其在道路图等低度图中效果显著。
  • 通过压缩和剪枝技术,使内存使用量与匹配子图大小呈线性关系,避免内存爆炸。
  • 实现无需预处理即可以CSR格式处理数据图,支持大规模图上的动态查询。
  • 优化措施包括基于标签的剪枝和高效的内存合并,以降低延迟并提升GPU占用率。

实验结果

研究问题

  • RQ1尽管中间结果生成更多,基于BFS的子图同构算法是否能在GPU上超越基于深度优先的CPU方法?
  • RQ2如何缓解GPU子图匹配中的内存压力,以支持更大规模的图和更高的标签数量?
  • RQ3一步验证和k-前瞻剪枝在多样化图工作负载上的性能与可扩展性提升程度如何?
  • RQ4与现有GPU方法相比,GSM在查询图规模和节点/边标签数量增加时的可扩展性表现如何?
  • RQ5在内存密集型和大规模子图匹配工作负载下,GSM是否能超越GPU优化的前代方案(如GpSM和GSI)?

主要发现

  • 在包括Enron和Gowalla在内的多种数据集上,GSM相比先前GPU最先进实现最高实现4倍性能提升。
  • 在road_central图上,k-前瞻剪枝通过减少低度图中的无意义候选,带来1.38倍性能提升。
  • 在Enron和Gowalla数据集上,GSM成功处理最大达13个节点的查询图,而GSI因内存限制无法处理超过4个节点的查询。
  • 在Gowalla数据集上,GSM的运行时间随标签数量从20增至100呈线性下降,之后因并行效率下降而趋于平稳。
  • 在合成Delaunay图上,GSM相比GSI保持3倍以上的性能优势,并可扩展至2^20个顶点,而GSI在2^15时即耗尽内存。
  • 在kron图上,GSM在6个节点的查询图上表现出优越可扩展性,而GSI因内存耗尽完全无法运行。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。