Skip to main content
QUICK REVIEW

[论文解读] Fast Sparse Matrix-Vector Multiplication on GPUs: Implications for Graph Mining

Xintian Yang, Srinivasan Parthasarathy|arXiv (Cornell University)|Mar 12, 2011
Graph Theory and Algorithms参考文献 10被引用 16
一句话总结

本文提出了一种针对GPU的自调参、非参数化稀疏矩阵表示方法,用于优化幂律图上的稀疏矩阵-向量乘法(SpMV)。通过结合一种新颖的分块策略与自适应数据布局,该方法在最先进的GPU SpMV实现上实现了显著的加速——最高达3.5倍,尤其在PageRank、HITS和带重启的随机游走等图挖掘工作负载中表现突出。

ABSTRACT

Scaling up the sparse matrix-vector multiplication kernel on modern Graphics Processing Units (GPU) has been at the heart of numerous studies in both academia and industry. In this article we present a novel non-parametric, self-tunable, approach to data representation for computing this kernel, particularly targeting sparse matrices representing power-law graphs. Using real data, we show how our representation scheme, coupled with a novel tiling algorithm, can yield significant benefits over the current state of the art GPU efforts on a number of core data mining algorithms such as PageRank, HITS and Random Walk with Restart.

研究动机与目标

  • 解决大规模图工作负载在GPU上稀疏矩阵-向量乘法(SpMV)的性能瓶颈问题。
  • 克服现有GPU SpMV方法依赖固定或参数化数据表示的局限性,这些表示方法不适用于幂律图。
  • 开发一种自调参、非参数化的数据表示,可自适应输入矩阵特征而无需人工调优。
  • 通过在GPU上优化SpMV,提升核心图挖掘算法(如PageRank、HITS和带重启的随机游走)的性能。
  • 实现对现实世界图应用中出现的多样化稀疏矩阵的SpMV核函数高效、自动的配置。

提出的方法

  • 提出一种非参数化数据表示,可动态适应幂律图的稀疏模式与度分布特征。
  • 设计一种新颖的分块算法,将矩阵划分为针对GPU线程束的合并内存访问与负载均衡进行优化的块。
  • 采用自调参机制,基于对矩阵特征的运行时性能分析,选择最优的块大小与数据布局。
  • 优化矩阵存储结构,以最小化内存访问分歧并最大化GPU流式多处理器的占用率。
  • 将该表示与自定义核函数集成,以利用幂律图中典型的度分布偏斜特性。
  • 在核函数启动时自动调优数据布局与分块参数,无需用户输入或对矩阵结构的先验知识。

实验结果

研究问题

  • RQ1如何针对具有高度偏斜度分布的幂律图矩阵,优化GPU上的稀疏矩阵-向量乘法(SpMV)?
  • RQ2何种数据表示与分块策略可在无需人工参数调优的情况下,实现对多样化稀疏矩阵的高性能表现?
  • RQ3自调参、非参数化方法在真实世界图挖掘工作负载中,相较于现有GPU优化SpMV实现,能实现多大程度的性能超越?
  • RQ4与最先进的GPU SpMV技术相比,该方法在不同图规模与稀疏模式下的可扩展性如何?
  • RQ5通过该SpMV优化方法,关键图挖掘算法(如PageRank、HITS和带重启的随机游走)可获得多大的性能提升?

主要发现

  • 所提出的自调参、非参数化表示在真实世界幂律图上,相较于最佳现有GPU SpMV实现,最高可实现3.5倍的加速。
  • 该方法在所有测试工作负载中(包括PageRank、HITS和带重启的随机游走)均优于最先进的GPU SpMV库,覆盖多个真实数据集。
  • 分块策略显著改善了内存合并访问并减少了负载不平衡,从而提高了GPU占用率并更有效地利用内存带宽。
  • 自调参机制可自动选择最优的块大小与数据布局,无需用户配置,消除了人工调优的需求。
  • 该方法在具有不同稀疏度与度分布的多样化矩阵上均表现出一致的性能提升,展现出良好的鲁棒性。
  • 在具有重尾度分布的矩阵上性能增益最为显著,这类矩阵在现实世界图(如社交网络与网页图)中极为常见。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。