Skip to main content
QUICK REVIEW

[论文解读] Heuristics for Symmetric Rectilinear Matrix Partitioning

Abdurrahman Yaşar, Ümit V. Çatalyürek|arXiv (Cornell University)|Sep 26, 2019
Graph Theory and Algorithms参考文献 13被引用 5
一句话总结

本文提出了五种启发式方法,用于稀疏方阵矩阵的对称矩形划分,采用轻量级空间技术,无需昂贵的顶点重排序或超图模型。所提出的算法在负载不平衡方面优于或媲美Nicol的最先进方法,其中PTC和PBD在各类图工作负载下表现最佳。

ABSTRACT

Partitioning sparse matrices and graphs is a common and important problem in many scientific and graph analytics applications. In this work, we are concerned with a spatial partitioning called rectilinear partitioning (also known as generalized block distribution) of sparse matrices, which is needed for tiled (or {\em blocked}) execution of sparse matrix and graph analytics kernels. More specifically, in this work, we address the problem of symmetric rectilinear partitioning of square matrices. By symmetric, we mean having the same partition on rows and columns of the matrix, yielding a special tiling where the diagonal tiles (blocks) will be squares. We propose five heuristics to solve two different variants of this problem, and present a thorough experimental evaluation showing the effectiveness of the proposed algorithms.

研究动机与目标

  • 解决将稀疏对称矩阵划分为p×p块的问题,确保行和列划分相等,且对角块为正方形。
  • 设计高效、轻量级的对称矩形划分启发式方法,避免昂贵的顶点重排序或超图建模。
  • 评估不同顶点排序方式(基于度、RCM、NAT)对块分布和负载不平衡的影响。
  • 改进分块稀疏矩阵与图分析内核中的负载均衡,尤其适用于并发和异构架构。
  • 证明在行/列对齐受限的对称划分可实际优于更灵活的非对称方法。

提出的方法

  • 提出两个问题变体:在对称矩形约束下最小化负载不平衡(mLI)和最小化切割数(mNC)。
  • 设计基于优化的启发式方法,通过在行/列和上应用最优划分,将二维划分问题简化为一维问题。
  • 开发基于探测的启发式方法,通过局部搜索迭代寻找最优切割,受矩阵结构和顶点排序引导。
  • 使用受Fenwick树启发的稀疏前缀和数据结构,加速PTC中的负载不平衡计算,将查找时间从O(n)降低至O(log n)。
  • 集成三种顶点排序方式——NAT(自然顺序)、DEG(基于度)、RCM(逆Cuthill-McKee)——以评估其对划分质量的影响。
  • 实现并比较六种算法:NIC、PBI、PBD、PTC、BTL和PTL,在不同稀疏度和规模的真实世界图上进行评估。

实验结果

研究问题

  • RQ1在负载不平衡方面,具有相同行和列切割的对称矩形划分是否能优于更灵活的非对称划分?
  • RQ2不同的顶点排序方式(NAT、基于度、RCM)如何影响对称矩形划分的质量?
  • RQ3基于探测的启发式与基于优化的启发式在执行时间与负载不平衡之间存在何种权衡?
  • RQ4轻量级空间启发式是否能在不依赖复杂超图划分模型的情况下取得具有竞争力的结果?
  • RQ5稀疏前缀和数据结构如何提升PTC中负载不平衡计算的性能,其对运行时间有何影响?

主要发现

  • 所提出的PTC启发式在多数测试实例中实现了最佳负载不平衡,且在所有情况下均优于Nicol的算法。
  • PBD在负载不平衡方面排名第二,PBI紧随其后,其性能几乎与NIC基线完全相同。
  • 基于探测的算法(BTL、PTL)在性能上与基于优化的算法(PBI、PBD)相当,且BTL和PTL的切割数低于PBI和PBD。
  • 使用NAT顶点排序导致的切割数少于RCM或基于度的排序,原因在于非零元素分布更均匀。
  • 稀疏前缀和数据结构将PTC的执行时间从比NIC慢2–3个数量级降低至慢4–43倍,使其在大规模图上具备实用性。
  • 在最大规模图(如friendster、twitter)上,PBD是mLI问题的最快算法,而PTC虽最慢但最准确。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。