Skip to main content
QUICK REVIEW

[论文解读] PSelInv -- A Distributed Memory Parallel Algorithm for Selected Inversion : the Symmetric Case

Mathias Jacquelin, Lin Lin|arXiv (Cornell University)|Apr 2, 2014
Parallel Computing and Optimization Techniques参考文献 39被引用 12
一句话总结

PSelInv 是一种可扩展的、基于分布式内存的并行算法,利用带动态负载均衡的消去树遍历进行稀疏对称矩阵的选定元素求逆,基于稀疏 LU 分解。该算法在超过 4,000 个核心上实现高性能,显著提升了大规模电子结构计算的效率——最高达 127× 加速,尤其适用于最多 32,768 个原子的体系。

ABSTRACT

We describe an efficient parallel implementation of the selected inversion algorithm for distributed memory computer systems, which we call exttt{PSelInv}. The exttt{PSelInv} method computes selected elements of a general sparse matrix $A$ that can be decomposed as $A = LU$, where $L$ is lower triangular and $U$ is upper triangular. The implementation described in this paper focuses on the case of sparse symmetric matrices. It contains an interface that is compatible with the distributed memory parallel sparse direct factorization exttt{SuperLU\_DIST}. However, the underlying data structure and design of exttt{PSelInv} allows it to be easily combined with other factorization routines such as exttt{PARDISO}. We discuss general parallelization strategies such as data and task distribution schemes. In particular, we describe how to exploit the concurrency exposed by the elimination tree associated with the $LU$ factorization of $A$. We demonstrate the efficiency and accuracy of exttt{PSelInv} by presenting a number of numerical experiments. In particular, we show that exttt{PSelInv} can run efficiently on more than $4,000$ cores for a modestly sized matrix. We also demonstrate how exttt{PSelInv} can be used to accelerate large-scale electronic structure calculations.

研究动机与目标

  • 解决大规模科学模拟中高效计算选定逆元素的需求,特别是在电子结构理论中的应用。
  • 克服全矩阵求逆在大规模稀疏矩阵中计算成本过高的局限。
  • 开发一种可扩展的高性能并行算法,用于选定求逆,充分利用消去树结构中的稀疏性与并行性。
  • 为密度泛函理论和动态平均场理论等应用,实现对逆矩阵的迹估计和对角元素的高效计算。
  • 在最多 32,768 个原子的体系上,实现在分布式内存架构下的强可扩展性,优于传统对角化方法在大规模下的表现。

提出的方法

  • 利用对称矩阵的稀疏 LU 分解(L 和 U)计算选定逆元素的超集,避免全矩阵求逆。
  • 采用基于消去树的遍历策略,以利用因子分解过程中的任务级并行性和数据局部性。
  • 通过兼容接口与现有的分布式内存稀疏直接求解器(如 SuperLU DIST 和 PARDISO)集成。
  • 通过将消去树节点映射到计算任务,实现处理器间的动态负载均衡,最大化并行度。
  • 使用超节点数据结构对计算进行分组,以减少分布式内存环境下的通信开销。
  • 与 PEXSI 框架结合,通过哈密顿矩阵的选定求逆加速大规模电子结构计算。

实验结果

研究问题

  • RQ1稀疏对称矩阵的选定求逆能否在拥有数千个核心的分布式内存系统上实现高效并行?
  • RQ2在大规模电子结构计算中,PSelInv 的性能如何随问题规模和处理器数量的增加而变化?
  • RQ3与全矩阵对角化相比,PSelInv 在大规模模拟中能将计算成本降低多少?
  • RQ4PSelInv 在高度不定或病态矩阵上如何保持数值精度?
  • RQ5PSelInv 能否在生产级 HPC 工作流中有效集成到现有稀疏直接求解器(如 SuperLU DIST 和 PARDISO)中?

主要发现

  • PSelInv 在超过 4,000 个核心上实现高效扩展,对最多 32,768 个原子的矩阵表现出强可扩展性。
  • 在 32,768 个原子的石墨烯体系中,PSelInv 在 327,680 个核心上总耗时为 241 秒(其中选定求逆耗时 87 秒),相比对角化方法实现 127 倍加速。
  • 对于 8,192 个原子的体系,PSelInv 与 PEXSI 结合将耗时从对角化的 21,556 秒降低至 45 秒,实现 127× 加速。
  • 通过大量数值实验验证,PSelInv 即使在高度不定和接近奇异的矩阵上仍保持高数值精度。
  • 在大规模下,PSelInv 在耗时表现上优于传统对角化方法:在 100 万个核心上,对角化预计耗时超过 1,000 秒,而 PSelInv 仍保持在 250 秒以内。
  • PSelInv 与 PEXSI 框架的结合,使得此前因对角化方法的立方级复杂度而不可行的大规模电子结构计算成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。