[论文解读] Parallel Triangular Solvers on GPU
本文提出了一种新型 HEC(混合 ELL 与 CSR)矩阵格式及针对 GPU 架构优化的并行三角形求解器,可高效求解 ILU 和域分解预条件子中至关重要的下三角和上三角系统。该方法在三角形求解中实现最高 7× 的加速,在整体线性求解器中实现最高 10× 的加速,且 RAS 预条件子在多种稀疏矩阵上表现出卓越的稳定性和性能。
In this paper, we investigate GPU based parallel triangular solvers systematically. The parallel triangular solvers are fundamental to incomplete LU factorization family preconditioners and algebraic multigrid solvers. We develop a new matrix format suitable for GPU devices. Parallel lower triangular solvers and upper triangular solvers are developed for this new data structure. With these solvers, ILU preconditioners and domain decomposition preconditioners are developed. Numerical results show that we can speed triangular solvers around seven times faster.
研究动机与目标
- 解决在 GPU 上高效并行化三角形求解器的挑战,这些求解器是迭代线性求解器的基础,但本质上具有串行性。
- 克服 GPU 架构中稀疏三角系统存在的内存访问低效和不规则数据访问模式问题。
- 开发一种新型矩阵格式(HEC),结合 ELL 与 CSR 结构,以在内存效率与连续内存访问之间取得平衡。
- 设计基于层级调度的并行算法,用于下三角和上三角求解,以实现在 GPU 上的数据并行执行。
- 将新求解器集成到块 ILU(k)、ILUT 和受限加法 Schwarz(RAS)预条件子中,以加速迭代线性系统求解。
提出的方法
- 提出 HEC(混合 ELL 与 CSR)矩阵格式,其中三角矩阵的规则部分以 ELL 格式存储(列主序,支持连续访问),不规则部分以 CSR 格式存储(行主序,可变长度存储)。
- 使用层级调度将未知数按依赖链分组为不同层级,从而实现同一层级内未知数的并行计算。
- 定义重排映射 m(i),将矩阵重排为层级结构,以提升内存连续访问能力并减少不规则访问模式。
- 基于重排后的 HEC 矩阵,实现用于下三角和上三角求解的并行核函数,利用 GPU 线程块实现并发计算。
- 将三角形求解器集成到块 ILU(k)、ILUT 和受限加法 Schwarz(RAS)预条件子中,以加速 Krylov 子空间方法。
- 通过将 ELL 数据按列主序对齐,并对非零数量高度可变的行使用 CSR,优化内存访问模式。
实验结果
研究问题
- RQ1结合 ELL 与 CSR 的混合矩阵格式是否能提升 GPU 上三角形求解器的内存访问效率与并行性能?
- RQ2层级调度与矩阵重排在多大程度上可减少数据依赖性,并实现 GPU 上三角形求解的有效并行化?
- RQ3与现有 GPU 三角形求解器相比,所提出的基于 HEC 的三角形求解器在 ILU 和域分解预条件子中的性能表现如何?
- RQ4在具有不同稀疏模式的多种稀疏矩阵上,使用新求解器在三角形求解和完整线性系统求解中可实现多大程度的加速?
- RQ5在大规模、不规则且高度异构的问题上,所生成的预条件子(如 RAS)在稳定性和可扩展性方面表现如何?
主要发现
- 所提出的基于 HEC 的三角形求解器相比 CPU 实现最高可提速 7×,在多个测试矩阵上平均提速达 6–7×。
- 块 ILU(0) 预条件子在三角形求解时间上获得超过 3× 的加速,整体线性求解在 GPU 上最高提速达 8×。
- RAS 预条件子表现出最高稳定性和性能,大型矩阵上求解阶段最高提速 9.32×,三角形求解最高提速 6.92×。
- 对于具有不规则稀疏模式的 BILUT,三角形求解器实现约 2× 加速,但由于算法效率,整体求解阶段仍实现约 6× 加速。
- 在 SPE10 基准测试(220 万个未知数,2990 万个非零元素)上,使用 BILU 时整个求解阶段提速 6.2×,使用 RAS 时提速 5.1×,尽管 BILUT 结构不规则。
- 块预条件子的块数增加时性能持续提升,表明在 GPU 架构上具有良好的可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。