[论文解读] Low synchronization GMRES algorithms
本文提出基于改进格拉姆-施密特(MGS)和经典格拉姆-施密特(CGS)正交化方法的低同步GMRES算法,采用紧凑WY形式中的滞后归一化,将全局约简次数减少至每次迭代仅一次。该方法在保持向后稳定性的同时,正交性损失为O(εκ(A)),在GPU上相比Hypre的BLAS-1 MGS-GMRES实现最高可提升35倍性能,显著降低通信开销,支持可扩展的百亿亿次计算性能。
Communication-avoiding and pipelined variants of Krylov solvers are critical for the scalability of linear system solvers on future exascale architectures. We present low synchronization variants of iterated classical (CGS) and modified Gram-Schmidt (MGS) algorithms that require one and two global reduction communication steps. Derivations of low synchronization iterated CGS algorithms are based on previous work by Ruhe. Our main contribution is to introduce a backward normalization lag into the compact $WY$ form of MGS resulting in a ${\cal O}(\eps)κ(A)$ stable GMRES algorithm that requires only one global synchronization per iteration. The reduction operations are overlapped with computations and pipelined to optimize performance. Further improvements in performance are achieved by accelerating GMRES BLAS-2 operations on GPUs.
研究动机与目标
- 通过最小化全局同步步骤,解决百亿亿次架构下Krylov子空间求解器的通信瓶颈。
- 开发基于紧凑WY和滞后归一化的低通信GMRES变体,实现向后稳定性。
- 通过重叠约简与计算、流水线化处理,实现在GPU和分布式内存系统上的可扩展性能。
- 在大规模稀疏线性系统(特别是有限元法和计算流体动力学应用)中实现高性能与高稳定性。
- 通过降低同步频率,将GMRES的可扩展性拓展至当前极限之外,同时保持数值精度。
提出的方法
- 在紧凑WY形式的MGS中,对R矩阵的对角归一化引入滞后机制,延迟全局约简,将同步次数减少至每次迭代一次。
- 借鉴Ruhe(1994)的循环不变量公式,展开再正交化过程,消除CGS中冗余的全局约简。
- 借鉴Ghysels等人与Yamazaki等人工作,采用流水线化与计算重叠技术,隐藏通信延迟。
- 在现代加速器上,通过GPU加速的BLAS-2操作(如稀疏矩阵-向量乘法SpMV和内积)提升性能。
- 利用紧凑WY表示法,减少存储开销,提升正交化步骤中的数据局部性。
- 将低同步GMRES与BoomerAMG及L1雅可比平滑器等预条件子结合,实现在GPU上的完整求解器可扩展性。
实验结果
研究问题
- RQ1是否可在不牺牲向后稳定性的情况下,将MGS-GMRES的全局同步步骤减少至每次迭代仅一次?
- RQ2紧凑WY形式中的滞后归一化对GMRES中正交性损失与数值稳定性有何影响?
- RQ3在GPU加速的百亿亿次系统中,流水线化与约简重叠技术能在多大程度上提升性能?
- RQ4在大规模稀疏线性系统上,低同步GMRES相比传统Hypre的BLAS-1 MGS-GMRES实现的性能提升如何?
- RQ5所提出的算法是否能在约O(100K)个节点上实现高效可扩展性,且通信开销极低?
主要发现
- 单次同步MGS-GMRES算法实现向后稳定性,正交性损失为O(εκ(A)),确保数值可靠性。
- 新提出的GMRES-two-synch算法在50万规模系统、1e-13精度要求下,求解时间缩短至1.92秒,相比Hypre的BLAS-1 MGS-GMRES提升60%。
- GPU加速实现相比同一硬件上Hypre的Level-1 BLAS MGS-GMRES最高可提升35倍。
- 在Peregrine超算上,随着节点数增加,格拉姆-施密特内核耗时显著下降,表现出强劲的强可扩展性。
- 该方法支持采用更多、更廉价的GMRES迭代结合轻量级V全周期的策略,从而优化整体求解时间。
- 该方法在大规模分布式内存系统中展现出广阔前景,初步结果表明具备良好的可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。