[论文解读] Resilience for Exascale Enabled Multigrid Methods
本文提出了一种面向exascale计算中并行几何多重网格求解器的基于算法的容错(ABFT)策略,通过使用多重网格循环在Dirichlet边界条件下求解局部子问题来恢复故障。该方法在极低I/O开销下实现了与检查点-重启相当的收敛性能,表明局部多重网格恢复在精度和效率上优于平滑法和Krylov求解器。
With the increasing number of components and further miniaturization the mean time between faults in supercomputers will decrease. System level fault tolerance techniques are expensive and cost energy, since they are often based on redundancy. Also classical check-point-restart techniques reach their limits when the time for storing the system state to backup memory becomes excessive. Therefore, algorithm-based fault tolerance mechanisms can become an attractive alternative. This article investigates the solution process for elliptic partial differential equations that are discretized by finite elements. Faults that occur in the parallel geometric multigrid solver are studied in various model scenarios. In a standard domain partitioning approach, the impact of a failure of a core or a node will affect one or several subdomains. Different strategies are developed to compensate the effect of such a failure algorithmically. The recovery is achieved by solving a local subproblem with Dirichlet boundary conditions using local multigrid cycling algorithms. Additionally, we propose a superman strategy where extra compute power is employed to minimize the time of the recovery process.
研究动机与目标
- 应对exascale HPC系统中硬件故障日益严峻的挑战,因数百万个节点的增加导致故障概率上升。
- 克服传统检查点-重启技术的局限性,该技术由于频繁保存状态而产生高昂的I/O和能耗成本。
- 开发一种基于算法的容错(ABFT)方法,实现在不依赖系统级冗余或检查点机制的情况下进行故障恢复。
- 在节点或核心故障后,最小化恢复过程中的解算延迟和计算开销,同时确保收敛性。
- 证明在几何多重网格求解器中,局部多重网格循环在故障恢复方面优于平滑法或Krylov方法。
提出的方法
- 将故障场景建模为并行几何多重网格求解器中核心或节点的故障,导致子域内解值丢失。
- 通过在受影响子域上使用局部多重网格循环(V-、W-、F-循环)求解具有Dirichlet边界条件的局部子问题来恢复丢失的值。
- 引入一种“超人”策略,利用额外的计算资源通过并行化加速局部恢复。
- 使用“循环优势”(CCR)指标,从所需多重网格循环数的角度,将恢复效率与完整检查点-重启(CCR)进行比较。
- 在分层混合多重网格(HHG)框架内实现并评估恢复策略,采用泊松方程的有限元离散化。
- 在不同故障发生时间下,比较不同平滑法(高斯-赛德尔、雅可比)、PCG迭代次数和多重网格循环的恢复性能。
实验结果
研究问题
- RQ1在不使用检查点的情况下,局部多重网格循环是否能有效恢复并行几何多重网格求解器中的节点或核心故障?
- RQ2故障发生时间(解算过程早期 vs. 晚期)如何影响所需的恢复工作量和收敛速度?
- RQ3不同恢复策略(平滑法、PCG、多重网格循环)在实现与检查点-重启相当精度方面的相对性能如何?
- RQ4“超人”策略是否能通过利用额外的并行性显著缩短恢复时间?
- RQ5“循环优势”指标如何量化恢复策略相对于完整检查点-重启的效率?
主要发现
- 当故障发生在第5次迭代后,4次V-循环、3次W-循环或3次F-循环可使条件数(κ)达到4.164,与完整检查点-重启(CCR)策略的精度一致。
- 当故障发生在第7次迭代后,需要5次W-或F-循环才能使κ ≈ 6.445,与CCR结果一致,而平滑法和PCG策略仅带来微小改进。
- 当故障发生在第11次迭代后,需超过5次W-或F-循环才能匹配CCR性能(κ ≈ 10.999),表明故障检测延迟导致恢复成本持续上升。
- W-循环和F-循环的恢复性能几乎相同,但F-循环因计算成本更低而更受青睐。
- 基于平滑法和PCG的恢复策略仅带来微小改进,且无法达到多重网格循环的精度水平。
- CCR指标证实,只有多重网格循环能够在极低I/O和计算开销下实现接近CCR的精度,使其成为exascale系统容错的理想选择。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。