[论文解读] Efficient distributed matrix-free multigrid methods on locally refined meshes for FEM computations
本文提出并比较了三种无需矩阵的多重网格方法——几何局部平滑、几何全局粗化和多项式全局粗化——用于在局部加密网格上进行有限元计算,使用 deal.II 库实现。结果表明,由于在精细层次上具有更好的负载均衡,全局粗化在并行可扩展性方面表现更优;而尽管迭代次数略高,局部平滑在串行计算中表现更佳,因其应用约束的开销更低。
This work studies three multigrid variants for matrix-free finite-element computations on locally refined meshes: geometric local smoothing, geometric global coarsening, and polynomial global coarsening. We have integrated the algorithms into the same framework-the open-source finite-element library deal.II-, which allows us to make fair comparisons regarding their implementation complexity, computational efficiency, and parallel scalability as well as to compare the measurements with theoretically derived performance models. Serial simulations and parallel weak and strong scaling on up to 147,456 CPU cores on 3,072 compute nodes are presented. The results obtained indicate that global coarsening algorithms show a better parallel behavior for comparable smoothers due to the better load balance particularly on the expensive fine levels. In the serial case, the costs of applying hanging-node constraints might be significant, leading to advantages of local smoothing, even though the number of solver iterations needed is slightly higher.
研究动机与目标
- 评估并比较三种多重网格变体——几何局部平滑、几何全局粗化和多项式全局粗化——在局部加密网格上的无矩阵有限元方法中的性能。
- 评估这些方法在统一框架下的实现复杂度、计算效率和并行可扩展性。
- 分析在无矩阵有限元法结合悬挂节点约束的背景下,局部与全局粗化策略之间的性能权衡。
- 通过大规模串行和并行模拟(最多 147,456 个 CPU 核心)验证结果与理论性能模型的一致性。
- 在 deal.II 有限元库中提供开源、可投入生产使用的实现,以促进广泛采用和可复现性。
提出的方法
- 在同一个开源有限元库(deal.II)中实现所有三种多重网格变体,以确保公平、直接的比较。
- 使用无矩阵算子计算以最大化节点级性能,并在并行环境中突出通信开销。
- 采用几何多重网格方法,分别使用局部平滑(仅在最细层次上平滑)和全局粗化(在所有层次上粗化),以及通过降低多项式阶数实现的多项式多重网格方法。
- 使用悬挂节点约束以在非匹配加密层次之间保持连续性,特别关注其计算开销。
- 在最多 147,456 个 CPU 核心(3,072 个计算节点)上进行串行模拟以及并行弱缩放和强缩放测试。
- 测量求解器迭代次数、求解时间以及单次迭代性能,以评估效率和可扩展性。
实验结果
研究问题
- RQ1在局部加密网格上,几何局部平滑、几何全局粗化和多项式全局粗化在并行可扩展性和负载均衡方面如何比较?
- RQ2悬挂节点约束的应用对串行性能有何影响?是否更有利于局部平滑而非全局粗化?
- RQ3在使用无矩阵算子时,三种多重网格变体在计算效率和迭代次数方面表现如何?
- RQ4理论性能模型在大规模并行模拟中的预测与实测结果在多大程度上一致?
- RQ5尽管在精细层次上约束成本更高,全局粗化是否仍能实现比局部平滑更好的并行效率?
主要发现
- 全局粗化方法由于具有更好的负载均衡,尤其在计算成本较高的精细层次上,表现出更优的并行可扩展性,在大规模并行运行中优于局部平滑。
- 在串行计算中,尽管需要略多的迭代次数,局部平滑仍能实现更好的性能(更短的求解时间),这是由于悬挂节点约束应用的开销更低。
- 对于 p = 4 且 L = 10 的情况,全局粗化在 768 个进程(16 个节点)上的求解时间为 3.4e-1 秒,而局部平滑为 3.0e-1 秒,表明局部平滑在串行计算中存在微小但可测量的优势。
- 在 24,576 个进程(512 个节点)上,全局粗化在悬挂节点附近单元权重因子变化时仍保持稳定的性能,对于 p = 4 且 L = 10,求解时间约为 1.0e-1 秒。
- 多项式全局粗化与几何全局粗化的性能相当,两者在并行可扩展性方面均优于局部平滑,尤其在核心数较高时表现更优。
- 在 p-多重网格中使用代数多重网格(AMG)作为粗网格求解器时,迭代次数较高且求解时间较长,尤其在 V-循环次数较多时,其效率低于本文提出的多重网格变体。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。