[论文解读] Numerical Study of Geometric Multigrid Methods on CPU--GPU Heterogeneous Computers
本文针对CPU–GPU异构架构下的几何多重网格(GMG)方法进行了数值研究,表明经过优化的GPU上FMG求解器在二维中相比仅使用CPU的OpenMP实现最高可提升11倍性能,在三维中可提升10倍。对于包含1600万个未知数的问题,FMG方法在二维中比cuFFT库快33%,在三维中快23%,同时展现出更优的能效和成本效益。
The geometric multigrid method (GMG) is one of the most efficient solving techniques for discrete algebraic systems arising from elliptic partial differential equations. GMG utilizes a hierarchy of grids or discretizations and reduces the error at a number of frequencies simultaneously. Graphics processing units (GPUs) have recently burst onto the scientific computing scene as a technology that has yielded substantial performance and energy-efficiency improvements. A central challenge in implementing GMG on GPUs, though, is that computational work on coarse levels cannot fully utilize the capacity of a GPU. In this work, we perform numerical studies of GMG on CPU--GPU heterogeneous computers. Furthermore, we compare our implementation with an efficient CPU implementation of GMG and with the most popular fast Poisson solver, Fast Fourier Transform, in the cuFFT library developed by NVIDIA.
研究动机与目标
- 评估几何多重网格(GMG)方法在CPU–GPU异构计算平台上的性能。
- 解决多重网格算法中粗网格层级GPU资源利用率不足的问题。
- 对比GPU加速的FMG求解器与最先进的cuFFT库在求解泊松方程时的效率。
- 评估GMG在不同问题规模和网格分辨率下的可扩展性与性能表现。
- 评估基于GPU的GMG在计算性能和能耗方面的成本效益。
提出的方法
- 使用CUDA将几何多重网格(GMG)求解器与全多重网格(FMG)循环实现在CPU–GPU异构系统上,实现GPU卸载。
- 通过嵌套网格层次结构同时减少高频和低频误差,利用多重网格的多级平滑策略。
- 通过线程聚合和最小化CPU与GPU之间的数据传输,优化GPU内存访问和内核启动。
- 在所有网格层级上使用对称高斯-赛德尔松弛法作为平滑器,松弛 sweeps 的数量在不同层级上可调。
- 将GPU加速的FMG与高度优化的仅使用CPU的OpenMP实现以及用于快速泊松求解的cuFFT库进行对比。
- 通过内核执行时间与L²范数下的近似误差来测量性能,以确保解的准确性。
实验结果
研究问题
- RQ1在异构系统上,GPU加速的几何多重网格方法与高度优化的仅使用CPU的实现相比性能如何?
- RQ2粗网格计算对GPU利用率有何影响?在多重网格算法中如何缓解这一问题?
- RQ3对于大规模泊松问题,GPU加速的FMG求解器是否能在二维和三维中超越cuFFT库?
- RQ4在何种问题规模下,GPU加速相比仅使用CPU的计算在多重网格求解器中更具效率?
- RQ5与现代多核CPU相比,基于GPU的GMG在能效和成本效益方面如何表现?
主要发现
- 对于大规模问题,GPU加速的FMG求解器在二维中相比仅使用CPU的OpenMP实现最高可提升11倍性能,在三维中可提升10倍。
- 对于包含1600万个未知数的问题,二维中的FMG(1,2)方案和三维中的FMG(3,3)方案均实现了最优收敛速率且误差最小。
- 在相同问题规模和精度下,GPU-based FMG方法在二维中比cuFFT快33%,在三维中快23%。
- 较小规模的问题最受益于混合计算(0 < Lθ < L),此时CPU与GPU的工作负载达到平衡。
- 缺乏并行性以及频繁访问粗网格层级限制了GPU利用率,导致峰值浮点性能无法充分发挥。
- 与现代多核CPU相比,基于GPU的GMG在大规模PDE求解中展现出更优的能效和成本效益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。