Skip to main content
QUICK REVIEW

[论文解读] Directionally Unsplit Hydrodynamic Schemes with Hybrid MPI/OpenMP/GPU Parallelization in AMR

Hsi-Yu Schive, Ui-Han Zhang|arXiv (Cornell University)|Mar 17, 2011
Computational Fluid Dynamics and Aerodynamics参考文献 10被引用 5
一句话总结

本文在GPU加速的自适应动态加密(AMR)代码GAMER中实现了方向无关分裂的流体动力学格式——MUSCL-Hancock(MHM)、MHM的变体(VL)以及角传输迎风(CTU)格式,采用混合MPI/OpenMP/GPU并行化模型。在单个GPU上,其性能相比单核CPU最高可提升101倍,并在绝热流体动力学测试中相比广泛使用的CPU代码Athena展现出100倍的性能优势。

ABSTRACT

We present the implementation and performance of a class of directionally unsplit Riemann-solver-based hydrodynamic schemes on Graphic Processing Units (GPU). These schemes, including the MUSCL-Hancock method, a variant of the MUSCL-Hancock method, and the corner-transport-upwind method, are embedded into the adaptive-mesh-refinement (AMR) code GAMER. Furthermore, a hybrid MPI/OpenMP model is investigated, which enables the full exploitation of the computing power in a heterogeneous CPU/GPU cluster and significantly improves the overall performance. Performance benchmarks are conducted on the Dirac GPU cluster at NERSC/LBNL using up to 32 Tesla C2050 GPUs. A single GPU achieves speed-ups of 101(25) and 84(22) for uniform-mesh and AMR simulations, respectively, as compared with the performance using one(four) CPU core(s), and the excellent performance persists in multi-GPU tests. In addition, we make a direct comparison between GAMER and the widely-adopted CPU code Athena (Stone et al. 2008) in adiabatic hydrodynamic tests and demonstrate that, with the same accuracy, GAMER is able to achieve two orders of magnitude performance speed-up.

研究动机与目标

  • 在GPU加速的AMR代码GAMER中实现基于黎曼求解器的方向无关分裂流体动力学格式,以提升精度并保持对称性。
  • 通过利用GPU加速和混合并行化模型,实现在天体物理模拟中的高性能计算。
  • 在相同数值条件下,直接对比GAMER与成熟CPU代码Athena的性能表现。
  • 优化混合MPI/OpenMP/GPU执行模型,以充分挖掘异构CPU/GPU集群的性能潜力,并克服性能瓶颈。

提出的方法

  • 采用方向无关分裂格式——MUSCL-Hancock(MHM)、MHM的变体(VL)以及角传输迎风(CTU),以在多维流体动力学模拟中保持空间对称性并提升精度。
  • 使用NVIDIA CUDA实现这些格式的GPU执行,支持多种重构方法(PLM、PPM)、黎曼求解器(HLLE、HLLC、Roe)和斜率限制器。
  • 采用混合MPI/OpenMP/GPU并行化模型:MPI用于节点间通信,OpenMP用于多核CPU任务卸载,GPU内核用于流体动力学和重力求解器。
  • 利用异步内存传输和CPU-GPU计算重叠技术,实现数据移动与计算的并发执行,减少空闲时间。
  • 在AMR模拟中采用矩形域分解策略,负载均衡问题作为未来挑战提出。
  • 在NERSC Dirac GPU集群上进行性能基准测试,最多使用32块Tesla C2050 GPU,与单核和四核CPU配置下的纯CPU运行进行对比。

实验结果

研究问题

  • RQ1方向无关分裂的流体动力学格式能否在GPU上高效实现,同时保持数值精度和对称性?
  • RQ2与纯CPU或单GPU执行相比,混合MPI/OpenMP/GPU模型在AMR模拟中如何提升性能和可扩展性?
  • RQ3在相同绝热流体动力学测试条件下,GAMER相比广泛使用的CPU代码Athena可实现多大程度的性能加速?
  • RQ4通信开销和负载不均衡如何影响多GPU AMR模拟中的强可扩展性和弱可扩展性?
  • RQ5异步内存复制和CPU-GPU并发执行等优化措施,在混合架构中能在多大程度上缓解性能瓶颈?

主要发现

  • 在均匀网格流体动力学模拟中,单个GPU相比单核CPU实现101倍性能加速,相比四核CPU实现25倍加速。
  • 在AMR模拟中,单个GPU相比单核CPU实现84倍加速,相比四核CPU实现22倍加速,且在多GPU环境下性能扩展良好。
  • 在32-GPU配置下,相比32核和128核纯CPU运行,分别实现71.4倍和18.3倍加速,其中MPI通信占总时间约11%。
  • 在32-GPU实验中,弱可扩展效率达98.8%,强可扩展效率达85.0%,表明并行效率极佳。
  • 与Athena代码的直接对比显示,在相同精度和测试条件下,GAMER实现两个数量级(100倍)的性能加速。
  • 初步的MHD测试(采用CTU和约束传输方法)显示,相比单核CPU实现60倍加速,表明GAMER未来具备强大的MHD支持潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。