Skip to main content
QUICK REVIEW

[论文解读] Minimod: A Finite Difference solver for Seismic Modeling

Jie Meng, Andreas Atle|arXiv (Cornell University)|Jul 12, 2020
Seismic Imaging and Inversion Techniques参考文献 20被引用 10
一句话总结

Minimod 是一个便携式、自包含的有限差分求解器,用于地震波模拟,旨在作为高性能计算(HPC)平台的代理应用程序。它支持 CPU 和 GPU 架构的优化与非优化内核,使用户能够通过强可扩展性和弱可扩展性测试,在现代 HPC 系统上评估性能,结果显示在 IBM Power 系统上达到高达 63% 的理想可扩展性,在 Fujitsu A64FX 系统上达到 60%。

ABSTRACT

This article introduces a benchmark application for seismic modeling using finite difference method, which is namedMiniMod, a mini application for seismic modeling. The purpose is to provide a benchmark suite that is, on one hand easy to build and adapt to the state of the art in programming models and changing high performance hardware landscape. On the other hand, the intention is to have a proxy application to actual production geophysical exploration workloads for Oil & Gas exploration, and other geosciences applications based on the wave equation. From top to bottom, we describe the design concepts, algorithms, code structure of the application, and present the benchmark results on different current computer architectures.

研究动机与目标

  • 提供一个轻量级、可移植的地震模拟代理应用程序,以模拟真实地球物理工作负载。
  • 支持新兴 HPC 硬件和编程模型(包括多线程和 GPU offloading)的基准测试。
  • 评估在 IBM Power 和 Fujitsu A64FX 等多样化架构上的节点级和分布式内存并行性能。
  • 通过集成的性能分析工具(如 HPCToolkit)实现性能分析与优化。
  • 通过提供基于波动方程的地震成像工作负载的可测量性能趋势,指导 HPC 采购决策。

提出的方法

  • 在结构化网格上使用有限差分法(FDM)求解三维声波方程,涵盖恒定密度和可变密度公式。
  • 实现三种网格类型:交错网格、Yee 交错网格和 Lebedev 交错网格,以支持不同的数值 stencils 和精度级别。
  • 提供适用于 CPU(OpenMP)和 GPU(OpenACC)执行的非优化与优化计算内核,以支持性能对比。
  • 采用完美匹配层(PML)作为吸收边界条件,以最小化模拟中的波反射。
  • 在分布式内存系统上使用 MPI 进行强可扩展性和弱可扩展性测试,强可扩展性测试中保持问题规模固定,弱可扩展性测试中按比例缩放问题规模。
  • 使用 HPCToolkit 对 CPU 和 GPU 执行轨迹进行详细性能分析,包括调用路径分析和内核子程序耗时统计。

实验结果

研究问题

  • RQ1Minimod 在包括 IBM Power 和 Fujitsu A64FX 系统在内的不同 HPC 架构上的性能如何扩展?
  • RQ2与非优化版本相比,优化内核在现代 CPU 和 GPU 平台上的性能提升程度如何?
  • RQ3网格交错方式的选择(共轭、Yee、Lebedev)对地震波模拟中的数值精度和计算效率有何影响?
  • RQ4问题规模和 MPI 进程数量对 Minimod 分布式内存实现中弱可扩展性和强可扩展性的影响如何?
  • RQ5Minimod 计算内核中的性能瓶颈在哪里?这些瓶颈在 CPU 和 GPU 执行中是否存在差异?

主要发现

  • 在使用 256 个 MPI 进程的强可扩展性测试中,Minimod 在 IBM Power 系统上实现了 63% 的理想可扩展性,在 Fujitsu A64FX 系统上实现了 60%。
  • 弱可扩展性效率在最多 8 个 MPI 进程时保持较高水平,由于问题规模较小,性能比超过 100%,但在更高进程数时开始下降。
  • 使用 HPCToolkit 进行性能分析显示,PML(完美匹配层)实现占用了最大比例的执行时间,尤其是在 CPU 和 GPU 上。
  • GPU 性能分析显示设备执行期间存在空闲时段,表明在内核启动和数据传输调度方面仍有优化空间。
  • 顺序内核性能分析表明,内部 stencils 计算和 PML 边界处理是主要的计算阶段。
  • 优化内核在 CPU 和 GPU 上均显著提升了性能,使得对新型编程模型和硬件的高效评估成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。