Skip to main content
QUICK REVIEW

[論文レビュー] Minimod: A Finite Difference solver for Seismic Modeling

Jie Meng, Andreas Atle|arXiv (Cornell University)|Jul 12, 2020
Seismic Imaging and Inversion Techniques参考文献 20被引用数 10
ひとこと要約

Minimod は、ハイパフォーマンスコンピューティング(HPC)プラットフォームのベンチマークを目的とした、ポータブルで自己完結型の有限差分ソルバーであり、地震波のモデリングを対象としている。CPU および GPU アーキテクチャ向けに最適化済みおよび非最適化済みのカーネルをサポートしており、強スケーリングおよび弱スケーリングのテストを通じて、現代の HPC システムにおける性能評価が可能であり、IBM Power では最大 63% の理想スケーリング、Fujitsu A64FX システムでは 60% のスケーリングを示している。

ABSTRACT

This article introduces a benchmark application for seismic modeling using finite difference method, which is namedMiniMod, a mini application for seismic modeling. The purpose is to provide a benchmark suite that is, on one hand easy to build and adapt to the state of the art in programming models and changing high performance hardware landscape. On the other hand, the intention is to have a proxy application to actual production geophysical exploration workloads for Oil & Gas exploration, and other geosciences applications based on the wave equation. From top to bottom, we describe the design concepts, algorithms, code structure of the application, and present the benchmark results on different current computer architectures.

研究の動機と目的

  • 実際の地球物理学的ワークロードを模倣する軽量でポータブルなプロキシアプリケーションを提供すること。
  • 新興の HPC 硬件およびプログラミングモデル(マルチスレーディングおよび GPU オフロードを含む)のベンチマークを支援すること。
  • IBM Power や Fujitsu A64FX などの多様なアーキテクチャにおけるノードレベルおよび分散メモリ並列性能を評価すること。
  • HPCToolkit などの統合プロファイリングツールを通じて、パフォーマンス分析と最適化を可能にすること。
  • 波動方程式に基づく地震画像化ワークロードの測定可能なパフォーマンストレンドを提供することで、HPC の調達意思決定を支援すること。

提案手法

  • 3次元の定常的および可変密度形式を用いた、構造的グリッド上で有限差分法(FDM)を用いて音響波動方程式を解く。
  • コロケート、Yee スタガード、Lebedev スタガードの3種類のグリッドタイプを実装し、異なる数値ステンシルおよび精度レベルをサポートする。
  • CPU(OpenMP)および GPU(OpenACC)実行用に、非最適化および最適化済みの計算カーネルを提供し、パフォーマンス比較を可能にする。
  • 波の反射を最小限に抑えるために、境界条件として完全一致層(PML)を採用する。
  • MPI を用いて分散メモリシステム上で強スケーリングおよび弱スケーリングのテストを実施し、強スケーリングでは固定問題サイズ、弱スケーリングではスケーリングされた問題サイズを用いる。
  • CPU および GPU 実行トレースの詳細なプロファイリングに HPCToolkit を使用し、コールパス解析およびカーネルサブルーチンでの実行時間の分析を実施する。

実験結果

リサーチクエスチョン

  • RQ1Minimod のパフォーマンスは、IBM Power や Fujitsu A64FX システムを含む、さまざまな HPC アーキテクチャでどのようにスケーリングするか?
  • RQ2最適化済みカーネルは、非最適化バージョンと比較して、現代の CPU および GPU プラットフォームでどの程度パフォーマンスを向上させるか?
  • RQ3グリッドのスタガリング(コロケート、Yee、Lebedev)の選択が、地震波モデリングにおける数値的正確性および計算効率に与える影響は何か?
  • RQ4問題サイズおよび MPI ランク数が、Minimod の分散メモリ実装における弱スケーリングおよび強スケーリングに与える影響は何か?
  • RQ5Minimod の計算カーネルにおけるパフォーマンスボトルネックはどこにあり、CPU と GPU 実行ではどのように異なるか?

主な発見

  • 強スケーリングテストにおいて、256 MPI ランクを用いた IBM Power システムでは 63% の理想スケーリングを達成した。Fujitsu A64FX システムでは 60% のスケーリングを示した。
  • 弱スケーリング効率は 8 MPI ランクまで高く維持され、問題サイズが小さいため性能比が 100% を超えたが、より高いランク数で低下した。
  • HPCToolkit を用いたプロファイリングにより、PML(完全一致層)の実装が実行時間の最大割合を占め、特に CPU および GPU で顕著であった。
  • GPU プロファイリングでは、デバイス実行中のアイドル期間が確認され、カーネル起動およびデータ転送スケジューリングの最適化の余地が示唆された。
  • 順次カーネルプロファイリングでは、内側のステンシル計算および PML 境界処理が主な計算フェーズであることが判明した。
  • 最適化済みカーネルは、CPU および GPU の両方で顕著なパフォーマンス向上を実現し、新しいプログラミングモデルおよびハードウェアの効率的評価を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。