Skip to main content
QUICK REVIEW

[論文レビュー] A modular massively parallel computing environment for three-dimensional multiresolution simulations of compressible flows

Nils Hoppe, Stefan Adami|arXiv (Cornell University)|Dec 8, 2020
Computational Fluid Dynamics and Aerodynamics参考文献 45被引用数 4
ひとこと要約

本論文は、重み付き非線形再構成を用いた有限体積法による3次元圧縮流体シミュレーションのための、モジュラーで大規模並列処理が可能なブロックベースのマルチスケール(MR)フレームワークを提示する。近接セル間通信に修正されたモーテルン順序を採用し、MPIベースのドメイン分割を組み合わせることで、効率的な負荷バランスと高いスケーラビリティを実現した。強力なスケーリング性能と弱いスケーリング性能を示し、O(10³)コアで10億セルを超える有効な解像度を達成した。

ABSTRACT

Numerical investigation of compressible flows faces two main challenges. In order to accurately describe the flow characteristics, high-resolution nonlinear numerical schemes are needed to capture discontinuities and resolve wide convective, acoustic and interfacial scale ranges. The simulation of realistic 3D problems with state-of-the-art FVM based on approximate Riemann solvers with weighted nonlinear reconstruction schemes requires the usage of HPC architectures. Efficient compression algorithms reduce computational and memory load. Fully adaptive MR algorithms with LTS have proven their potential for such applications. While modern CPU require multiple levels of parallelism to achieve peak performance, the fine grained MR mesh adaptivity results in challenging compute/communication patterns. Moreover, LTS incur for strong data dependencies which challenge a parallelization strategy. We address these challenges with a block-based MR algorithm, where arbitrary cuts in the underlying octree are possible. This allows for a parallelization on distributed-memory machines via the MPI. We obtain neighbor relations by a simple bit-logic in a modified Morton Order. The block-based concept allows for a modular setup of the source code framework in which the building blocks of the algorithm, such as the choice of the Riemann solver or the reconstruction stencil, are interchangeable without loss of parallel performance. We present the capabilities of the modular framework with a range of test cases and scaling analysis with effective resolutions beyond one billion cells using $\mathcal{O}(10^3)$ cores.

研究の動機と目的

  • アダプティブメッシュ細分化を用いた高解像度3次元圧縮流体シミュレーションにおける計算およびメモリの課題に対処すること。
  • 多様な数値スキームと流体モデルをサポートできるスケーラブルでモジュラーかつポータブルなHPCフレームワークを開発すること。
  • 分散メモリシステムにおける細粒度メッシュ適応と局所時間ステッピング(LTS)の性能ボトルネックを克服すること。
  • 現代のHPCアーキテクチャ上で高次精度と保存性を備えた効率的なマルチスケールシミュレーションを可能にすること。

提案手法

  • MPIを用いた効率的なドメイン分割を可能にするために、任意のオクトリー切断を許容するブロックベースのマルチスケールアルゴリズムを採用する。
  • 明示的な照合テーブルを用いずに、ビット演算を用いた修正されたモーテルン順序により、近接セル関係を計算する。
  • 各レベルにおける空間満たし曲線(SFC)に基づく負荷バランスを導入し、プロセッサ間で作業を均等に分配する。
  • パフォーマンス損失なしに、Riemannソルバーや再構成ステンシルなどの交換可能な数値カーネルを、モジュラーなC++フレームワークでサポートする。
  • 低動的領域における計算コストを削減するために、アダプティブ局所時間ステッピング(ALTS)を実装する。
  • 誤差の切断に基づいて動的にメッシュを細分化するウェーブレットベースの圧縮技術を用いる。

実験結果

リサーチクエスチョン

  • RQ1複雑な通信パターンを示す分散メモリHPCシステムにおいて、マルチスケールフレームワークを効率的に並列化する方法は何か?
  • RQ2修正されたモーテルン順序を用いたブロックベースのマルチスケール手法は、セルベース手法と比較して、性能とスケーラビリティをどの程度維持できるか?
  • RQ3モジュラー設計は、パラレル効率を損なわずに多様な高次数値スキームをサポートできるか?
  • RQ4大規模な3次元圧縮流体問題に対して、数千コアにわたる弱いスケーリングと強いスケーリングにおいて、このフレームワークはどの程度スケーリングするか?
  • RQ5アダプティブ局所時間ステッピングとブロックベースの細分化を組み合わせることで、どの程度のメッシュ圧縮比と計算効率が達成できるか?

主な発見

  • フレームワークは1,680コアまで強いスケーリングと弱いスケーリングを達成し、大規模HPCシステムでも優れた並列効率を示した。
  • 10億セルを超える有効な解像度が達成され、複雑な圧縮流体の高精度3次元シミュレーションが可能になった。
  • セルベースMR手法と同等のメッシュ圧縮比が得られ、ブロックベース手法の有効性が裏付けられた。
  • モジュラー設計により、異なるRiemannソルバーや再構成ステンシルのシームレスな統合が可能で、パフォーマンス劣化なしに実現された。
  • 修正されたモーテルン順序の使用により、ビット論理演算による高速な近接セル通信が可能になり、実行時オーバーヘッドが低減された。
  • フレームワークはオープンソースであり、プロダクション環境で利用可能で、ショックチューブ、ヴォーテックス相互作用、乱流を含む複数のテストケースで妥当性が検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。