QUICK REVIEW
[論文レビュー] Alsvinn: A Fast multi-GPGPU finite volume solver with a strong emphasis on reproducibility
Kjetil Olsen Lye|arXiv (Cornell University)|Dec 16, 2019
Meteorological Phenomena and Simulations被引用数 4
ひとこと要約
Alsvinn は、不確実性評価(UQ)を内蔵したハイパーオンリック保存則のための高性能でマルチ-GPGPU対応の有限体積法ソルバであり、複雑な3次元流れのスケーラブルで再現可能なシミュレーションを可能にする。512 GPU における優れた弱スケーリングと、NVIDIA P100 で 60% を超えるメモリ帯域幅利用率を達成しており、UQ を重視する問題において CPU 基盤のソルバーよりも 1 時間程度の高速化を実現している。
ABSTRACT
We present the Alsvinn simulator, a fast multi general purpose graphical processing unit (GPGPU) finite volume solver for hyperbolic conservation laws in multiple space dimensions. Alsvinn has native support for uncertainty quantifications, and exhibits excellent scaling on top tier compute clusters.
研究の動機と目的
- 現代の GPGPU クラスタ上で、ハイパーオンリック保存則における不確実性評価(UQ)の計算ボトル neck を克服し、効率的で再現可能かつスケーラブルなシミュレーションを可能にすること。
- モンテカルロ法、準モンテカルロ法、マルチレベルモンテカルロ法といった複数のUQ手法を、1つの高性能フレームワーク内でネイティブにサポートする有限体積法ソルバの開発。
- 通信と計算のオーバーラップおよびデータ移動の最小化により、マルチGPUおよびマルチノードアーキテクチャにおいて高いパフォーマンスと強いスケーリングを実現すること。
- 開発者負荷を最小限に抑えながら、広範な方程式、数値フラックス、および再構成スキームをサポートする、ポータブルで拡張可能な C++/CUDA/MPI 実装の提供。
- GPGPU アクceleration を用いて、不適切に定式化されたハイパーオンリック系の確率的定式化を、高空間・時間分解能および統計的分解能で効率的にシミュレートできるかの実証。
提案手法
- Alsvinn は、高次再構成(例:WENO)と強安定性保持ルンゲ・クッタ時間積分法を用いた、半離散有限体積法を実装している。これはハイパーオンリック保存則に適している。
- コンパイル時と実行時のポリモーフィズムのハイブリッドモデルを採用し、GPU プrogramming の専門知識がなくても、自動的に最適化された CPU および GPGPU カーネルを生成可能である。
- HLLC、ゴドノフ、ロウ、エントロピー保存フラックスなど、複数の数値フラックスをサポートしており、実行時選択と自動カーネル生成が可能である。
- マルチGPU環境では、通信を回避し、通信と計算を重ねる技術を用い、ハロ(hollow)データ交換をコンパクトにし、内部ドメイン計算と並列化して実行している。
- UQモジュールは、サンプリングに基づく確率的統合を介して統計的ソリューションフレームワークを統合しており、MPI ロードバランシングを伴う単一レベルおよびマルチレベルモンテカルロ法をサポートしている。
- 平均、分散、確率密度関数(PDF)推定などのすべてのUQ操作を、GPU 上で直接計算することで、データ転送および保存のオーバーヘッドを最小限に抑える。
実験結果
リサーチクエスチョン
- RQ1512 GPU で、3次元ハイパーオンリックPDEに対して、優れた弱スケーリングを達成すると同時に、高いメモリ帯域幅利用率を維持できるマルチ-GPGPU有限体積法ソルバは実現可能か?
- RQ2複雑な3次元流れのシミュレーションにおいて、GPGPUベースのUQ対応有限体積法ソルバのパフォーマンスは、高度に最適化されたCPUベースのソルバーよりも優れているか?
- RQ3通信のオーバーヘッドを、オーバーラップおよびコンパクト化技術を用いてどれほど低減できるか?
- RQ41つのソフトウェアスタックが、高次数値スキームと多様なUQサンプリング手法を、最小限のパフォーマンスペナルティでネイティブにサポートできるか?
- RQ5GPGPU アクセレレーションを用いて、スケール上で不適切に定式化されたハイパーオンリック保存則の高分解能統計的ソリューションを実行することは可能か?
主な発見
- Alsvinn は、ケルビン=ヘルムホルツ不安定性の2次元および3次元シミュレーションにおいて、512 GPU で優れた弱スケーリングを達成しており、解像度が向上しても1タイムステップあたりの実行時間がほぼ一定を維持している。
- 3次元解像度 2048³ において、1タイムステップあたり 0.105 秒の実行時間を達成しており、大規模なUQシミュレーションにおいて高いパフォーマンスを示している。
- 512 GPU を使用する際、2次元では通信オーバーヘッドが 10% 未満、3次元では約 30% であり、3次元における O(N²) のハロデータ成長に起因するものであることが予想通りである。
- 1台のNVIDIA Tesla P100 において、Alsvinn は理論的メモリ帯域幅の 60% を超える利用率を達成しており、メモリ帯域幅に制限を受けており、適切に最適化されていることが確認された。
- ソルバはピークFLOPSの約 10% を達成しており、これはメモリ制限の有限体積法アルゴリズムと整合しており、複雑な高次スキームにおいても高い効率を維持している。
- Alsvinn は、高空間・時間分解能および統計的分解能で、3次元圧縮流体の統計的ソリューションのグローバルスケールシミュレーションを初めて可能にした。スケールでの実現可能性とパフォーマンスの両面で実証された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。