Skip to main content
QUICK REVIEW

[論文レビュー] Towards Exascale for Wind Energy Simulations

Misun Min, Michael Brazell|arXiv (Cornell University)|Sep 30, 2022
Wind Energy Research and Development被引用数 11
ひとこと要約

本稿は、風力エネルギーに関連する大気境界層(ABL)流れのための大規模済み乱流シミュレーション(LES)を想定し、2つのオープンソースCFDコード—NekRS(高次スペクトル要素法)およびAMR-Wind(AMRを備えたブロック構造化有限体積法)—のエクサスケール環境適合性を評価している。SummitおよびCrusherスパコンを用いて、最大4,800個のGPUにおける強スケーリングおよび弱スケーリングを実証し、問題サイズにかかわらずAMR-WindがNekRS比1.4–2.0倍の性能を達成していることが示された。また、圧力ポアソン解法が主なスケーリングボトルネックであることが特定された。

ABSTRACT

We examine large-eddy-simulation modeling approaches and computational performance of two open-source computational fluid dynamics codes for the simulation of atmospheric boundary layer (ABL) flows that are of direct relevance to wind energy production. The first is NekRS, a high-order, unstructured-grid, spectral element code. The second, AMR-Wind, is a block-structured, second-order finite-volume code with adaptive-mesh-refinement capabilities. The objective of this study is to co-develop these codes in order to improve model fidelity and performance for each. These features will be critical for running ABL-based applications such as wind farm analysis on advanced computing architectures. To this end, we investigate the performance of NekRS and AMR-Wind on the Oak Ridge Leadership Facility supercomputers Summit, using 4 to 800 nodes (24 to 4,800 NVIDIA V100 GPUs), and Crusher, the testbed for the Frontier exascale system using 18 to 384 Graphics Compute Dies on AMD MI250X GPUs. We compare strong- and weak-scaling capabilities, linear solver performance, and time to solution. We also identify leading inhibitors to parallel scaling.

研究の動機と目的

  • エクサスケールクラスのGPUアクセラレートHPCシステムにおけるNekRSおよびAMR-Windの拡張性および性能を評価すること。
  • エクサスケールアーキテクチャ上でコードの効率と忠実度を向上させることで、風力発電所や地域気象の高精度LESを可能にすること。
  • 並列スケーリングにおける主なパフォーマンスボトル neck、特に線形ソルバーや通信集約型カーネルの特定。
  • 2つのコードを共同開発し、エクサスケール環境への展開に向けたモデル精度と計算効率を向上させること。
  • エクサスケール適合性を示すために、SummitおよびCrusherシステムを用いて最大4,800GPUでの強スケーリングおよび弱スケーリングを実証すること。

提案手法

  • オールドリッジリーダーシップファシリティのシステムを用いて、NekRSおよびAMR-WindでGABLSベンチマーク問題の大規模済み乱流シミュレーション(LES)を実施。
  • NekRS(高次、非構造格子スペクトル要素法)と、AMR-Wind(ブロック構造化、2次精度有限体積法、メッシュの適応的細分化機能を備えたコード)を用いる。
  • Summitでは4–800ノード(24–4,800個のV100 GPU)およびCrusherでは18–384個のGraphics Compute Dies(MI250X GPU)を用い、強スケーリングおよび弱スケーリングのパフォーマンスを測定。
  • スケーリングボトル neck を特定するために、非線形移流項および圧力ポアソン解法といった主要な計算カーネルをプロファイリング。
  • ホストCPU上で粗格子ソルブに代数的マルチグリッド(hypre)を採用し、実行時間、反復回数、実行時間対物理時間比を分析。
  • 問題サイズやプロセッサ数の違いに応じたパフォーマンス比較を実施。特に、ブロック構造化分割に起因する2のべき乗のプロセッサ数がAMR-Windに与える影響に注目。

実験結果

リサーチクエスチョン

  • RQ1NekRSおよびAMR-Windは、SummitおよびCrusherのようなGPUアクセラレートエクサスケールクラスのシステムでどのようにスケーリングするか?
  • RQ2現代のHPCアーキテクチャ上での大気境界層流れの大型乱流シミュレーションにおける主なパフォーマンスボトル neck は何か?
  • RQ3線形ソルバーのプリコンディショナの選択が、LESシミュレーションの収束性およびスケーリングにどのように影響するか?
  • RQ4AMR-Windのパフォーマンスは、そのブロック構造化設計に起因して、2のべき乗のプロセッサ数に強く依存するか?
  • RQ5エクサスケールシステム上での気象および風力エネルギーモデリングにおいて、実行時間対物理時間比(rt)を1未満に維持できるか?

主な発見

  • NekRSは、1GPUあたり200万点のn/P比で、並列効率80%を達成し、物理1秒あたり0.11秒の実行時間を記録した。
  • AMR-Windは、全テスト問題サイズおよびGPU数において、NekRS比1.4–2.0倍のパフォーマンスを達成した。
  • 両コードにおいて、強スケーリングを制限する主な通信集約型ボトル neck として、圧力ポアソン解法が特定された。
  • AMR-Windは、GPU数が2のべき乗である場合、ブロック分割の利点により、並列効率が最大36%向上した。
  • NekRSにおいては、1つのAMD MI250X Graphics Compute Dieが、Summitの1つのNVIDIA V100 GPUと同等のパフォーマンスを示した。
  • 物理領域サイズを固定した場合、線形解像度を2倍にすると、実行時間対物理時間比(rt)が2倍に増加した。これは、固定ドメインサイズで必要なタイムステップ数が増加するためである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。