Skip to main content
QUICK REVIEW

[論文レビュー] Modern Gyrokinetic Particle-In-Cell Simulation of Fusion Plasmas on Top Supercomputers

Bei Wang, S. Ethier|arXiv (Cornell University)|Oct 19, 2015
Magnetic confinement fusion research参考文献 26被引用数 5
ひとこと要約

本稿では、エクサスケールスーパーコンピュータ向けに最適化された、非常にスケーラブルで近代化されたギャロアクイネティック粒子法(PIC)コード、GTC-Pを提示する。GTC-Pは、核融合プラズマにおけるイオン温度勾配乱流の5次元シミュレーションを、未曾有のスケールで可能にする。2次元ドメイン分割、高度なスレッドレベル最適化、および異種アクセラレータ(GPUとXeon Phi)のサポートを導入することで、多様なHPCアーキテクチャにおいて極めて高いスケーラビリティとパフォーマンスを達成し、従来のコードと比較して輸送係数が低減したITERスケールのプラズマに対する長時間・高分解能シミュレーションを実現する。

ABSTRACT

The Gyrokinetic Toroidal Code at Princeton (GTC-P) is a highly scalable and portable particle-in-cell (PIC) code. It solves the 5D Vlasov-Poisson equation featuring efficient utilization of modern parallel computer architectures at the petascale and beyond. Motivated by the goal of developing a modern code capable of dealing with the physics challenge of increasing problem size with sufficient resolution, new thread-level optimizations have been introduced as well as a key additional domain decomposition. GTC-P's multiple levels of parallelism, including inter-node 2D domain decomposition and particle decomposition, as well as intra-node shared memory partition and vectorization have enabled pushing the scalability of the PIC method to extreme computational scales. In this paper, we describe the methods developed to build a highly parallelized PIC code across a broad range of supercomputer designs. This particularly includes implementations on heterogeneous systems using NVIDIA GPU accelerators and Intel Xeon Phi (MIC) co-processors and performance comparisons with state-of-the-art homogeneous HPC systems such as Blue Gene/Q. New discovery science capabilities in the magnetic fusion energy application domain are enabled, including investigations of Ion-Temperature-Gradient (ITG) driven turbulence simulations with unprecedented spatial resolution and long temporal duration. Performance studies with realistic fusion experimental parameters are carried out on multiple supercomputing systems spanning a wide range of cache capacities, cache-sharing configurations, memory bandwidth, interconnects and network topologies. These performance comparisons using a realistic discovery-science-capable domain application code provide valuable insights on optimization techniques across one of the broadest sets of current high-end computing platforms worldwide.

研究の動機と目的

  • ITERのような大規模核融合プラズマをシミュレートする際、従来のギャロアクイネティックPICコードのスケーラビリティとパフォーマンスの制限を克服すること。
  • 1次元ドメイン分割におけるメモリボトルネックを克服するため、径方向およびトロイダル方向に2次元ドメイン分割を導入すること。
  • GPUおよびXeon Phiアクセラレータを含む現代のスーパーコンピューティングアーキテクチャを活用して、トカマクにおけるマイクロ乱流の長時間・高分解能シミュレーションを可能にすること。
  • PICワークロードにおけるメモリ帯域幅、キャッシュ階層、インターコネクト効果の分析を通じて、多様なHPCプラットフォームにおけるパフォーマンス最適化を実現すること。
  • 磁気核融合エネルギー分野における発見的科学を支援するため、空間分解能と時間的持続期間が未曾有の高水準に達するシミュレーションを可能にすること。

提案手法

  • 径方向およびトロイダル方向に2次元ドメイン分割を実装し、プロセスごとのメモリ使用量を削減し、負荷バランスを改善する。
  • 各ドメイン内での粒子分割を導入することで、数千のコンピューティングノードにわたる強スケーリングを維持する。
  • CPUアーキテクチャにおけるノード内最適化のため、OpenMPによる共有メモリ並列処理とベクトル化を活用する。
  • NVIDIA GPUとIntel Xeon Phiコプロセッサの両方に対して、それぞれCUDAおよびオフロードディレクティブを用いてキーパーフォーマンスカーネルを移植し、データ並列性およびスレッド並列性を活用する。
  • 分散メモリ通信に二重側MPIを採用し、大規模システムにおけるスケーラビリティ向上のため、将来の1方向MPI(MPI-3.0)への移行を計画する。
  • 長時間シミュレーションの安定化のため、エネルギー保存性を向上させ、人工的輸送を低減するために、従来のヒートバスモデルに代わる数値的拡散を導入する。

実験結果

リサーチクエスチョン

  • RQ11次元分割と比較して、2次元ドメイン分割は5次元ギャロアクイネティックPICシミュレーションにおけるメモリスケーラビリティとパフォーマンスにどのように寄与するか?
  • RQ2特にメモリ帯域幅、データ移動、PCIeのオーバーヘッドに注目した場合、現代の異種スーパーコンピュータにおけるPICコードのパフォーマンスボトルネックは何か?
  • RQ3キャッシュ階層、メモリ帯域幅、インターコネクトトポロジーといったシステムレベル要因は、多様なHPCプラットフォームにおけるギャロアクイネティックシミュレーションのパフォーマンスにどのように影響するか?
  • RQ4GTC-Pは、ペタスケールおよびエクサスケールクラスのシステムにおいて、高分解能と長時間シミュレーションを維持したまま、どの程度の強スケーリングを達成できるか?
  • RQ5数値的安定化手法(例:数値的拡散対ヒートバス)の違いが、長期的なマイクロ乱流シミュレーションにおける輸送係数とエネルギー保存性に与える影響は何か?

主な発見

  • GTC-PはMiraスーパーコンピュータ上で最大32,768のコンピューティングノードにスケーリングし、標準設定の1000倍のマイナー半径に達するプラズマデバイスのシミュレーションを可能にした。
  • 2次元ドメイン分割により、プロセスごとのメモリ要件が顕著に削減され、高空間分解能でITERスケールのプラズマをシミュレート可能となった。
  • GPUおよびXeon Phiコプロセッサにおけるパフォーマンスは、STREAM帯域幅予測値を大幅に下回っている。これは、データ局所性、同期化、PCIe転送のオーバーヘッドに起因する。
  • ネットワークパフォーマンスは、特に長時間実行のシミュレーションにおいて、深刻なボトルネックとして浮上し、インターコネクト効率の重要性を強調している。
  • GTC-Pシミュレーションにおける時間平均の熱伝導度は、大規模プラズマにおいて輸送係数が徐々に「ロールオーバー」する傾向を示し、従来の低分解能シミュレーションと比較して顕著に低減している。これは、高分解能領域で輸送が低減している可能性を示唆している。
  • ヒートバスモデルに代わる数値的拡散の導入により、長期的なエネルギー保存性が向上し、人工的輸送が低減したが、輸送係数の差の正確な原因はまだ調査中である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。