Skip to main content
QUICK REVIEW

[論文レビュー] Optimising PICCANTE - an Open Source Particle-in-Cell Code for Advanced Simulations on Tier-0 Systems

A. Sgattoni, Luca Fedeli|arXiv (Cornell University)|Mar 9, 2015
Magnetic confinement fusion research参考文献 2被引用数 12
ひとこと要約

本論文は、Tier-0ハイパフォーマンスコンピューティング(HPC)システムを対象とした、オープンソースで完全相対論的Particle-in-Cell(PIC)コードPICCANTEの最適化戦略を提示する。Scalascaを用いたパフォーマンスプロファイリングと、JUQUEENおよびFERMIにおけるI/Oおよび並列化ルーチンの最適化を通じて、強スケーリングおよび弱スケーリング効率に顕著な向上が達成され、元のバージョンと比較してスケーリング性とI/Oパフォーマンスが向上していることが示された。

ABSTRACT

We present a detailed strong and weak scaling analysis of PICCANTE, an open source, massively parallel, fully-relativistic Particle-In-Cell (PIC) code. PIC codes are widely used in plasma physics and astrophysics to study the cases where kinetic effects are relevant. PICCANTE is primarily developed to study laser-plasma interaction. Within a PRACE Preparatory Access Project, various revisions of different routines of the code have been analysed on the HPC systems JUQUEEN at Juelich Supercomputing Centre (JSC), Germany, and FERMI at CINECA, Italy, to improve scalability and I/O performance of the application. The diagnostic tool Scalasca is used to identify suboptimal routines. Different output strategies are discussed. The detailed strong and weak scaling behaviour of the improved code are presented in comparison with the original version of the code.

研究の動機と目的

  • Tier-0 HPCシステムにおけるPICCANTEコードのスケーリング性とI/Oパフォーマンスの向上を目的とする。
  • 診断ツールを用いて、元のPICCANTE実装におけるパフォーマンスボトルネックを同定することを目的とする。
  • 大規模HPCアーキテクチャ全体における強スケーリングおよび弱スケーリング動作の評価と最適化を目的とする。
  • 大規模プラズマシミュレーションにおけるI/Oオーバーヘッドを低減するためのI/O戦略の強化を目的とする。
  • 高性能コード最適化を通じて、高度なレーザー-プラズマ相互作用シミュレーションを支援することを目的とする。

提案手法

  • PICCANTEにおける非効率なルーチンを特定するためのScalascaパフォーマンス分析ツールの適用。
  • JUQUEENおよびFERMIを含むTier-0 HPCシステムにおける、さまざまなコードルーチンの体系的プロファイリング。
  • 負荷バランスの向上と遅延の低減を図るための、並列化および通信パターンの見直しと実装。
  • 大規模シミュレーションにおけるI/Oボトルネックを最小限に抑えるための複数のI/O戦略の評価。
  • 生産用HPCシステム上で強スケーリングおよび弱スケーリングテストを用いた最適化コードのベンチマーク。
  • PICCANTEの元バージョンと最適化済みバージョンの間でのパフォーマンス指標の比較。

実験結果

リサーチクエスチョン

  • RQ1PICCANTEの元のルーチンは、Tier-0 HPCシステム上で強スケーリングおよび弱スケーリングにおいてどのように動作するか?
  • RQ2PICCANTEのどのコードルーチンに非効率な性能が見られ、その主なボトルネックは何か?
  • RQ3異なるI/O戦略は、PICCANTEの全体的なパフォーマンスとスケーリング性にどのように影響を与えるか?
  • RQ4通信および負荷バランスのルーチンに対する的確な最適化によって、コードのスケーリング性はどの程度向上できるか?
  • RQ5コード最適化後に強スケーリングおよび弱スケーリングでどの程度のパフォーマンス向上が達成されたか?

主な発見

  • 最適化されたPICCANTEバージョンは、JUQUEENおよびFERMIシステムの両方で顕著に向上した強スケーリング効率を示した。
  • 弱スケーリング性能が向上し、大規模なプロセッサ数までほぼ線形のスケーリングが観察された。
  • 最適化された出力戦略の採用により、I/Oパフォーマンスが著しく向上し、I/Oオーバーヘッドが削減された。
  • Scalascaプロファイリングにより、通信およびメモリアクセスルーチンにおける重要なパフォーマンスボトルネックが的確に同定された。
  • 見直されたコードは、より良い負荷バランスと低減された通信遅延を実現し、並列効率の向上に寄与した。
  • 全体的な最適化プロセスにより、測定可能なパフォーマンス向上が達成され、よりスケーラブルで効率的なレーザー-プラズマ相互作用シミュレーションが可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。