Skip to main content
QUICK REVIEW

[論文レビュー] 4.45 Pflops Astrophysical N-Body Simulation on K computer -- The Gravitational Trillion-Body Problem

Tomoaki Ishiyama, Keigo Nitadori|arXiv (Cornell University)|Nov 19, 2012
Computational Physics and Python Applications被引用数 12
ひとこと要約

本論文は、Kコンピュータを用いた最初の重力的1兆体N体シミュレーションを提示しており、82,944ノードで4.45 Pflopsの性能を達成した。短距離力の計算には高度に最適化された重力カーネルを、長距離力の計算には新規のリレーメッシュ通信アルゴリズムを採用したハイブリッドTreePM法を用い、スケーラブルな性能と大規模スケールでの42%の効率性を実現した。

ABSTRACT

As an entry for the 2012 Gordon-Bell performance prize, we report performance results of astrophysical N-body simulations of one trillion particles performed on the full system of K computer. This is the first gravitational trillion-body simulation in the world. We describe the scientific motivation, the numerical algorithm, the parallelization strategy, and the performance analysis. Unlike many previous Gordon-Bell prize winners that used the tree algorithm for astrophysical N-body simulations, we used the hybrid TreePM method, for similar level of accuracy in which the short-range force is calculated by the tree algorithm, and the long-range force is solved by the particle-mesh algorithm. We developed a highly-tuned gravity kernel for short-range forces, and a novel communication algorithm for long-range forces. The average performance on 24576 and 82944 nodes of K computer are 1.53 and 4.45 Pflops, which correspond to 49% and 42% of the peak speed.

研究の動機と目的

  • Kスパコン上で1兆粒子の重力的N体シミュレーションを実行すること。
  • ハイブリッドTreePMアルゴリズムを用いて、大規模天体物理学的シミュレーションにおける高い性能とスケーラビリティを達成すること。
  • 従来の木構造アルゴリズムの限界と、過去の大規模シミュレーションにおける周期的境界条件の非効率性を克服すること。
  • KコンピュータのHPC-ACEアーキテクチャに最適化された重力カーネルおよび通信戦略を設計すること。
  • ダークマターを含む宇宙構造形成の研究に実用的なシミュレーション時間を提供すること。

提案手法

  • 短距離力は木構造アルゴリズム、長距離力は粒子メッシュ(PM)法を用いたハイブリッドTreePMアルゴリズムを採用した。
  • KコンピュータのHPC-ACEアーキテクチャに最適化された、短距離力計算のための高精度にチューニングされた重力カーネルを実装した。
  • 長距離力計算における遅延低減とスケーラビリティ向上を目的に、新規のリレーメッシュ通信アルゴリズムを開発した。
  • 計算効率の向上とシミュレーション領域全体における一貫性の確保のため、周期的境界条件を採用した。
  • 24,576〜82,944ノードにわたるノード間での負荷分散を実現するため、ドメイン分割と粒子交換、負荷バランスを適用した。
  • 通信オーバーヘッドの低減のため、FFT並列化を1軸に制限し、リレーメッシュを活用した。

実験結果

リサーチクエスチョン

  • RQ1ペタスケールスパコン上で1兆粒子の重力的N体シミュレーションを、高い効率性を維持して実行可能か?
  • RQ2Kコンピュータ上での性能とスケーラビリティの観点から、ハイブリッドTreePM法は純粋な木構造アルゴリズムと比べてどのように差がつくか?
  • RQ3大規模システムにおける長距離力計算の高性能化を実現するための通信戦略および負荷分散戦略は何か?
  • RQ4開放境界条件と比較して、周期的境界条件の使用がシミュレーションの正確性と計算効率に与える影響は何か?
  • RQ5大規模N体シミュレーションにおける性能ボトルネックは何か。また、現代のスパコン上でそれらをどのように緩和できるか?

主な発見

  • Kコンピュータの82,944ノードで4.45 Pflopsの性能を達成し、ピーク性能の42%を実現した。
  • 短距離力計算は1回の力サイクルあたり71%の効率性を達成し、理論的最大値に正規化すると95%の効率性に相当した。
  • 長距離力計算ではリレーメッシュ法を採用し、通信コストを低減し、FFTプロセス数が限られている状況下でも高いスケーラビリティを実現した。
  • 1粒子あたりの平均相互作用リスト長は約2,300粒子であり、周期的境界条件と最適化されたグループサイズのおかげで、従来のGPUベースのシミュレーションと比較して6倍短縮された。
  • 重力カーネルは72%の効率性を達成し、HPC-ACEアーキテクチャに強く最適化されていることが示された。
  • 82,944ノードで1ステップあたりの合計シミュレーション時間は60.20秒であり、うち短距離力計算に45.82秒、長距離力計算に6.74秒を要した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。