Skip to main content
QUICK REVIEW

[論文レビュー] Stop talking to me -- a communication-avoiding ADER-DG realisation

Dominic Etienne Charrier, Tobias Weinzierl|arXiv (Cornell University)|Jan 26, 2018
Numerical methods for differential equations参考文献 13被引用数 10
ひとこと要約

本論文は、通信を回避するADDER-DG離散化を提示しており、単一タッチのセマンティクスを強制することでデータ移動とメモリ圧力を低減し、アルゴリズム的手順をメッシュ走査から分離し、分散メモリ通信を計算の背後に隠す。この手法は、再帰的データアクセスを最小限に抑え、並列処理およびエクサスケール対応のシミュレーションにおけるタスクスケジューリングを最適化することで、特に低次の多項式と小さな時間ステップにおいて顕著な性能向上を達成する。

ABSTRACT

We present a communication- and data-sensitive formulation of ADER-DG for hyperbolic differential equation systems. Sensitive here has multiple flavours: First, the formulation reduces the persistent memory footprint. This reduces pressure on the memory subsystem. Second, the formulation realises the underlying predictor-corrector scheme with single-touch semantics, i.e., each degree of freedom is read on average only once per time step from the main memory. This reduces communication through the memory controllers. Third, the formulation breaks up the tight coupling of the explicit time stepping's algorithmic steps to mesh traversals. This averages out data access peaks. Different operations and algorithmic steps are ran on different grid entities. Finally, the formulation hides distributed memory data transfer behind the computation aligned with the mesh traversal. This reduces pressure on the machine interconnects. All techniques applied by our formulation are elaborated by means of a rigorous task formalism. They break up ADER-DG's tight causal coupling of compute steps and can be generalised to other predictor-corrector schemes.

研究の動機と目的

  • ハイパーオニックPDEの高性能コンピューティングにおけるデータ移動の増大するボトルネックに対処すること。
  • データアクセス最適化を通じて、ADDER-DGスキームにおけるメモリ帯域幅圧力と通信オーバーヘッドを低減すること。
  • 計算の背後に通信を隠すことで、分散メモリシステムにおけるADDER-DGの効率的でスケーラブルな並列実行を可能にすること。
  • 通信を回避する技術をADDER-DGを越えた予測-補正スキームに一般化すること。
  • 地震波および天体物理学的波シミュレーションを含む実世界の応用において、手法の有効性を検証すること。

提案手法

  • 各自由度がメインメモリから1回ずつ読み込まれる単一タッチのセマンティクスをADDER-DGに導入し、1時間ステップあたり1回のみ読み込みを保証する。
  • 予測、リーマン解法、補正ステップをメッシュ走査の厳密な順序から分離し、異なるグリッド要素に対して独立したスケジューリングを可能にする。
  • 通信をメッシュ走査とタスクスケジューリングに合わせることで、分散メモリデータ転送を計算の背後に隠す。
  • タスクベースの形式を用いてデータアクセスパターンとアルゴリズム的依存関係をモデル化・最適化する。
  • 予測とリーマン解法フェーズを統合するファージョンタイムステッピングを適用し、同期と通信オーバーヘッドを低減する。
  • 衝撃が存在する場合のロバスト性を確保するため、有限体積法のリミッターを採用しながら、滑らかな領域では高次精度を維持する。

実験結果

リサーチクエスチョン

  • RQ1ADDER-DGをどのように再構築すれば、高性能コンピューティングにおけるデータ移動とメモリ帯域幅圧力を最小限に抑えられるか?
  • RQ2分散メモリADDER-DGにおける通信を計算の背後にどれほど隠すことができるか?
  • RQ3予測ステップとリーマン解法ステップの統合が、さまざまな多項式次数において性能とスケーラビリティに与える影響はいかほどか?
  • RQ4通信を回避する技術を、有限体積法を含む他の予測-補正スキームに一般化できるか?
  • RQ5タスクスケジューリングとロードバランシングが、分散メモリ環境における通信を回避するADDER-DGの性能に与える影響は?

主な発見

  • 通信を回避するADDER-DG定式化は、特に低次の多項式(p ≤ 5)と小さな時間ステップにおいて顕著な性能向上を達成する。
  • ファージョンタイムステッピングにより、3段階の逐次的手法よりも1時間ステップあたりの合計時間が短縮され、特にp = 2およびp = 3のとき顕著である。
  • KNLおよびBroadwellアーキテクチャ上では、ファージョンアプローチにより通信を計算の背後に隠し、分散メモリ環境でも測定可能な性能向上が得られた。
  • 予測ステップ(STP)が実行時間の大部分を占める場合に最も効果的であり、通信が計算と効率的にオーバーラップされる。
  • 多項式次数が増加するにつれて、STPフェーズのコストが増加するため、統合の相対的利点が低下し、性能向上が小さくなる。
  • 適切に負荷バランシングを管理し、サブドメイン境界に沿ってタスクを優先順位付けすれば、分散メモリ実行においてもスケーラビリティと有効性を維持できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。