Skip to main content
QUICK REVIEW

[論文レビュー] A Hermite-like basis for faster matrix-free evaluation of interior penalty discontinuous Galerkin operators

Martin Kronbichler, Katharina Kormann|arXiv (Cornell University)|Jul 19, 2019
Advanced Numerical Methods in Computational Mathematics被引用数 5
ひとこと要約

本稿は、1つの関数値と1つの微分値を1面あたりに制限することで、隣接データアクセスを低減する高次不連続ガラーキン法向けのヘルミート型基底を提案する。この基底はテンソル積と和因子化を用いてヘルミート型およびジャコビ基底のノード関数を組み合わせ、行列非依存の演算子評価を高速化する。p=5–10の多項式次数において、MPI並列化でノード基底と比較して最大2倍の性能を達成し、基底変換は現代のハードウェアにおけるメモリ帯域幅の背後で隠されている。

ABSTRACT

This work proposes a basis for improved throughput of matrix-free evaluation of discontinuous Galerkin symmetric interior penalty discretizations on hexahedral elements. The basis relies on ideas of Hermite polynomials. It is used in a fully discontinuous setting not for higher order continuity but to minimize the effective stencil width, namely to limit the neighbor access of an element to one data point for the function value and one for the derivative. The basis is extended to higher orders with nodal contributions derived from roots of Jacobi polynomials and extended to multiple dimensions with tensor products, which enable the use of sum factorization. The beneficial effect of the reduced data access on modern processors is shown. Furthermore, the viability of the basis in the context of multigrid solvers is analyzed. While a plain point-Jacobi approach is less efficient than with the best nodal polynomials, a basis change via sum-factorization techniques enables the combination of the fast matrix-vector products with effective multigrid constituents. The basis change is essentially for free on modern hardware because these computations can be hidden behind the cost of the data access.

研究の動機と目的

  • 高次スクリーブにおける広いステンシルのための行列非依存不連続ガラーキン法の高いメモリ帯域幅コストを解消する。
  • 行列非依存DGにおける隣接データアクセスを低減し、1面あたりの有効ステンシル幅を1つの関数値と1つの微分値に制限する。
  • 和因子化を介して高速な行列-ベクトル積を可能にする基底を構築すると同時に、標準的な積分と整合性を保つ。
  • 高速な行列非依存評価と基底変換を組み合わせることで、効果的なスムージングを実現する多重グリッドソルバーを可能にする。
  • 基底変換が現代のハードウェアにおける高FLOP/バイト比を活用して、メモリアクセスの背後で計算的に隠されることを保証する。

提案手法

  • ヘリミート型基底を六面体要素に提案し、特定の点で関数値と1階微分の連続性を強制することで、隣接結合を最小限に抑える。
  • ノード自由度にはジャコビ多項式の根を用い、それらをヘリミート型関数と組み合わせることで、データアクセスを最小限に抑える。
  • 多次元への拡張をテンソル積を用いて行い、和因子化に必要な構造を保持する。
  • 和因子化を適用することで、1セルあたりの計算量をO(pd+1)に抑え、自由度1つあたりの算術演算数をO(p)に削減する。
  • スムージングに使用するため、ヘリミート型基底からノード基底(例:ガウス=ロバチ)への基底変換を実装し、変換はメモリ帯域幅の背後で隠す。
  • チェビシェフ反復法に点ヤコビおよびブロックヤコビ preconditioner を適用し、多重グリッドソルバーにおける性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1ヘリミート型基底は、精度や整合性を損なわせることなく、行列非依存DG離散化における隣接データアクセスを低減できるか?
  • RQ2提案された基底は、高次DG法における標準ノード基底と比較して、より高速な行列-ベクトル積を実現できるか?
  • RQ3効果的な多重グリッドスムージングに必要な基底変換が、現代のプロセッサにおいてメモリ帯域幅の背後に隠され得るか?
  • RQ4p=5–10の多項式次数において、OpenMPおよびMPI並列化におけるヘリミート型基底とノード基底の性能はどのように比較されるか?
  • RQ5有効ステンシル幅の短縮が、行列非依存DGソルバーにおけるキャッシュ効率およびメモリ帯域幅利用に与える影響は何か?

主な発見

  • ヘリミート型基底は、1面あたり1つの関数値と1つの微分値にまで隣接データアクセスを低減し、有効ステンシル幅を顕著に制限する。
  • p=5–10の多項式次数において、MPIオンリーパラレル化でノード基底と比較して最大2倍の性能を達成する。
  • OpenMP並列化では、同じ多項式次数においてノード基底と比較して8–20%の性能向上を達成する。
  • プリコンディショニングのための基底変換は、現代のハードウェアではほぼ無料であり、チェビシェフ反復ループ内のメモリ転送コストの背後に隠されている。
  • 完全に統合されたチェビシェフ反復では、p=8で1反復あたり5.0 GDoF/sのスループットに達し、行列-ベクトル積を分離した場合の3.6 GDoF/sと比較して向上する。
  • 性能向上は、メモリ帯域幅が制限要因となる環境で顕著であり、データアクセスの低減が直接的に高い有効スループットに繋がる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。