Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Aggregation Based Domain Decomposition Multigrid for the Lattice Wilson Dirac Operator

Andreas Frommer, Karsten Kahl|arXiv (Cornell University)|Mar 6, 2013
Advanced Numerical Methods in Computational Mathematics参考文献 30被引用数 11
ひとこと要約

本稿では、格子QCDにおける格子ウィルソンディラック作用素を解くための、新しいアダプティブ集約ベースのドメイン分解多重グリッド法であるDD-αAMGを提案する。ドメイン分解をスムージングに用い、アダプティブ代数的多重グリッドの階層構築を組み合わせることで、非正確なデフレーションより最大1.43倍の高速化を達成し、8,192コア環境でも2–3倍の高速化を実現。同時にセットアップコストを低減し、再帰的多重グリッドサイクルの実現を可能にした。

ABSTRACT

In lattice QCD computations a substantial amount of work is spent in solving discretized versions of the Dirac equation. Conventional Krylov solvers show critical slowing down for large system sizes and physically interesting parameter regions. We present a domain decomposition adaptive algebraic multigrid method used as a precondtioner to solve the "clover improved" Wilson discretization of the Dirac equation. This approach combines and improves two approaches, namely domain decomposition and adaptive algebraic multigrid, that have been used seperately in lattice QCD before. We show in extensive numerical test conducted with a parallel production code implementation that considerable speed-up over conventional Krylov subspace methods, domain decomposition methods and other hierarchical approaches for realistic system sizes can be achieved.

研究の動機と目的

  • ウィルソンディラック作用素のための強固でスケーラブルな予め条件子を開発し、格子QCDシミュレーションにおける臨界遅れの緩和を図ること。
  • 従来のクリロフ法ソルバーおよび既存の予め条件子(例:奇偶分割、デフレーション)が依然として臨界遅れに苦しむという限界を克服すること。
  • ドメイン分解をアダプティブ代数的多重グリッドにスムージングとして統合し、並列スケーラビリティを向上させ、グローバル通信を低減すること。
  • 非正確なデフレーションとは異なり、粗グリッドの解法に低い精度要件を課すことにより、セットアップ時間を短縮し、再帰的多重グリッドサイクルを可能にすること。
  • ジュラープなどのスーパーコンピュータ上でMPIとハイブリッドOpenMP+MPIを用いた並列で生産品質のコードベースを用いて、現実的で大規模な格子構成における優れた性能を実証すること。

提案手法

  • 並列性と通信の低減を図るために、従来のクリロフ法ベースのスムージングに代えて、ドメイン分解(DD)をスムージングとして用いる多重グリッドフレームワークを提案する。
  • Γ₅対称性を保持するとともに、テストベクトルに基づくアダプティブ補間を用いることで、格子QCDに適合したアグリゲーションベースの代数的多重グリッド(AMG)フレームワークを適応させる。
  • 粗グリッド作用素を低精度で計算する新しいアダプティブセットアップ戦略を導入し、セットアップを高速化するとともに再帰的多重グリッドサイクルを可能にする。
  • 粗グリッド系を近似的に解く二段階法を採用することで、完全な多重グリッドサイクルへの拡張を可能にする。
  • ジュラープのようなスーパーコンピュータ上でMPIとハイブリッドOpenMP+MPIを用いた並列で生産品質のコードベースに実装する。
  • 非正確なデフレーションフレームワークを基準として用いるが、粗グリッド解法の精度を低下させ、再帰を可能にするなどして、真の多重グリッド法に再定式化する。

実験結果

リサーチクエスチョン

  • RQ1ドメイン分解は、格子ウィルソンディラック作用素に対する代数的多重グリッドのスムージングとして効果的に機能するか? 並列スケーラビリティの向上と通信の低減が図れるか?
  • RQ2提案されたアダプティブセットアップ戦略は、従来のAMGおよび非正確なデフレーション手法と比較して、セットアップコストと収束速度の点でどのように差をつけるか?
  • RQ3従来のクリロフ法ソルバーや既存の予め条件子と比較して、新しい手法は臨界遅れをどの程度低減するか?
  • RQ4粗グリッドの解法に低い精度を適用しても収束性が劣化せず、再帰的多重グリッドサイクルが可能になるか?
  • RQ5数千のCPUコアを用いた大規模で現実的な格子構成において、この手法はどの程度の性能向上を達成するか?

主な発見

  • 条件数が悪く、128×64³の格子で実行した場合、DD-αAMGは非正確なデフレーションより1.43倍の高速化を達成し、セットアップ時間と解法時間ともに40%以上短縮された。
  • 8,192コア環境では、標準的なAMGと比較してDD-αAMGは2–3倍の高速化を達成し、解法時間はAMGの5.51秒から1.82秒にまで短縮された。
  • 8,192コアでDD-αAMGのセットアップ時間は27.7秒にまで短縮されたのに対し、デフォルトのAMG設定では89.9秒であった。一方、解法ごとに10–11回のGMRES反復を維持した。
  • ドメイン分解スムージングによりグローバル通信が低減され、特にコア数が多い場合に優れた強スケーリング性能を示した。
  • 従来のAMG手法がBiCGStabを用いて高精度の固有ベクトル近似を必要とするのに対し、アダプティブセットアップフェーズは著しく高速であった。
  • 粗グリッドの解法精度を低くしたにもかかわらず、DD-αAMGは収束性を安定的に維持し、再帰的多重グリッドサイクルの実現可能性を実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。