Skip to main content
QUICK REVIEW

[論文レビュー] Hierarchically deflated conjugate gradient

P A Boyle|arXiv (Cornell University)|Feb 11, 2014
Matrix Theory and Algorithms参考文献 20被引用数 16
ひとこと要約

本稿では、ラティスQCDにおける5次元キラルフェルミオン系(ドメインウォールおよびモビウスフェルミオンなど)を解くための階層的縮約付き共役勾配法(HDCG)を提案する。4次元粗格子と赤外線シフトプリコンディショナを用いることで、ステンシルの複雑さと通信コストを低減し、粗格子演算で最大10倍の高速化を達成するとともに、BlueGene/Qハードウェア上でも収束効率を維持する。

ABSTRACT

We present a multi-level algorithm for the solution of five dimensional chiral fermion formulations, including domain wall and Mobius Fermions. The algorithm operates on the red-black preconditioned Hermitian operator, and directly accelerates conjugate gradients on the normal equations. The coarse grid representation of this matrix is next-to-next-to-next-to-nearest neighbour and multiple algorithmic advances are introduced, which help minimise the overhead of the coarse grid. The treatment of the coarse grids is purely four dimensional, and the bulk of the coarse grid operations are nearest neighbour. The intrinsic cost of most of the coarse grid operations is therefore comparable to those for the Wilson case. We also document the implementation of this algorithm in the BAGEL/Bfm software package and report on the measured performance gains the algorithm brings to simulations at the physical point on IBM BlueGene/Q hardware.

研究の動機と目的

  • 近いゼロモードに起因する高い条件数が原因で、5次元キラルフェルミオン形式における共役勾配ソルバの収束が遅い問題に対処する。
  • 5次元ディラック作用素における粗格子演算の計算コストを低減するスケーラブルで多層的な縮約法を開発する。
  • 最近接近接ステンシルを用いた4次元粗格子表現を採用することで、階層的 multigrid ソルバにおけるアルゴリズム的オーバーヘッドを最小限に抑える。
  • 低精度データ表現による通信帯域幅の削減を通じて、BlueGene/Qにおける性能を向上させつつ、収束性を損なわないようにする。

提案手法

  • 5次元ディラック作用素のエルミート形に赤黒プリコンディショナを適用し、正規方程式を共役勾配法で解く。
  • 低エネルギーモードを表現するため、1⁴の第3粗格子空間を用いた階層的縮約フレームワークを導入する。
  • 小規模ディラック作用素の最近接近接近似に基づく赤外線シフトプリコンディショナを導入し、ステンシルの複雑さを低減する。
  • 標準的なシュール補完法と比較して、粗格子演算のオーバーヘッドを10倍低減するADEF-2アルゴリズムを採用する。
  • ノード間データ交換において低精度通信(例:16ビット仮数部)を適用し、帯域幅を最大4倍削減しながら収束性を維持する。
  • 複数回の行列・ベクトル演算においてゲージ場およびフェルミオン場を再利用することで、キャッシュフレンドリーなメモリアクセスパターンを維持する。

実験結果

リサーチクエスチョン

  • RQ1ドメインウォールフェルミオンのような5次元キラルフェルミオン形式に多層縮約を効果的に適用できるか。その際、粗格子コストが著しく増大しないか。
  • RQ2標準的なウィルソンフェルミオンソルバと同等のステンシル複雑さを維持しつつ、粗格子作用素のステンシル複雑さをどのように低減できるか。
  • RQ3低精度データ表現による帯域幅削減は、Krylov法ソルバの収束性に悪影響を及ぼさずにどの程度可能か。
  • RQ4最近接近接近似に基づく赤外線シフトプリコンディショナは、5次元ソルバの性能と安定性を向上させるか。
  • RQ5階層的縮約フレームワークは、BlueGene/Q上の大規模なラティスQCDシミュレーションにおいても、頑健性と効率性を維持できるか。

主な発見

  • ADEF-2アルゴリズムを標準的なシュール補完法の代わりに採用することで、小規模ディラック作用素のオーバーヘッドが10倍低減された。
  • 赤外線シフトプリコンディショナにより、粗格子行列乗算の大部分が最近接ステンシルに簡略化され、ウィルソンフェルミオンソルバと同等の複雑さに一致した。
  • 低精度通信(7ビット仮数部)により、帯域幅が4倍削減されたが、収束性に影響はなく、168回の外側反復を維持した。
  • 粗格子演算は完全に4次元的であり、ゲージ場およびフェルミオン場の再利用が可能になり、キャッシュ局所性が向上した。
  • IBM BlueGene/Q上で顕著な性能向上が達成され、通信の削減が、遅延が大きい相互接続スケーリングに起因するドメイン分割の利点を上回った。
  • プリコンディショナの変動に対しても、プリコンディショニング付き共役勾配法は頑健であり、柔軟Krylov法の必要性が低減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。