[論文レビュー] Alternating Anderson-Richardson method: An efficient alternative to preconditioned Krylov methods for large, sparse linear systems
本稿では、前処理付きリチャードソン反復内でのアンダーソン外挿法を用いて、スパースかつ大規模な線形系の収束を加速する、前処理付きKrylov法の代替手法として、交互アンダーソン・リチャードソン(AAR)法を提案する。GMRES、Bi-CGSTAB、CGと比較して、特にスケールが大きい状況下で優れた強スケーリングおよび弱スケーリングを達成し、ヤコビ前処理を施したポアソン問題において、110,592コアで解に至るまでの時間を最大1.91倍短縮した。
We present the Alternating Anderson-Richardson (AAR) method: an efficient and scalable alternative to preconditioned Krylov solvers for the solution of large, sparse linear systems on high performance computing platforms. Specifically, we generalize the recently proposed Alternating Anderson-Jacobi (AAJ) method (Pratapa et al., J. Comput. Phys. (2016), 306, 43--54) to include preconditioning, discuss efficient parallel implementation, and provide serial MATLAB and parallel C/C++ implementations. In serial applications to nonsymmetric systems, we find that AAR is comparably robust to GMRES, using the same preconditioning, while often outperforming it in time to solution; and find AAR to be more robust than Bi-CGSTAB for the problems considered. In parallel applications to the Helmholtz and Poisson equations, we find that AAR shows superior strong and weak scaling to GMRES, Bi-CGSTAB, and Conjugate Gradient (CG) methods, using the same preconditioning, with consistently shorter times to solution at larger processor counts. Finally, in massively parallel applications to the Poisson equation, on up to 110,592 processors, we find that AAR shows superior strong and weak scaling to CG, with shorter minimum time to solution. We thus find that AAR offers a robust and efficient alternative to current state-of-the-art solvers, with increasing advantages as the number of processors grows.
研究の動機と目的
- 高性能コンputィングにおけるグローバル通信のボトルneckによって引き起こされる、GMRES や CG といった従来の Krylov 法の並列スケーリング限界を解消すること。
- 古典的リチャードソン法およびヤコビ反復法の収束が遅いという問題を克服しつつ、それらが持つ固有の並列局所性を維持すること。
- 対称および非対称系に適用可能な、スケーラブルで頑健かつ汎用的な反復的ソルバーを、大規模なスパース線形系に対して開発すること。
- アンダーソン外挿法と前処理付きリチャードソン反復法を組み合わせることで、最先端のKrylov法と比較して、スケールが大きい状況下で優れた性能を発揮することを示すこと。
- 電子構造や量子分子動力学といった計算が高価な応用分野で繰り返し解かれる大規模なスパース線形系を、効率的に解けるようにすること。
提案手法
- AAJ法を一般化し、前処理を組み込むことで、交互アンダーソン・リチャードソン(AAR)法を構築する。
- 前処理付きリチャードソン反復の周期的間隔でアンダーソン外挿法を適用し、収束を加速するとともに、厳密な局所性を維持する。
- 通信ボトルneckを回避するため、単純なヤコビ前処理器を用い、高い並列スケーリングを確保する。
- 高性能コンputィングプラットフォーム向けに、シリアル版MATLABおよび並列版C/C++(MPI実装)で実装を行う。
- アンダーソン外挿法とGMRESの関係を活用し、グローバル演算を伴わずにKrylov法に類似した収束レートを達成する。
- 内積の計算を残差評価以外では避けることで、計算の単純さとデータ局所性を維持し、数千コアにわたる効率的な分散を可能にする。
実験結果
リサーチクエスチョン
- RQ1アンダーソン外挿法は、並列スケーリングを維持したまま、前処理付きリチャードソン反復の収束を顕著に加速できるか?
- RQ2AAR法は、大規模並列アーキテクチャ上での解に至るまでの時間とスケーリング特性において、GMRES、Bi-CGSTAB、CGと比較してどうなるか?
- RQ3プロセッサ数が増加するに従い、AAR法は強スケーリングおよび弱スケーリングの両状態で優れた性能を維持できるか?
- RQ4繰り返し解かれる大規模なスパース線形系を含む、マススケール並列アプリケーションにおいて、AAR法は最先端のKrylov法を上回れるか?
- RQ5通信非効率性がAAR法およびCGのスケーリング挙動に与える影響は何か?AAR法はスケールが大きくなると、どのようにこれを緩和するか?
主な発見
- 最大110,592プロセッサで、ヤコビ前処理を施したポアソン方程式に対して、AAR法はCG法と比較して最小で1.91倍短いウォールタイムを達成した。
- 弱スケーリングにおいて、AAR法はポアソン問題で𝒪(N¹.⁰¹)のスケーリングを示し、大規模コア数でのCG法の𝒪(N¹.⁰⁷)スケーリングを上回った。
- 強スケーリングにおいて、AAR法はGMRES、Bi-CGSTAB、CGを常に上回る性能を維持し、高コア数での解に至るまでの時間が短かった。
- 非対称系では、同じ前処理を用いた場合、AAR法はGMRESと同等の頑健性を示したが、解に至るまでの時間ではしばしばそれを上回った。
- テストされた問題全般にわたり、AAR法はBi-CGSTAB法と比較して優れた収束の頑健性を示した。
- プロセッサ数が増加するに従い、AAR法はKrylovソルバーと比較して一貫した利点を示し、エクサスケールおよび将来のHPC環境における有用性が高まることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。