Skip to main content
QUICK REVIEW

[論文レビュー] The Communication-Hiding Conjugate Gradient Method with Deep Pipelines

J. Cornelis, Siegfried Cools|arXiv (Cornell University)|Jan 15, 2018
Matrix Theory and Algorithms参考文献 37被引用数 19
ひとこと要約

本稿では、大規模並列システムにおける通信遅延を隠すために、最大l個のその後続するスパース行列-ベクトル積(spmv)と重ね合わせる、Conjugate Gradient(CG)法のディープパイプライン版であるp(l)-CG法を提案する。この手法は、エクサスケールハードウェア上でのスケーラビリティを、古典的および標準的パイプラインCG法よりも向上させるが、パイプライン長が長くなることでストレージの増加と数値的不安定性(誤差伝搬による)の懸念が生じる。

ABSTRACT

Krylov subspace methods are among the most efficient solvers for large scale linear algebra problems. Nevertheless, classic Krylov subspace algorithms do not scale well on massively parallel hardware due to synchronization bottlenecks. Communication-hiding pipelined Krylov subspace methods offer increased parallel scalability by overlapping the time-consuming global communication phase with computations such as spmvs, hence reducing the impact of the global synchronization and avoiding processor idling. One of the first published methods in this class is the pipelined Conjugate Gradient method (p-CG). However, on large numbers of processors the communication phase may take much longer than the computation of a single spmv. This work extends the pipelined CG method to deeper pipelines, denoted as p(l)-CG, which allows further scaling when the global communication phase is the dominant time-consuming factor. By overlapping the global all-to-all reduction phase in each CG iteration with the next l spmvs (deep pipelining), the method hides communication latency behind additional computational work. The p(l)-CG algorithm is derived from similar principles as the existing p(l)-GMRES method and by exploiting operator symmetry. The p(l)-CG method is also compared to other Krylov subspace methods, including the closely related classic CG and D-Lanczos methods and the pipelined CG method by Ghysels et al.. By analyzing the maximal accuracy attainable by the p(l)-CG method it is shown that the pipelining technique induces a trade-off between performance and numerical stability. A preconditioned version of the algorithm is also proposed and storage requirements and performance estimates are discussed. Experimental results demonstrate the possible performance gains and the attainable accuracy of deeper pipelined CG for solving large scale symmetric linear systems.

研究の動機と目的

  • グローバルな同期ボトルネック(内積の縮約処理)に起因する、大規模並列アーキテクチャ上での古典的Krylov部分空間法のスケーラビリティ制限を解消すること。
  • 大規模システムにおいて、グローバル通信遅延がspmv計算時間よりも支配的になる状況で、標準的パイプラインCG(p-CG)の性能上限を克服すること。
  • 1段階のオーバーラップを超えて、より深いパイプライン(l > 1)にパイプライン化の概念を拡張し、通信隠蔽と並列効率を向上させること。
  • 対称正定値系におけるより深いパイプライン化によって生じる数値的安定性と精度のトレードオフを分析すること。
  • p(l)-CGアルゴリズムの実装フレームワークを提供し、ストレージと性能の見積もりを提示すること。

提案手法

  • 行列の対称性を活用し、残差の直交性を強制することで、一般枠組みであるp(l)-GMRES法からp(l)-CGアルゴリズムを導出する。これにより、対称系に特化した構造が単純化される。
  • 各CG反復におけるグローバルな全対全リダクション(通信)フェーズを、次のl個のspmv演算と重ね合わせるための補助変数を導入する。
  • 多項式再帰式を用いて補助変数を再帰的に計算し、アルゴリズムの構造を維持しながら通信遅延を計算の背後に隠す。
  • 反復kの通信フェーズを、反復k+1からk+lまでのspmv計算中にスケジューリングすることで、通信と計算のオーバーラップを実装する。
  • p(l)-CGのプリコンディショニング版を提案し、そのストレージ要件と性能特性を分析する。
  • 局所的丸め誤差伝搬に関する理論的境界を提示し、パイプライン長が解の精度に与える影響を評価する。

実験結果

リサーチクエスチョン

  • RQ1グローバルな縮約処理が計算時間よりも支配的となる大規模並列システムにおいて、CG法におけるより深いパイプライン化(l > 1)が通信遅延を効果的に隠せるか?
  • RQ2パイプライン長を増加させることで、有限精度算術におけるp(l)-CG法の数値的安定性と達成可能な解の精度にどのような影響が生じるか?
  • RQ3より深いパイプライン化によって生じるストレージおよび計算のオーバーヘッドは、lおよび問題サイズとどのようにスケーリングされるか?
  • RQ4分散マルチコアアーキテクチャ上でのp(l)-CG法は、古典的CG、p-CG、D-Lanczos法と比較して、性能と精度の面でどのように差がつくか?
  • RQ5p(l)-CG法はエクサスケールハードウェア上でどの程度スケーリング可能か?また、誤差伝搬と実装の複雑さによって生じる実用的限界は何か?

主な発見

  • グローバル通信遅延が支配的となる大規模並列システム上では、p(l)-CG法が古典的CG法および標準的p-CG法よりも優れたスケーラビリティを達成する。特にl > 1の場合に顕著である。
  • 最適なオーバーラップ状況では、古典的CG法に比べて最大3倍の性能向上が観測され、エクサスケールスケールのハードウェア上では、より深いパイプラインがアイドル時間の削減に寄与する。
  • この手法は、性能と数値的精度のトレードオフを導入しており、長いパイプラインでは局所的丸め誤差の伝搬が拡大され、達成可能な解の精度が低下する可能性がある。
  • 特定の条件下ではp(3)-CGで平方根の崩壊(square root breakdowns)が観測され、より深いパイプラインでは数値的失敗のリスクがあることが示された。
  • 理論的分析から、誤差伝搬はパイプライン長lと補助Krylov基底ベクトルの選択に依存しており、実装の選択に敏感であることが示された。
  • 実験結果から、より深いパイプラインが分散マルチコアシステムにおけるスケーラビリティを向上させることを確認したが、それに伴い実装の複雑さとストレージオーバーヘッドもlに比例して増加する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。