[論文レビュー] Finite Projective Geometry based Fast, Conflict-free Parallel Matrix Computations
本稿では、特に共役勾配法(CG)およびLU/コレスキー分解の並列行列計算を高速化するために、有限射影幾何学に基づくデータ分布および相互接続方式を提案する。射影幾何学における対称的インシデント関係を活用することで、矛盾のない、通信最適化された並列実行が可能となり、証明可能な最適な負荷分散と通信オーバーヘッドの低減を実現し、従来のメッシュベースの方式に比べ顕著な高速化を達成する。
Matrix computations, especially iterative PDE solving (and the sparse matrix vector multiplication subproblem within) using conjugate gradient algorithm, and LU/Cholesky decomposition for solving system of linear equations, form the kernel of many applications, such as circuit simulators, computational fluid dynamics or structural analysis etc. The problem of designing approaches for parallelizing these computations, to get good speedups as much as possible as per Amdahl's law, has been continuously researched upon. In this paper, we discuss approaches based on the use of finite projective geometry graphs for these two problems. For the problem of conjugate gradient algorithm, the approach looks at an alternative data distribution based on projective-geometry concepts. It is proved that this data distribution is an optimal data distribution for scheduling the main problem of dense matrix-vector multiplication. For the problem of parallel LU/Cholesky decomposition of general matrices, the approach is motivated by the recently published scheme for interconnects of distributed systems, perfect difference networks. We find that projective-geometry based graphs indeed offer an exciting way of parallelizing these computations, and in fact many others. Moreover, their applications ranges from architectural ones (interconnect choice) to algorithmic ones (data distributions).
研究の動機と目的
- スパース行列-ベクトル乗算(SpMV)およびLU/コレスキー分解を含む並列行列計算における性能ボトル neck を解消するため、通信最適化され、衝突のない相互接続およびデータ分布方式を設計すること。
- 通信オーバーヘッドを最小限に抑え、プロセッサ間で計算負荷を均等に分配することで、アムダールの法則に制限されるスループットの向上を図ること。
- 共役勾配法における密行列-ベクトル乗算に対して、証明可能な通信最適性を有する新規なデータ分布「プロジェクト型データ分布」を考案すること。
- 4次元射影空間グラフを用いた、LU/コレスキー分解のための効率的なスケジューリングおよび相互接続方式を設計し、従来のメッシュベースのトポロジーを凌駆すること。
- プロジェクト型幾何学に基づくアーキテクチャの有効性を、サイクル数、計算時間、プロセッサ利用率などのパフォーマンス指標を比較したシミュレーションにより検証すること。
提案手法
- プロセッサおよびメモリの相互接続として、部分空間間のインシデント関係および包含関係に基づく、有限射影幾何学グラフ(特に4次元射影空間)を基盤トポロジーとして採用する。
- 射影幾何学の自己同型写像を用いて完全アクセスパターンおよびシーケンスを生成し、すべてのプロセッサおよびメモリが同時に通信し、競合が生じないことを保証する。
- 幾何的インシデントに基づいて導出された新規な「プロジェクト型データ分布」を行列データに適用し、SpMVカーネルにおける通信量を最小化するとともに、計算負荷をバランスさせる。
- 間接的インシデントおよび階層的部分空間を用いた2種類のスケジューリング方式(PG-1およびPG-2)を考案し、LU/コレスキー分解における効率的なデータ移動および計算スケジューリングを実現する。
- さまざまなブロックサイズ(例:8×8、12×12、24×24)を想定し、サイクル数、計算/通信サイクル数、正規化された実行時間などの指標を用いて、メッシュベースの相互接続と比較したパフォーマンスのシミュレーションを実施する。
- ソフトウェアプロトタイプを用いて、従来の行単位の分布と比較して、通信効率および負荷分散の観点から、提案手法のパフォーマンス差を評価する。
実験結果
リサーチクエスチョン
- RQ1有限射影幾何学に基づくデータ分布は、共役勾配法における密行列-ベクトル乗算に対して、証明可能な最適な通信複雑度を達成できるか?
- RQ2LU/コレスキー分解において、プロジェクト型幾何学に基づく相互接続トポロジーは、従来のメッシュベースのトポロジーと比較して、プロセッサ利用率および総実行時間の点で優れているか?
- RQ3SpMVカーネルにおいて、プロジェクト型データ分布は、従来の行単位またはブロック単位の分布と比較して、通信オーバーヘッドをどの程度低減できるか?
- RQ4射影幾何学の対称性および自己同型写像の性質を活用して、並列行列計算における衝突のない高帯域幅の通信パターンを設計できるか?
- RQ5ブロックサイズが小さくなるに従って、サイクル数および正規化された計算時間といったパフォーマンス指標が、プロジェクト型幾何学ベースの方式とメッシュベースの方式の間でどのようにスケーリングするか?
主な発見
- プロジェクト型データ分布は、密行列-ベクトル乗算に対して、証明可能な通信最適性を有しており、従来の行単位の分布と比較して通信量を顕著に削減する。
- 共役勾配法において、プロジェクト型分布は20~30プロセッサを超えると、行単位の分布を上回り、プロセッサ数が増加するに従い性能向上が顕著に現れる。
- LU/コレスキー分解のPG-2方式は、メッシュ方式(61.35サイクル)と比較して、平均通信サイクル数を著しく削減(12×12ブロックでは31.14サイクル)し、計算サイクル数はほぼ同等を維持する。
- すべてのブロックサイズにおいて、プロジェクト型幾何学ベースの方式はメッシュ方式に比べて顕著に高いプロセッサ利用率を示し、PG-2は低通信と高い並列性の両立が図られている。
- ブロックサイズが小さくなるに従い、より細粒度の負荷分散が可能となり、パフォーマンスはほぼ線形に向上する。プロジェクト型方式は、総合的な実行時間およびサイクル効率の両面で、メッシュ方式を常に上回る。
- 中規模の行列に対して実用的であり、各プロセッサが約n²/155個の行列要素を格納するだけでよい(メインメモリまたはL1キャッシュに実装可能)ため、市販のプロセッサおよび低消費電力のカスタムボードを用いた実装が可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。