[論文レビュー] Enhancing the scalability and load balancing of the parallel selected inversion algorithm via tree-based asynchronous communication
本論文では、分散メモリシステム上の並列選択的逆行列(PSelInv)アルゴリズムのスケーラビリティと負荷分散を向上させるために、木構造に基づく非同期通信方式を提案する。標準の集合的通信をMPI_Isend/Irecvに基づく二分木に置き換え、ランダムランクシフトヒューリスティクスを適用することで、通信の不均衡を低減し、性能を向上させる。6,400プロセッサで5倍以上のスループット向上を達成し、実行時間のばらつきを4倍以上に低減した。
We develop a method for improving the parallel scalability of the recently developed parallel selected inversion algorithm [Jacquelin, Lin and Yang 2014], named PSelInv, on massively parallel distributed memory machines. In the PSelInv method, we compute selected elements of the inverse of a sparse matrix A that can be decomposed as A = LU, where L is lower triangular and U is upper triangular. Updating these selected elements of A-1 requires restricted collective communications among a subset of processors within each column or row communication group created by a block cyclic distribution of L and U. We describe how this type of restricted collective communication can be implemented by using asynchronous point-to-point MPI communication functions combined with a binary tree based data propagation scheme. Because multiple restricted collective communications may take place at the same time in the parallel selected inversion algorithm, we need to use a heuristic to prevent processors participating in multiple collective communications from receiving too many messages. This heuristic allows us to reduce communication load imbalance and improve the overall scalability of the selected inversion algorithm. For instance, when 6,400 processors are used, we observe over 5x speedup for test matrices. It also mitigates the performance variability introduced by an inhomogeneous network topology.
研究の動機と目的
- 大規模な分散メモリマシンにおける並列選択的逆行列(PSelInv)アルゴリズムにおける通信のスケーラビリティと負荷の不均衡を解消すること。
- 任意のプロセッササブセットに制限された場合に、標準のMPI集合的通信の限界を克服すること。
- 事前に割り当てられたコミュニケータに依存せず、スケーラブルで非同期な通信メカニズムを設計し、異種ネットワーク環境における性能変動を低減すること。
- PSelInvにおける制限付き集合的通信の効率を向上させること。これは大規模な電子構造計算において極めて重要である。
- 高性能Kohn-Sham DFTシミュレーションにおいて、4,000プロセッサを超えるスケーリングを可能にすること。
提案手法
- 動的集合的通信を模倣するために、標準のMPI集合的演算をポイントツーポイント非同期MPI_IsendおよびMPI_Irecv呼び出しに置き換える。
- 選択されたプロセッサ間でのデータ伝搬のための二分木を構築し、通信量とメッセージ数を最小限に抑える。
- 複数の木構造で同時に内部ノードとなることを防ぐために、受信者ランクに対してランダムな巡回シフトヒューリスティクスを実装する。
- 通信負荷をバランスさせ、高並列度環境下でのホットスポットを回避するために、シフト付き二分木構造を用いる。
- 複数のプロセッサグループにまたがる同時制限付き通信をサポートするために、この方式をPSelInvアルゴリズムに統合する。
- エディソンのような大規模システム上で、実際のテスト行列(例:DG PNF14000、audikw1)を用いて性能を評価する。
実験結果
リサーチクエスチョン
- RQ1制限付き通信シナリオにおいて、木構造ベースのデータ伝搬を伴う非同期ポイントツーポイント通信は、フラットツリーまたは標準のMPIコレクティブと比較して優れているか?
- RQ2複数の集合的通信が同時に発生する場合、ランダムランクシフトヒューリスティクスは通信負荷のバランスにどのように影響するか?
- RQ3提示された手法は、非均一なネットワークトポロジによって引き起こされる実行時間のばらつきをどの程度低減できるか?
- RQ4この通信戦略を用いて、PSelInvがスケーラブルに達成できる最大プロセッサ数は何か?
- RQ5このアプローチは非対称行列に対しても性能と負荷バランスを維持したまま拡張可能か?
主な発見
- シフト付き二分木ベースの通信方式により、テスト行列を用いたスケーリングにおいて1,024から6,400プロセッサに拡張した際、5倍を超えるスループット向上を達成した。
- 6,400プロセッサを用いた場合、実行時間の標準偏差が4倍以上に低減され、性能の一貫性が向上した。
- 4,096プロセッサにおいて、通信対計算比はフラットツリーの11.8からシフト付き二分木の1.9に低下し、通信オーバーヘッドが顕著に削減された。
- スケーラビリティは4,000プロセッサを超えて拡張され、強スケーリングは6,400プロセッサまで達成された。一方、フラットツリー版は1,024プロセッサ未満でのみスケーリング可能であった。
- ヒューリスティクスにより、同時に複数の操作が発生する際の通信負荷の不均衡が低減され、プロセッサが過剰なメッセージを受信するのを防いだ。
- この手法により、異種ネットワークアーキテクチャが引き起こす性能のばらつきが緩和され、PEXSIアルゴリズムの大規模実行が安定して可能になった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。