Skip to main content
QUICK REVIEW

[論文レビュー] On Symmetric Rectilinear Matrix Partitioning

Abdurrahman Yaşar, Muhammed Fati̇h Balin|arXiv (Cornell University)|Sep 16, 2020
Interconnection Networks and Systems参考文献 27被引用数 5
ひとこと要約

本稿では、スパース行列の並列計算を効率的に行うために、バランスの取れた正方形の対角タイルを保証する問題である対称長方形行列分割のための4つのヒューリスティックアルゴリズムを提案する。スパース化とスパースな接頭辞和データ構造を活用することで、24コアシステム上でTwitterのような大規模グラフに対しても3秒未満の実行時間で、1%未満の負荷不均衡を達成し、80%のテストインスタンスでほぼ最適性に近い性能を示した。

ABSTRACT

Even distribution of irregular workload to processing units is crucial for efficient parallelization in many applications. In this work, we are concerned with a spatial partitioning called rectilinear partitioning (also known as generalized block distribution) of sparse matrices. More specifically, in this work, we address the problem of symmetric rectilinear partitioning of a square matrix. By symmetric, we mean the rows and columns of the matrix are identically partitioned yielding a tiling where the diagonal tiles (blocks) will be squares. We first show that the optimal solution to this problem is NP-hard, and we propose four heuristics to solve two different variants of this problem. We present a thorough analysis of the computational complexities of those proposed heuristics. To make the proposed techniques more applicable in real life application scenarios, we further reduce their computational complexities by utilizing effective sparsification strategies together with an efficient sparse prefix-sum data structure. We experimentally show the proposed algorithms are efficient and effective on more than six hundred test matrices. With sparsification, our methods take less than 3 seconds in the Twitter graph on a modern 24 core system and output a solution whose load imbalance is no worse than 1%.

研究の動機と目的

  • 並列スパース行列計算における不規則なワークロードのバランスをとる課題に対処すること。特に、対称な正方行列において。
  • 負荷不均衡と通信オーバーヘッドを最小限に抑える一方で、対称的なタイリング(正方形の対角ブロック)を維持する効率的な分割技術を開発すること。
  • スパース化と最適化されたデータ構造を用いることで、現実世界のスケーラビリティを実現するための分割アルゴリズムの計算複雑性を低減すること。
  • 多様なスパース行列ワークロード、特に大規模グラフを含む、提案されたヒューリスティクスの性能と負荷バランスを評価すること。
  • ハイパフォーマンスコンピューティング分野における広範な採用と今後の研究を促進するため、実装をオープンソース化すること。

提案手法

  • mLI(不均衡を最小化)とmNC(通信量を最小化)の2つのバリエーションを対象として、PaL、BaL(RaC)、BaL(Uni)、RaCの4つのヒューリスティクスを提案する。
  • 累積行および列の重みを効率的に計算するため、スパースな接頭辞和データ構造を用い、分割中における負荷推定を高速化する。
  • 低重みの行・列をフィルタリングすることで入力サイズを縮小するスパース化戦略を適用し、解の品質を損なわせずに計算コストを顕著に低減する。
  • プローブベースのアプローチ(PaL)とリファイニングベースの手法(BaL)を用い、反復的に分割境界を調整して目標負荷バランスを達成する。
  • RaCヒューリスティクスにより、2次元分割問題を1次元のカットに還元し、速度を犠牲にして若干の精度を落とす。
  • スパース化、接頭辞和の構築、分割の3段階を統合したパイプラインを構築し、600以上の実際の行列を用いて性能を測定した。

実験結果

リサーチクエスチョン

  • RQ1対称長方形分割問題はNP困難であるか。最適解を求める際の計算限界は何か。
  • RQ2PaL、BaL、RaCなどの異なるヒューリスティクス戦略は、多様なスパース行列ワークロードにおいて、負荷不均衡と実行時間の観点でどのように比較されるか。
  • RQ3スパース化は、解の品質を劣化させることなく、分割アルゴリズムの実行時間をどの程度改善するか。
  • RQ4提案されたアルゴリズムは、特に大規模グラフを含む実世界の行列において、ほぼ最適な負荷バランスをどの程度達成できるか。
  • RQ5スパースな接頭辞和データ構造は、分割パイプライン全体の効率性にどのような影響を与えるか。

主な発見

  • 対称長方形分割問題がNP困難であることが証明され、最適解を得るための計算的非実行可能性が確立された。
  • mNC問題において、PaLヒューリスティクスは、計算複雑度が低いため、特に大きなターゲットブロックサイズの場合に他の手法を上回る実行時間性能を示した。
  • スパース化とスパースな接頭辞和構造を組み合わせることで、24コアシステム上でのTwitterグラフにおいて、3秒未満の実行時間で、負荷不均衡が1%未塔を達成した。
  • 375の小さなテスト行列において、提案されたアルゴリズムは80%のケースでほぼ最適な解を達成し、優れた解品質を示した。
  • RaCヒューリスティクスは、1次元への還元により最も高速な実行時間を達成したが、PaLに比べ若干精度が低い。
  • 大規模グラフではスパース化により実行時間が顕著に短縮されたが、小規模なグラフでは前処理コストの影響で、全体的な利得は限定的であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。