Skip to main content
QUICK REVIEW

[論文レビュー] A Makespan Lower Bound for the Scheduling of the Tiled Cholesky Factorization based on ALAP scheduling

Willy Quach, Julien Langou|arXiv (Cornell University)|Oct 17, 2015
Parallel Computing and Optimization Techniques参考文献 15被引用数 4
ひとこと要約

本稿は、ALAP(As Late As Possible)スケジューリングにおけるタイル化コレスキー分解のマクスパンに対するタイトな理論的下界を確立し、9t−10のクリティカルパス長を達成するには少なくとも0.185t²の処理ユニットが必要であることを証明している。さらに、この下界に一致するためのALAPに基づくスケジュールを提示し、その要件が0.25t² + 0.16t + 3ユニット未満であることを示しており、ナイーブな境界や実用的ヒューリスティクスに比べて顕著な改善がなされている。

ABSTRACT

Due to the advent of multicore architectures and massive parallelism, the tiled Cholesky factorization algorithm has recently received plenty of attention and is often referenced by practitioners as a case study. It is also implemented in mainstream dense linear algebra libraries. However, we note that theoretical study of the parallelism of this algorithm is currently lacking. In this paper, we present new theoretical results about the tiled Cholesky factorization in the context of a parallel homogeneous model without communication costs. We use standard flop-based weights for the tasks. For a $t$-by-$t$ matrix, we know that the critical path of the tiled Cholesky algorithm is $9t-10$ and that the weight of all tasks is $t^3$. In this context, we prove that no schedule with less than $0.185 t^2$ processing units can finish in a time less than the critical path. In perspective, a naive bound gives $0.11 t^2.$ We then give a schedule which needs less than $0.25 t^2+0.16t+3$ processing units to complete in the time of the critical path. In perspective, a naive schedule gives $0.50 t^2.$ In addition, given a fixed number of processing units, $p$, we give a lower bound on the execution time as follows: $$\max( \frac{t^{3}}{p}, \frac{t^{3}}{p} - 3\frac{t^2}{p} + 6\sqrt{2p} - 7 , 9t-10).$$ The interest of the latter formula lies in the middle term. Our results stem from the observation that the tiled Cholesky factorization is much better behaved when we schedule it with an ALAP (As Late As Possible) heuristic than an ASAP (As Soon As Possible) heuristic. We also provide scheduling heuristics which match closely the lower bound on execution time. We believe that our theoretical results will help practical scheduling studies. Indeed, our results enable to better characterize the quality of a practical schedule with respect to an optimal schedule.

研究の動機と目的

  • 均一で通信なしのモデルにおけるタイル化コレスキー分解の並列実行時間の理論的境界に関する理解のギャップを埋めること。
  • マクスパンを最小化する観点で、ALAPスケジューリングとASAPスケジューリングの性能優位性を比較すること。
  • 任意の処理ユニット数pに対する実行時間のタイトで閉形式の下界を導出すること。
  • 実用的スケジュール(ALAPおよびKurzakらの手法を含む)と比較することで、下界のタイトさを評価すること。
  • タスクベースの線形代数における実用的スケジューリングヒューリスティクスの評価を改善する理論的基盤を提供すること。

提案手法

  • 通信コストを含まない均一でフロップ重み付きタスクグラフモデルを用い、t×tタイル行列のタイル化コレスキー分解に焦点を当てる。
  • タスクを実行の終端から後退してスケジューリングするALAPスケジューリングヒューリスティクスを適用し、より良いロードバランシングとアイドルタイムの削減を実現する。
  • タスク依存グラフの構造的解析を用いて、クリティカルパス長を達成するのに必要なプロセッサ数の下界を導出する。
  • タスク集合を2つのサブセットに分割することで、√pを含む新しい中間項を導入し、よりタイトな実行時間の下界を導出する。
  • 同一の仮定下で、LAPACK(フォーク・ジョイン)、Kurzak ら、およびALAPの3つのスケジュールのシミュレーテッドスピードアップを比較する。
  • 一貫性のある比較を保証するため、固定されたフロップ重み(POTRF=1、TRSM=3、SYRK=3、GEMM=6)を用いた理論的シミュレーションフレームワークを用いる。

実験結果

リサーチクエスチョン

  • RQ1タイル化コレスキー分解において、クリティカルパス長を達成するために必要な最小の処理ユニット数は何か?
  • RQ2ALAPスケジューリングは、マクスパンとプロセッサ効率の観点でASAPスケジューリングに比べてどのように異なるか?
  • RQ3タスクグラフの構造を捉え、ナイーブな境界を改善する閉形式の実行時間下界を導出できるか?
  • RQ4導出された下界はどの程度タイトか?また、実用的スケジューリングヒューリスティクスによって達成可能か?
  • RQ5この理論的枠組みは、LUやQRなどの他のタイルベース線形代数アルゴリズムへ一般化可能か?

主な発見

  • 本稿は、クリティカルパス長9t−10を達成するには、0.185t²未満のプロセッサ数ではいかなるスケジュールでも不可能であることを証明しており、ナイーブな境界0.11t²に比べ顕著な改善がなされている。
  • ALAPに基づくスケジュールが、0.25t² + 0.16t + 3未満のプロセッサ数でクリティカルパス時間内に完了することを示しており、ナイーブな境界0.50t²に比べて顕著な改善がなされている。
  • 導出された実行時間下界はmax(t³/p, t³/p − 3t²/p + 6√(2p) − 7, 9t−10)であり、中間項が主な新規貢献である。
  • シミュレーション結果から、t=40のときp=343でALAPスケジュールがクリティカルパスに達することが確認され、その効率性と理論的下界の妥当性が裏付けられた。
  • LAPACK風のフォーク・ジョインスケジュールは過剰な同期により著しく性能が低いことが判明し、ALAPスケジューリングの利点が浮き彫りになった。
  • 理論的下界と最良の実用的スケジュールとの間にはまだギャップが残っていることから、漸近的解析におけるさらなるタイトニングの余地があると示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。