Skip to main content
QUICK REVIEW

[論文レビュー] Tiled QR factorization algorithms

Henricus Bouwmeester, Mathias Jacquelin|arXiv (Cornell University)|Apr 22, 2011
Interconnection Networks and Systems参考文献 12被引用数 4
ひとこと要約

本稿では、長方形行列に対するタイル化QR分解アルゴリズムを、フィボナッチおよびグリーディスケジューリング戦略を用いて導入し、マルチコアアーキテクチャにおける並列性を最適化する。両アルゴリズムが、p = q²f(q) かつ lim f(q) = 0 を満たす行列に対して漸近的に最適であることを証明しており、実験ではPlasmaTree や FlatTree といった既存手法に比べ優れた性能を示しており、特にタールマトリクスにおいて顕著である。

ABSTRACT

This work revisits existing algorithms for the QR factorization of rectangular matrices composed of p-by-q tiles, where p >= q. Within this framework, we study the critical paths and performance of algorithms such as Sameh and Kuck, Modi and Clarke, Greedy, and those found within PLASMA. Although neither Modi and Clarke nor Greedy is optimal, both are shown to be asymptotically optimal for all matrices of size p = q^2 f(q), where f is any function such that \lim_{+\infty} f= 0. This novel and important complexity result applies to all matrices where p and q are proportional, p = λq, with λ>= 1, thereby encompassing many important situations in practice (least squares). We provide an extensive set of experiments that show the superiority of the new algorithms for tall matrices.

研究の動機と目的

  • 数値線形代数ワークロードの高速化を目的として、マルチコアアーキテクチャにおける高度に並列化されたQR分解アルゴリズムの必要性に対応する。
  • パラメータチューニングを必要としない新しいスケジューリングアルゴリズムを導入することで、既存のタイル化戦略(例:Sameh-Kuck、FlatTree、PlasmaTree)を改善し、並列性を向上させる。
  • タールで細長いマトリクスを想定した漸近的領域において、フィボナッチおよびグリーディアルゴリズムの理論的最適性を確立する。
  • 広範な実験を通じて、新アルゴリズムが、クリティカルパス長および実行時間の観点から、最先端の実装を上回ることを示す。

提案手法

  • スケジューリング戦略のフィボナッチおよびグリーディ戦略を、タイルベースのQR分解に適応させ、スカラ演算をタイルレベルの変換に置き換える。
  • 計算を依存性グラフとしてモデル化し、タイルを計算ユニットとし、エッジをデータ依存性として定義する。
  • クリティカルパス解析を用いて、各アルゴリズムの理論的性能上限を評価し、並列性と遅延に注目する。
  • 倍精度および複素数倍精度のマルチコアシステム上で、TT(タールタイル)およびTS(スクエアタイル)カーネルを用いて、新アルゴリズムを実装・ベンチマークする。
  • クリティカルパス長や実行時間などの指標を用いて、FlatTree、PlasmaTree、Sameh-Kuck といった既存アルゴリズムと比較する。
  • コンact WY表現とレベル3 BLASを活用し、ハウスホルダー変換の安定性とギヴィングススタイルスケジューリングの並列性を統合した効率的なタイル更新を実現する。

実験結果

リサーチクエスチョン

  • RQ1フィボナッチおよびグリーディスケジューリング戦略は、タイルベースのQR分解に効果的に適応可能であり、並列性を向上させることができるか?
  • RQ2フィボナッチおよびグリーディアルゴリズムが、どのようなマトリクスサイズ条件下で漸近的に最適となるか?
  • RQ3実際の実装において、PlasmaTree や FlatTree といった既存実装と比較して、新アルゴリズムの実行時間およびクリティカルパス長の観点から、どのような差が生じるか?
  • RQ4フィボナッチおよびグリーディアルゴリズムには、ドメインサイズなどのチューニングパラメータが存在しないため、多様なマトリクス形状にわたる性能の安定性が向上するか?
  • RQ5マルチコア環境において、TTカーネルを用いたタイルベースアルゴリズムは、スクエアタイルと比較して、どの程度性能が向上するか?

主な発見

  • フィボナッチおよびグリーディアルゴリズムは、p = q²f(q) かつ lim f(q) = 0 を満たすすべてのマトリクスに対して漸近的に最適である。これは、p = λq(λ ≥ 1)という重要なケースも含む。
  • タールマトリクス(例:p=40, q=1)において、グリーディアルゴリズムはPlasmaTree(TT)に比べて実行時間で28.09%の向上を達成しており、グリーディに対するオーバーヘッドは、PlasmaTree(TS)で1.0153、PlasmaTree(TT)で1.0152である。
  • 複素数倍精度のケース(p=40, q=1)において、フィボナッチアルゴリズムはグリーディに比べて実行時間を最大28.15%短縮しており、グリーディに対するオーバーヘッドは0.7185である。
  • 倍精度の場合、p=40, q=2 において、グリーディアルゴリズムはPlasmaTree(TT)に比べて13.64%の性能向上を達成しており、オーバーヘッドは0.8636である。
  • 新アルゴリズムは、テストされたすべてのマトリクスサイズにおいてPlasmaTree(TT)を上回っており、グリーディに対する実行時間の相対的改善は0.0067から0.1364の範囲にわたる。
  • 実験結果は、新アルゴリズムがチューニングパラメータ(例:ドメインサイズ)を必要とせず、安定した性能を発揮することを確認しており、[12]のような先行手法とは異なり、優れた耐障害性を有する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。