Skip to main content
QUICK REVIEW

[論文レビュー] Implementing Communication-Optimal Parallel and Sequential QR Factorizations

James Demmel, Laura Grigori|ArXiv.org|Sep 14, 2008
Caching and Content Delivery参考文献 26被引用数 12
ひとこと要約

本稿では、縦長の行列に適したTSQRと一般の長方形行列に適したCAQRという、通信を回避するQR分解アルゴリズムを提示している。これらの手法は、並列および逐次環境の両方でデータ移動を最小限に抑える。再帰的QRと最適化された削減木を用いることで、ScaLAPACKに対して最大6.7倍、PDGEQRFに対して最大22.9倍の高速化を達成しており、ハウスホルダーQRと同様にノルムワイズ後向き安定性を維持している。

ABSTRACT

We present parallel and sequential dense QR factorization algorithms for tall and skinny matrices and general rectangular matrices that both minimize communication, and are as stable as Householder QR. The sequential and parallel algorithms for tall and skinny matrices lead to significant speedups in practice over some of the existing algorithms, including LAPACK and ScaLAPACK, for example up to 6.7x over ScaLAPACK. The parallel algorithm for general rectangular matrices is estimated to show significant speedups over ScaLAPACK, up to 22x over ScaLAPACK.

研究の動機と目的

  • 並列および逐次HPC環境の両方で通信を最適化したQR分解アルゴリズムを設計すること。
  • ScaLAPACK や LAPACK などの既存のQR実装における通信オーバーヘッドによる性能ボトルネックを解消すること。
  • 特に複数の右辺や固有値問題を含む応用において、大規模な行列に対する高性能でスケーラブルなQR分解を可能にすること。
  • TSQR を CAQR の構築モジュールとして統合し、2次元ブロック巡回レイアウトにおけるレイテンシおよび帯域幅のボトルネックを解消すること。
  • 複数のメモリレベルと並列化レイヤーを持つ現代の異種アーキテクチャに最適化されたアルゴリズムを設計すること。

提案手法

  • TSQR の局所カーネルとして、通信を最小限に抑える再帰的QR分解(ElmrothとGustavson)を用いることで、逐次システムでのパフォーマンスを向上させる。
  • TSQR を通信回避削減木上で削減操作として実装し、通信と計算を重ねて実行できるようにする。
  • TSQR をパネル分解に用いることで、2次元ブロック巡回レイアウトを対象とした並列アルゴリズムCAQRを設計し、ScaLAPACKのPDGEQRFにおけるレイテンシボトルネックを排除する。
  • 任意のトポロジをサポートする削減木を構築し、複雑な多層アーキテクチャにおける効率的な通信スケジューリングを可能にする。
  • TSQR がノルムワイズ後向き安定性を満たすという事実を活用し、ハウスホルダーQRと同等の数値的頑健性を保証する。
  • 理論的モデルを用いてペタスケールシステムにおけるパフォーマンスを推定し、異なる問題サイズおよびプロセッサ数におけるスループット向上を予測する。

実験結果

リサーチクエスチョン

  • RQ1通信を最小限に抑えるQR分解アルゴリズムを、数値的安定性を損なわせることなく、逐次および並列環境の両方で設計できるか?
  • RQ2通信回避削減が、縦長の行列に対するQR分解のパフォーマンスに、どの程度向上効果をもたらすか?
  • RQ3CAQR と TSQR は、大規模システムにおけるScaLAPACKのPDGEQRFと比べて、スケーラビリティおよびパフォーマンスでどの程度優れているか?
  • RQ4通信ボトルネック(帯域幅とレイテンシ)がQR分解のパフォーマンスに与える影響は何か? そして、それらをどのように緩和できるか?
  • RQ5通信回避QR分解をLU分解や固有値ソルバなどの他の線形代数演算に拡張可能か?

主な発見

  • 16プロセッサのPentium IIIクラスタ上で100,000×200行列に対して、TSQRはScaLAPACK比最大6.7倍の高速化を達成した。
  • 32プロセッサのBlueGene/Lシステム上では、1,000,000×50行列に対してTSQRが最大4倍の高速化を達成し、優れた局所QRカーネルを活用した。
  • ペタスケールシステムにおいて、8192プロセッサで10^4×10^4行列を処理する場合、CAQRはPDGEQRF比ピークで22.9倍の高速化が見込まれる。
  • n=10^5.5の場合、2プロセッサから8192プロセッサにスケーリングした際、CAQRは1431倍の高速化を達成し、強いスケーラビリティを示した。
  • テストされたすべての行列サイズにおいてCAQRはPDGEQRFを常に上回り、最小で1.4倍、有利な設定では最大7.4倍の高速化を達成した。
  • CAQRは常にPDGEQRFより悪い性能を示さず、常に同等以上、場合によっては著しく速く、特にレイテンシが計算を上回る状況で顕著な性能向上を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。