Skip to main content
QUICK REVIEW

[論文レビュー] I/O Efficient Algorithms for Matrix Computations

Sraban Kumar Mohanty|arXiv (Cornell University)|Jun 7, 2010
Parallel Computing and Optimization Techniques参考文献 2被引用数 6
ひとこと要約

本学位論文は、外部記憶モデルを用いて、QR分解およびヘッセンベルク/トレディアゴナル/バイディアゴナル削減を含む主要な行列計算のI/O効率の良いアルゴリズムを提示する。タイルベースおよびバンド状中間形式の技術を導入することで、漸近的に最適なI/O複雑性を達成し、タイルサイズがメインメモリに収まる場合に、行列乗算のI/Oバウンドと一致する新しい再帰的キャッシュオブliviousアルゴリズムを提案する。

ABSTRACT

We analyse some QR decomposition algorithms, and show that the I/O complexity of the tile based algorithm is asymptotically the same as that of matrix multiplication. This algorithm, we show, performs the best when the tile size is chosen so that exactly one tile fits in the main memory. We propose a constant factor improvement, as well as a new recursive cache oblivious algorithm with the same asymptotic I/O complexity. We design Hessenberg, tridiagonal, and bidiagonal reductions that use banded intermediate forms, and perform only asymptotically optimal numbers of I/Os; these are the first I/O optimal algorithms for these problems. In particular, we show that known slab based algorithms for two sided reductions all have suboptimal asymptotic I/O performances, even though they have been reported to do better than the traditional algorithms on the basis of empirical evidence. We propose new tile based variants of multishift QR and QZ algorithms that under certain conditions on the number of shifts, have better seek and I/O complexities than all known variants. We show that techniques like rescheduling of computational steps, appropriate choosing of the blocking parameters and incorporating of more matrix-matrix operations, can be used to improve the I/O and seek complexities of matrix computations.

研究の動機と目的

  • 外部記憶モデル下での行列計算のI/O効率の良いアルゴリズムの設計を目的とする。
  • ヘッセンベルク、トレディアゴナル、バイディアゴナル削減のためのI/O最適化されたアルゴリズムの不足を解決することを目的とする。
  • 二重側削減における漸近的に最適なI/O複雑性を達成することを目的とする。
  • 行列乗算のI/O複雑性と一致する再帰的キャッシュオブリビアスアルゴリズムを提案することを目的とする。
  • 既存のスラブベースおよびブロッキングアルゴリズムを、新しいデータレイアウトとアルゴリズム的構造によって改善することを目的とする。

提案手法

  • I/O複雑性が行列乗算と一致するタイルベースQR分解アルゴリズムを提案する。
  • ヘッセンベルク、トレディアゴナル、バイディアゴナル削減におけるI/O削減のため、バンド状中間形式を導入する。
  • 同じ漸近的I/O複雑性を持つ再帰的キャッシュオブリビアスアルゴリズムを設計する。
  • Aggarwal-Vitter外部記憶モデルに基づくI/O複雑性の分析を行い、I/O操作の最小化に注力する。
  • I/Oを最小化するためのタイルサイズの最適化を行い、1つのタイルがメインメモリに収まる場合に最良のパフォーマンスを示すことを示す。
  • コンパクトな保存と効率的なI/Oの両立のため、ハウスホルダー変換とWY表現を用いる。

実験結果

リサーチクエスチョン

  • RQ1QR分解は、行列乗算と同等のI/O複雑性で実行可能か?
  • RQ2従来のブロッキングおよびアンブロッキングの削減はなぜI/O非効率的であり、どのように是正できるか?
  • RQ3バンド状中間形式は、二重側削減におけるI/O最適性を実現可能か?
  • RQ4タイルベースQRアルゴリズムにおけるI/O効率の最適なタイルサイズは何か?
  • RQ5再帰的キャッシュオブリビアスアルゴリズムは、既知の最良のI/O最適化アルゴリズムと同等のI/O複雑性を達成可能か?

主な発見

  • タイルベースQRアルゴリズムは、行列乗算と漸近的に同等のI/O複雑性を達成する。
  • 最適なタイルサイズは、正確に1つのタイルがメインメモリに収まる場合であり、I/O操作を最小化する。
  • 提案されたアルゴリズムは、既存のタイルベース手法よりも定数倍の性能向上を達成する。
  • バンド状中間形式を用いた、ヘッセンベルク、トレディアゴナル、バイディアゴナル削減のための最初のI/O最適アルゴリズムが提示される。
  • 再帰的キャッシュオブリビアスアルゴリズムは、行列乗算のI/O複雑性と一致し、最適なパフォーマンスを達成する。
  • 二重側削減におけるスラブベースアルゴリズムのI/O複雑性が非最適であることが示され、新たなアプローチの動機付けがなされる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。