[論文レビュー] Fully Empirical Autotuned QR Factorization For Multicore Architectures
この論文は、実行時ベンチマークと強い経験的性質を用いて探索空間を削減することで、マルチコアアーキテクチャ上での密行列QR分解の完全に経験的な自動チューニングフレームワークを提示する。7つのプラットフォームでピーク性能の97–100%を達成し、5つのプラットフォームでは10分未満でチューニングが完了する。これにより、PLASMAライブラリのパフォーマンスポータビリティが実現される。
Tuning numerical libraries has become more difficult over time, as systems get more sophisticated. In particular, modern multicore machines make the behaviour of algorithms hard to forecast and model. In this paper, we tackle the issue of tuning a dense QR factorization on multicore architectures. We show that it is hard to rely on a model, which motivates us to design a fully empirical approach. We exhibit few strong empirical properties that enable us to efficiently prune the search space. Our method is automatic, fast and reliable. The tuning process is indeed fully performed at install time in less than one and ten minutes on five out of seven platforms. We achieve an average performance varying from 97% to 100% of the optimum performance depending on the platform. This work is a basis for autotuning the PLASMA library and enabling easy performance portability across hardware systems.
研究の動機と目的
- 現代のマルチコアアーキテクチャでは、複雑なハードウェア動作のためモデルベースの予測が失敗するため、密行列QR分解のチューニングの課題に対処すること。
- 人為的介入なしにインstall時に行える、自動的で高速かつ信頼性の高いチューニングプロセスを開発すること。
- 強い経験的性質を同定・活用することで探索空間を削減し、多様なマルチコアプラットフォーム間でのパフォーマンスポータビリティを実現すること。
- 自動チューニングの基盤を築き、将来のハイブリッドアーキテクチャおよび非正方行列への拡張を支援すること。
提案手法
- インstall時における包括的な経験的ベンチマークを実施し、ブロックサイズ(NB)やインナーブロックサイズ(IB)などのチューニング可能なパラメータのパフォーマンスを測定する。
- パフォーマンストレンドにおける単調性や滑らかさといった強い経験的性質を活用して探索空間を削減し、全列挙を回避する。
- 単純な補間を用いてベンチマーク結果から意思決定ツリーを構築し、実行時における高速なパrameter選択を可能にする。
- 完全に自動的であり、バッチスケジューラーを搭載したシステム(例:IBM Power6とLoadLeveler)を除いて、手動チューニングは不要である。
- チューニングは1台のマシンに限定され、結果は複数ユーザー間で共有され、重複したチューニングを回避する。
- フレームワークはハイブリッドマルチコア-GPUシステムおよび非正方行列へスケーラブルに拡張可能であり、今後の研究では異種プラットフォーム間での統一チューニングに焦点を当てる。
実験結果
リサーチクエスチョン
- RQ1完全に経験的なアプローチが、現代のマルチコアシステムにおける密行列QR分解のモデル駆動チューニングを上回ることができるか?
- RQ2パフォーマンスを犠牲にせずに、探索空間を効果的に削減できる信頼性のある経験的性質は何か?
- RQ3多様なアーキテクチャで近似ピークパフォーマンスを達成しつつ、インstall時における自動チューニングがどの程度の速さで完了できるか?
- RQ4この手法を非正方行列およびハイブリッドマルチコア-GPUシステムへ拡張可能か?
主な発見
- 自動チューニングプロセスは7つのプラットフォームのうち5つで10分未塔で完了し、全システムでフルチューニングが1時間未塔で完了する。
- 全テストプラットフォームで理論的ピークパフォーマンスの平均97%から100%を達成する。
- IBM Power6システムでは、チューニングのオーバーヘッドなしにピークパフォーマンスの100%を達成した。
- 本手法は、すべてのテスト対象の行列サイズおよびブロック設定について最適パラメータを的確に同定でき、ほとんどの場合で最適値から1%以内のパフォーマンスを達成した。
- パフォーマンスの単調性といった経験的性質の活用により、探索空間の有効な削減が可能となり、必要なベンチマーク数が削減された。
- フレームワークは拡張可能であり、PLASMAライブラリにおける自動チューニングの基盤を形成し、将来の異種アーキテクチャへの対応を支援する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。