Skip to main content
QUICK REVIEW

[論文レビュー] Chebyshev Filter Diagonalization on Modern Manycore Processors and GPGPUs

Moritz Kreutzer, Georg Hager|arXiv (Cornell University)|Mar 6, 2018
Neural Networks and Applications被引用数 4
ひとこと要約

本稿では、Intel Xeon Phi Knights LandingおよびNVIDIA P100 GPU上で、部分空間ブロッキングとパイプライン通信を用いて遅延を隠蔽する最適化されたチェビシェフフィルタ対角化(ChebFD)を提案する。512ノードで10^9次元のスパース行列の100個の固有値を計算する際、100 TFlop/sを超える性能を達成し、ハイブリッドメモリハーキテクチャを性能の低下なしに効率的に活用できる。

ABSTRACT

Chebyshev filter diagonalization is well established in quantum chemistry and quantum physics to compute bulks of eigenvalues of large sparse matrices. Choosing a block vector implementation, we investigate optimization opportunities on the new class of high-performance compute devices featuring both high-bandwidth and low-bandwidth memory. We focus on the transparent access to the full address space supported by both architectures under consideration: Intel Xeon Phi "Knights Landing" and Nvidia "Pascal." We propose two optimizations: (1) Subspace blocking is applied for improved performance and data access efficiency. We also show that it allows transparently handling problems much larger than the high-bandwidth memory without significant performance penalties. (2) Pipelining of communication and computation phases of successive subspaces is implemented to hide communication costs without extra memory traffic. As an application scenario we use filter diagonalization studies on topological insulator materials. Performance numbers on up to 512 nodes of the OakForest-PACS and Piz Daint supercomputers are presented, achieving beyond 100 Tflop/s for computing 100 inner eigenvalues of sparse matrices of dimension one billion.

研究の動機と目的

  • 現代のマルチコアおよびGPGPUアーキテクチャにおける量子物理学および物性科学分野のスケーラブルな固有値計算の性能ボトルネックを解消する。
  • 現代のノードにおける高帯域幅(HBM2/MCDRAM)および低帯域幅(DDR4)メモリを効率的に活用することで、HPCにおけるメモリ帯域幅制限を克服する。
  • 問題サイズが高帯域幅メモリ容量をはるかに超える場合でも、最適化されたメモリアクセスパターンにより、メモリの全領域(高帯域幅および低帯域幅を含む)を透明に利用可能にする。
  • パイプライン通信を用いて計算と通信を重ねることで、分散メモリ実装における通信オーバーヘッドを低減する。
  • 実世界のトポロジカル絶縁体の応用を想定し、Oakforest-PACS や Piz Daint といった本番環境のスーパーコンピュータ上で強スケーリングと高い性能を実証する。

提案手法

  • 計算強度を向上させ、データ局所性を改善するため、チェビシェフフィルタ対角化のブロックベクトル定式化を実装する。
  • 部分空間ブロッキングを適用し、一度に少数のベクトルのみを処理することで、高帯域幅メモリの効率的利用と、低帯域幅メモリへの透明なアクセスを実現する。
  • 計算を1つの部分空間で行いながら次の部分空間の通信を重ねるパイプライン通信戦略を導入し、無駄な待機時間を削減する。
  • P100における非ブロッキングMPIとGPUdirectを活用し、通信遅延を隠蔽しながらメモリトラフィックの増加なしに通信を最適化する。
  • カーネル統合と規則的なメモリアクセスパターンを用いて、スパース行列-複数ベクトル乗算(SpMMV)を最適化する。
  • アルゴリズムの再定式化により、高次数のチェビシェフ多項式をサブブロックごとに段階的に評価することで、計算強度を維持する。

実験結果

リサーチクエスチョン

  • RQ1現代のマルチコアおよびGPGPUアーキテクチャにおけるハイブリッドメモリハーキテクチャを想定したチェビシェフフィルタ対角化の最適化はどのように達成できるか?
  • RQ2部分空間ブロッキングは、高帯域幅メモリ容量を超える問題に対して、効率的な計算を可能にする程度はどの程度か?
  • RQ3分散メモリ実装におけるチェビFDにおいて、パイプライン通信と計算の重ね合わせは通信コストを効果的に隠蔽できるか?
  • RQ4これらの最適化を用いることで、Oakforest-PACS や Piz Daint といった現代のスーパーコンピュータ上でどの程度の性能向上が達成できるか?
  • RQ5通信がボトルネックとなる強スケーリング環境において、本手法はどの程度スケーリングするか?

主な発見

  • ブロックベクトル実装により、Xeon PhiおよびP100アーキテクチャの両方で理論ピーク性能のおよそ10%を達成しており、メモリバウンドではなくなったことが示された。
  • 部分空間ブロッキングにより、高帯域幅メモリ容量を超える作業セットであっても、高帯域幅メモリに加え低帯域幅メモリ(DDR4)を透明に利用可能にし、性能の低下なしに実現された。
  • パイプライン通信と計算の重ね合わせにより通信オーバーヘッドが低減され、Oakforest-PACSで512ノードの強スケーリングにおいて、従来のベクトルモード比で最大50%の高速化が達成された。
  • Piz Daintでは、GPU計算と非ブロッキングMPI通信の間にオーバーラップが生じなかったため、パイプライン化による利点は得られず、アーキテクチャ固有の制限が顕在化した。
  • Oakforest-PACSおよびPiz Daintにおいて、10^9次元のスパース行列の10^2個の固有値を計算する際、100 TFlop/s以上の性能が達成された。
  • 本手法は高い計算強度を維持し、余分なメモリトラフィックを回避するため、量子物性における大規模な反復ソルバーやスペクトル解析に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。