Skip to main content
QUICK REVIEW

[論文レビュー] Massively Parallel Tensor Network State Algorithms on Hybrid CPU-GPU Based Architectures

Andor Menczer, Örs Legeza|arXiv (Cornell University)|May 9, 2023
Distributed and Parallel Computing Systems被引用数 6
ひとこと要約

本論文は、ハイパフォーマンスコンピューティング向けに最適化された、大規模並列でハイブリッドCPU-GPUのテンソルネットワーク状態アルゴリズムを提示する。Maze-Runnerタスクスケジューリング、TTCacheメモリ管理、SBMM4Sバッチ処理行列積といった革新的な技術を導入し、CPUオンリー実行に比べ最大20倍の高速化と、8枚のA100 GPUで準エクサフロップ性能を達成した。これにより、ヒルベルト空間次元が2.88×10^36に達する強い相関を持つ系の効率的シミュレーションが可能になった。

ABSTRACT

The interplay of quantum and classical simulation and the delicate divide between them is in the focus of massively parallelized tensor network state (TNS) algorithms designed for high performance computing (HPC). In this contribution, we present novel algorithmic solutions together with implementation details to extend current limits of TNS algorithms on HPC infrastructure building on state-of-the-art hardware and software technologies. Benchmark results obtained via large-scale density matrix renormalization group (DMRG) simulations are presented for selected strongly correlated molecular systems addressing problems on Hilbert space dimensions up to $2.88 imes10^{36}$.

研究の動機と目的

  • 古典的計算を用いた量子多体系シミュレーションの指数的スケーリング問題を、テンソルネットワーク状態(TNS)手法を活用することで克服すること。
  • 大規模並列処理を特徴とするハイパフォーマンスコンピューティング(HPC)アーキテクチャにおいて、密度行列密度行列縮約法(DMRG)シミュレーションの限界を拡張すること。
  • 量子化学および強相関系物理学における大規模テンソル演算を処理するための、効率的でスケーラブルかつポータブルなアルゴリズムソリューションを構築すること。
  • 最適化されたハードウェア利用と低オーバーヘッドのタスクスケジューリングにより、長距離相互作用を有するペタスケールの量子多体系シミュレーションを可能にすること。

提案手法

  • タスクのグループ化と均一なスレッド使用を可能にすることで、スケジューリングの簡素化とボトルネックの低減を実現する、軽量でロールフリーなタスク並列モデル「Maze-Runner」を導入。変動しやすいワークロードにおけるオーバーヘッドを低減する。
  • データを属性に分解し、実行ブロックにマッピングすることで、I/Oの重複、メモリ断片化、割り当てコストを最小限に抑える階層的仮想メモリアドレッシング方式「TTCache」を提案。
  • ストライドメモリアクセスとオフセットベースのバッチ処理を活用し、ゼロコストの和演算を実現するバッチ処理行列積カーネル「SBMM4S」を開発。複数の行列-ベクトル演算を効率的にインタリーブして計算可能にした。
  • CPUおよびGPUにおける低レベルSIMD実行と、高レベルのHPCジョブスケジューリングを組み合わせたマルチティアの並列化戦略を採用。複数のハードウェアおよびソフトウェア抽象化レイヤーで独立して実行可能となった。
  • 長距離相互作用を含む一般のモデルハミルトニアンに対応するため、大規模テンソル演算をスケーラブルで独立したベクトルおよび行列演算に置き換えることで、DMRGアルゴリズムの最適化を実施。
  • MPIプロトコルをハイブリッドCPU-マルチGPUフレームワークに移行し、複数ノードに跨る分散計算を可能にした。これによりペタスケールのシミュレーションが実現した。

実験結果

リサーチクエスチョン

  • RQ1ハイブリッドCPU-GPUアーキテクチャは、強い相関を持つ量子多体系のテンソルネットワーク状態シミュレーションにおいて、準エクサフロップ性能を達成できるか?
  • RQ2量子多体系シミュレーションに一般的な不規則で変動しやすいワークロードにおいて、タスクスケジューリングのオーバーヘッドをどのように最小化できるか?
  • RQ3大規模テンソルネットワーク計算において、I/O、断片化、割り当てコストを最小限に抑えるために、メモリアクセスパターンをどの程度最適化できるか?
  • RQ4ゼロコストの和演算を備えたバッチ処理行列積は、DMRGシミュレーションの対角化ステップを顕著に高速化できるか?
  • RQ5GPUアクセラレータの数を増加させた際、提案アルゴリズムのスケーリング特性はどのようなものか?また、現代のハードウェアの理論的性能限界に達することができるか?

主な発見

  • 単一GPUを搭載した場合でも、ハイブリッドCPU-マルチGPU実装はCPUオンリー実行に比べ2–4倍の高速化を達成し、複数アクセラレータ間で性能が線形にスケーリングされた。
  • 8枚のNVIDIA A100-PCIE-40GB GPUを用いた場合、77.6 TFLOPSの性能を達成し、ハードウェア構成の理論ピーク性能77.6 TFLOPSに近づいた。
  • 大きな結合次元Dに対しては、総シミュレーション時間が二重対数スケールで線形に低下し、CPUオンリー実行に比べ8GPU使用時で20倍以上の高速化が達成された。
  • F2分子のCAS(18,18)空間における有効ハミルトニアンの対角化に成功し、ヒルベルト空間次元が2.88×10^36に達するまで処理可能となった。
  • 量子化学分野のベンチマーク系として知られるFeMocoクラスタは、最適化されたGPUアクセラレートDMRG法により効率的にシミュレートされた。実世界の強相関系への適用可能性が示された。
  • 提案手法であるMaze-Runner、TTCache、SBMM4Sは、効率的で低オーバーヘッドかつ高スケーラビリティを実現し、長距離相互作用を有する量子多体系のペタスケールシミュレーションへの道筋を切り開いた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。