Skip to main content
QUICK REVIEW

[論文レビュー] Boosting the effective performance of massively parallel tensor network state algorithms on hybrid CPU-GPU based architectures via non-Abelian symmetries

Andor Menczer, Örs Legeza|arXiv (Cornell University)|Sep 23, 2023
Parallel Computing and Optimization TechniquesComputer Science被引用数 3
ひとこと要約

本稿では、非アーベル SU(2) 対称性を活用することで、計算複雑性を最大10倍低減し、前例の U(1) 対称性実装と比較して 3–6倍の高い TFLOPS 性能を達成する、CPU-GPUハイブリッド実装の密度行列密度行列縮約群(DMRG)アルゴリズムを提示する。ウィグナー=エーケルトの定理を用いて非アーベルテンソル代数を分離し、適応的バッファリングとストライド付きバッチ処理によるメモリアクセス最適化を実施することで、8枚のA100 GPUを搭載した単一ノードで110 TFLOPSの性能を達成し、同等の精度において推定250–500 TFLOPSの有効性能を実現した。

ABSTRACT

We present novel algorithmic solutions together with implementation details utilizing non-Abelian symmetries in order to boost the current limits of tensor network state algorithms on high performance computing infrastructure. In our in-house developed hybrid CPU-multiGPU solution scheduling is decentralized, threads are autonomous and inter-thread communications are solely limited to interactions with globally visible lock-free constructs. Our custom tailored virtual memory management ensures data is produced with high spatial locality, which together with the use of specific sequences of strided batched matrix operations translates to significantly higher overall throughput. In order to lower IO overhead, an adaptive buffering technique is used to dynamically match the level of data abstraction, at which cache repositories are built and reused, to system resources. The non-Abelian symmetry related tensor algebra based on Wigner-Eckhart theorem is fully detached from the conventional tensor network layer, thus massively parallel matrix and tensor operations can be performed without additional overheads. Altogether, we have achieved an order of magnitude increase in performance with respect to results reported in arXiv:2305.05581 in terms of computational complexity and at the same time a factor of three to six in the actual performance measured in TFLOPS. Benchmark results are presented on Hilbert space dimensions up to $2.88 imes10^{36}$ obtained via large-scale SU(2) spin adapted density matrix renormalization group simulations on selected strongly correlated molecular systems. These demonstrate the utilization of NVIDIA's highly specialized tensor cores, leading to performance around 110 TFLOPS on a single node supplied with eight NVIDIA A100 devices. In comparison to U(1) implementations with matching accuracy, our solution has an estimated effective performance of 250-500 TFLOPS.

研究の動機と目的

  • テンソルネットワーク状態アルゴリズムにおける非アーベル対称性の活用によって、量子系シミュレーションの指数的スケーリングを克服すること。
  • 対称性処理に起因するパフォーマンスオーバーヘッドが生じないよう、ハイブリッドCPU-GPU HPCアーキテクチャ上で効率的かつ大規模並列なDMRGシミュレーションを可能にすること。
  • カスタムメモリ管理および適応的バッファリング技術により、計算スループットを向上させるとともにI/Oオーバーヘッドを低減すること。
  • 2.88×10^36次元に達する巨大なヒルベルト空間を対象としたSU(2)スピン適応DMRGの実現可能性と性能向上を実証すること。
  • 強相関する量子系のスケーラブルかつ高性能なフレームワークを、量子化学および物性物理学分野に確立すること。

提案手法

  • スレッド間通信を最小限に抑えるために、分散型でロックフリーなスレッドスケジューリングモデルと、自律的なGPUカーネルを採用する。
  • ウィグナー=エーケルトの定理に基づく非アーベルテンソル代数を、テンソルネットワーク層から完全に分離することで、対称性関連の計算オーバーヘッドを排除する。
  • GPUテンソルコアにおける空間局所性とスループットを最大化するために、ストライド付きバッチ処理の行列演算を用いる。
  • 適応的バッファリングにより、データの抽象化レベルをシステムリソースに動的に適合させ、I/Oオーバーヘッドを低減するとともにキャッシュ再利用を向上させる。
  • カスタム仮想メモリ管理により、マルチGPUノード全体で高いデータ局所性と効率的なメモリアクセスパターンを確保する。
  • NVIDIA A100 GPUを用いたハイブリッドCPU-マルチGPUアーキテクチャに基づく実装であり、FP16およびBF16演算のテンソルコア加速を活用する。

実験結果

リサーチクエスチョン

  • RQ1非アーベル SU(2) 対称性は、ハイブリッドCPU-GPUシステム上の大規模並列テンソルネットワーク状態アルゴリズムで効率的に活用可能か?
  • RQ2ウィグナー=エーケルトの定理は、パフォーマンスボトルネックを引き起こさずにテンソルネットワークアルゴリズムに統合可能か?
  • RQ3最新のGPUアーキテクチャにおいて、非アーベル対称性と最適化されたメモリアクセス、バッチ処理を組み合わせることで、どの程度のパフォーマンス向上が達成可能か?
  • RQ4大規模なDMRGシミュレーションにおいて、高い対称性低減を伴う場合、適応的バッファリングはどの程度I/Oオーバーヘッドを低減するか?
  • RQ5同等の精度下で、SU(2) 対称性を持つDMRGの実装は、U(1) 対称性実装と比較してどの程度の有効パフォーマンスを達成できるか?

主な発見

  • 本手法は、先行研究(arXiv:2305.05581)と比較して計算複雑性が1桁改善され、スケーリングを指数的から近似的多項式に低減した。
  • 8枚のNVIDIA A100 GPUを搭載した単一ノードにおいて、110 TFLOPSの性能を達成し、テンソルコアの効果的利用を示した。
  • 同等の精度下で、SU(2) 実装は推定250–500 TFLOPSの有効性能を達成し、U(1) 実装と比較して3–6倍の向上を示した。
  • アルゴリズムはGPUデバイス数に比例して線形にスケーリング可能であり、ペタスケールシミュレーションに向けた効率的なマルチノード展開が可能である。
  • 強相関分子系における大規模SU(2)スピン適応DMRGを用いて、2.88×10^36次元に達するヒルベルト空間を成功裏にシミュレートした。
  • 非アーベル対称性代数をテンソルネットワーク層から分離することで、高スループットかつ低オーバーヘッドの並列化が可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。