Skip to main content
QUICK REVIEW

[논문 리뷰] Boosting the effective performance of massively parallel tensor network state algorithms on hybrid CPU-GPU based architectures via non-Abelian symmetries

Andor Menczer, Örs Legeza|arXiv (Cornell University)|2023. 09. 23.
Parallel Computing and Optimization TechniquesComputer Science인용 수 3
한 줄 요약

이 논문은 비아벨 SU(2) 대칭성을 활용하여 계산 복잡도를 최대 10배 감소시키고, 이전의 U(1) 대칭 구현 대비 TFLOPS 기준 3–6배 높은 성능을 달성한 밀도 행렬 군집화 그룹(DMRG) 알고리즘의 하이브리드 CPU-GPU 구현을 제시한다. 위그너-에크하르트 정리에 기반한 비아벨 텐서 대수의 분리와 적응형 버퍼링 및 스트라이드 배치 연산을 통한 메모리 접근 최적화를 통해, 8개의 A100 GPU를 탑재한 단일 노드에서 110 TFLOPS의 성능을 달성하였고, 동일 정확도 기준으로 추정되는 효과적 성능은 250–500 TFLOPS에 이른다.

ABSTRACT

We present novel algorithmic solutions together with implementation details utilizing non-Abelian symmetries in order to boost the current limits of tensor network state algorithms on high performance computing infrastructure. In our in-house developed hybrid CPU-multiGPU solution scheduling is decentralized, threads are autonomous and inter-thread communications are solely limited to interactions with globally visible lock-free constructs. Our custom tailored virtual memory management ensures data is produced with high spatial locality, which together with the use of specific sequences of strided batched matrix operations translates to significantly higher overall throughput. In order to lower IO overhead, an adaptive buffering technique is used to dynamically match the level of data abstraction, at which cache repositories are built and reused, to system resources. The non-Abelian symmetry related tensor algebra based on Wigner-Eckhart theorem is fully detached from the conventional tensor network layer, thus massively parallel matrix and tensor operations can be performed without additional overheads. Altogether, we have achieved an order of magnitude increase in performance with respect to results reported in arXiv:2305.05581 in terms of computational complexity and at the same time a factor of three to six in the actual performance measured in TFLOPS. Benchmark results are presented on Hilbert space dimensions up to $2.88 imes10^{36}$ obtained via large-scale SU(2) spin adapted density matrix renormalization group simulations on selected strongly correlated molecular systems. These demonstrate the utilization of NVIDIA's highly specialized tensor cores, leading to performance around 110 TFLOPS on a single node supplied with eight NVIDIA A100 devices. In comparison to U(1) implementations with matching accuracy, our solution has an estimated effective performance of 250-500 TFLOPS.

연구 동기 및 목표

  • 텐서 네트워크 상태 알고리즘에서 비아贝尔 대칭성을 활용하여 양자 시스템 시뮬레이션의 지수적 스케일링 문제를 해결하기 위해.
  • 대칭 처리에 따른 성능 오버헤드 없이 하이브리드 CPU-GPU HPC 아키텍처에서 효율적이고 대량 병렬 DMRG 시뮬레이션을 가능하게 하기 위해.
  • 맞춤형 메모리 관리 및 적응형 버퍼링 기법을 통해 계산 처리량을 극대화하고 I/O 오버헤드를 최소화하기 위해.
  • 2.88×10^36 차원에 이르는 큰 하이젠베르크 공간에서 SU(2) 스핀 적응 DMRG의 실현 가능성과 성능 향상을 입증하기 위해.
  • 양자 화학 및 응집물리 분야에서 강상호작용 양자 시스템을 위한 확장 가능하고 고성능 프레임워크를 구축하기 위해.

제안 방법

  • 상호 스레드 통신을 최소화하기 위해 분산형, 락 없는 스레드 스케줄링 모델과 자율적 GPU 커널을 사용한다.
  • 위그너-에크하르트 정리에 기반한 비아벨 텐서 대수는 텐서 네트워크 레이어에서 완전히 분리되어 대칭 관련 계산 오버헤드를 제거한다.
  • GPU 텐서 코어에서 공간 국소성과 처리량을 극대화하기 위해 스트라이드 배치 행렬 연산을 사용한다.
  • 적응형 버퍼링은 데이터 추상화 수준을 시스템 자원에 맞게 동적으로 조정하여 I/O 오버헤드를 감소시키고 캐시 재사용을 향상시킨다.
  • 맞춤형 가상 메모리 관리 시스템은 다중 GPU 노드 간 높은 데이터 국소성과 효율적인 메모리 접근 패턴을 보장한다.
  • NVIDIA A100 GPU를 사용한 하이브리드 CPU-다중 GPU 아키텍처에 기반한 구현으로, FP16 및 BF16 연산에 대해 텐서 코어 가속을 활용한다.

실험 결과

연구 질문

  • RQ1비아벨 SU(2) 대칭성이 하이브리드 CPU-GPU 시스템에서 대량 병렬 텐서 네트워크 상태 알고리즘에 효율적으로 적용될 수 있는가?
  • RQ2위그너-에크하르트 정리를 텐서 네트워크 알고리즘에 통합할 때 성능 저하 요소가 발생하지 않도록 할 수 있는가?
  • RQ3현대 GPU 아키텍처에서 비아贝尔 대칭성과 최적화된 메모리 접근, 배치 연산을 조합함으로써 얻을 수 있는 성능 향상은 어느 정도인가?
  • RQ4고대칭 감소를 가진 대규모 DMRG 시뮬레이션에서 적응형 버퍼링이 I/O 오버헤드를 어느 정도 감소시키는가?
  • RQ5동일 정확도 기준으로 SU(2) 대칭 DMRG의 실현 가능한 효과적 성능는 U(1) 대칭 구현 대비 어느 정도 높은가?

주요 결과

  • 이전 연구(arXiv:2305.05581) 대비 계산 복잡도에서 한 단계 향상되었으며, 스케일링이 지수적에서 근사 다항식 수준으로 감소하였다.
  • 8개의 NVIDIA A100 GPU를 탑재한 단일 노드에서 110 TFLOPS에 도달하여 텐서 코어의 효과적 활용을 입증하였다.
  • 동일 정확도 기준으로 SU(2) 구현은 추정 효과적 성능 250–500 TFLOPS를 달성하였으며, 이는 U(1) 구현 대비 3–6배 향상된 성능이다.
  • GPU 장치 수에 따라 알고리즘의 스케일링이 선형적으로 유지되어 페타스케일 시뮬레이션을 위한 다중 노드 배포가 효율적으로 가능하다.
  • 강상호작용 분자 시스템에서 대규모 SU(2) 스핀 적응 DMRG를 사용하여 최대 2.88×10^36 차원의 하이젠베르크 공간을 성공적으로 시뮬레이션하였다.
  • 비아벨 대칭 대수를 텐서 네트워크 레이어에서 분리함으로써 고처리량, 저오버헤드 병렬 텐서 연산이 가능해졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.