Skip to main content
QUICK REVIEW

[논문 리뷰] mpiQulacs: A Distributed Quantum Computer Simulator for A64FX-based Cluster Systems

Satoshi Imamura, M. Yamazaki|arXiv (Cornell University)|2022. 03. 30.
Quantum Computing Algorithms and Architecture인용 수 9
한 줄 요약

이 논문은 MPI, 벡터화, 융합 스왑 게이트를 활용하여 통신을 최소화한 A64FX 기반 클러스터 시스템에 최적화된 고성능 분산 양자 회로 시뮬레이터인 mpiQulacs를 제시한다. 64노드로 구성된 Todoroki 클러스터에서 36 큐비트까지 거의 이상적인 약한 스케일링 및 강한 스케일링을 달성하며, 기존 시뮬레이터들을 능가하는 성능을 보이며 새로운 양자 B/F 비율 지표를 통해 뛰어난 효율성을 입증한다.

ABSTRACT

Quantum computer simulators running on classical computers are essential for developing real quantum computers and emerging quantum applications. In particular, state vector simulators, which store a full state vector in memory and update it in every quantum operation, are available to simulate an arbitrary form of quantum circuits, debug quantum applications, and validate future quantum computers. However, the time and space complexity grows exponentially with the number of qubits and easily exceeds the capability of a single machine. Therefore, we develop a distributed state vector simulator, $mpiQulacs$, that is optimized for large-scale simulation on A64FX-based cluster systems. A64FX is an ARM-based CPU that is also equipped in the world's top Fugaku supercomputer. We evaluate weak and strong scaling of mpiQulacs with up to 36 qubits on a new 64-node A64FX-based cluster system named $Todoroki$. By comparing mpiQulacs with existing distributed state vector simulators, we show that mpiQulacs achieves the highest performance for large-scale simulation on tens of nodes while sustaining a nearly ideal scalability. Besides, we define a new metric, $quantum B/F ratio$, and use it to demonstrate that mpiQulacs running on Todoroki fits the requirements of distributed state vector simulation rather than the existing simulators running on general purpose CPU-based or GPU-based cluster systems.

연구 동기 및 목표

  • 클래식 시스템에서 대규모 양자 회로 시뮬레이션의 기하급수적 증가하는 메모리 및 계산 요구량을 해결하기 위해.
  • 단일 노드 시뮬레이터와 일반 목적의 CPU/GPU 클러스터의 상태 벡터 시뮬레이션에 한계가 있음을 극복하기 위해.
  • Fugaku 및 기타 고성능 시스템에서 사용되는 고대역폭 A64FX 아키텍처에 최적화된 분산 양자 시뮬레이터를 최적화하기 위해.
  • 최소한의 노드 간 통신으로 수십 개의 노드에서 36 큐비트 회로를 효율적이고 확장 가능하게 시뮬레이션할 수 있도록 하기 위해.
  • 분산 상태 벡터 시뮬레이션에 적합한 클러스터 시스템을 평가하기 위해 새로운 성능 지표인 양자 B/F 비율(QBF)을 도입하고 검증하기 위해.

제안 방법

  • MPI를 사용하여 단일 노드 Qulacs 시뮬레이터를 확장하여 A64FX 기반의 여러 노드에서 분산 시뮬레이션을 가능하게 하였다.
  • A64FX CPU의 SIMD 유닛과 고대역폭 HBM2 메모리에 특화된 벡터화된 커널을 구현하였다.
  • 분산 상태 벡터 업데이트 중 MPI 통신량을 줄이기 위해 융합 스왑 게이트 연산을 도입하였다.
  • 평가 및 벤치마킹을 위해 Todoroki라는 이름의 64노드 A64FX 기반 클러스터 시스템을 구축하였다.
  • 총 FLOPS를 실행 시간으로 나눈 값으로 정의된 양자 B/F 비율(QBF)을 정의하고 계산하여 분산 시뮬레이션에서의 시스템 효율성을 평가하였다.

실험 결과

연구 질문

  • RQ1현대의 A64FX 기반 클러스터 시스템에서 분산 상태 벡터 시뮬레이터가 거의 이상적인 약한 스케일링 및 강한 스케일링을 달성할 수 있는가?
  • RQ2동일 하드웨어 조건에서 mpiQulacs는 기존의 분산 시뮬레이터들(예: Intel-QS, QuEST, Qiskit Aer)에 비해 어떤 성능을 보이는가?
  • RQ3mpiQulacs는 비최적화 구현 대비 A64FX CPU의 고대역폭 메모리 대역폭을 얼마나 잘 활용하는가?
  • RQ4양자 B/F 비율(QBF) 지표는 대규모 상태 벡터 시뮬레이션에 적합한 시스템을 효과적으로 구분할 수 있는가?
  • RQ5mpiQulacs는 Fugaku와 유사한 1024노드 A64FX 클러스터에서도 높은 성능과 확장성을 유지할 수 있는가?

주요 결과

  • mpiQulacs는 64노드 Todoroki 클러스터에서 최대 36 큐비트까지 거의 이상적인 약한 스케일링 및 강한 스케일링을 달성하였으며, 다중 노드 환경에서 Intel-QS, QuEST, Qiskit Aer을 모두 능가하는 성능을 보였다.
  • 단일 A64FX CPU에서 mpiQulacs는 이론적 HBM2 메모리 대역폭 최고치의 80% 이상을 달성하였으며, Xeon CPU를 사용한 Intel-QS 대비 실행 시간을 69% 감소시켰다.
  • 융합 스왑 게이트 최적화가 MPI 통신량을 크게 줄여 높은 확장성과 성능 향상에 기여하였다.
  • 양자 B/F 비율(QBF) 평가 결과, Todoroki에서의 mpiQulacs는 GPU 기반 Qiskit Aer과 CPU 기반 시뮬레이터보다 훨씬 높은 효율성을 보이며, 대규모 분산 시뮬레이션에 더 적합함을 시사하였다.
  • mpiQulacs는 특히 노드 간 통신이 필요한 다중 노드 시뮬레이션에서 뛰어난 성능을 보였으며, 8개 GPU를 초과하는 Qiskit Aer을 뛰어넘었다.
  • 예상되는 1024노드 A64FX 클러스터에서는 40 큐비트 시뮬레이션까지 확장 가능하며, 더 높은 확장성과 에너지 효율성 향상이 기대된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.