Skip to main content
QUICK REVIEW

[논문 리뷰] Hybrid quantum programming with PennyLane Lightning on HPC platforms

Ali Asadi, Amintor Dusko|arXiv (Cornell University)|2024. 03. 04.
Quantum Computing Algorithms and Architecture인용 수 4
한 줄 요약

이 논문은 CPU, GPU, HPC 환경에서 최적화된 C++ 기반 상태벡터 시뮬레이터인 PennyLane Lightning를 소개한다. SIMD 가속, 다중 스레딩, 배치 실행, 다중 노드 기반 MPI 기반 분산 시뮬레이션을 통해 VQE, QAOA, 기울기 기반 최적화와 같은 효율적인 하이브리드 양자-고전적 워크로드를 지원하며, 기존 시뮬레이터 대비 특히 GPU 및 다중 노드 HPC 플랫폼에서 강력한 성능 향상을 이룩하여 최대 41 큐비트 회로 시뮬레이션을 구현한다.

ABSTRACT

We introduce PennyLane's Lightning suite, a collection of high-performance state-vector simulators targeting CPU, GPU, and HPC-native architectures and workloads. Quantum applications such as QAOA, VQE, and synthetic workloads are implemented to demonstrate the supported classical computing architectures and showcase the scale of problems that can be simulated using our tooling. We benchmark the performance of Lightning with backends supporting CPUs, as well as NVidia and AMD GPUs, and compare the results to other commonly used high-performance simulator packages, demonstrating where Lightning's implementations give performance leads. We show improved CPU performance by employing explicit SIMD intrinsics and multi-threading, batched task-based execution across multiple GPUs, and distributed forward and gradient-based quantum circuit executions across multiple nodes. Our data shows we can comfortably simulate a variety of circuits, giving examples with up to 30 qubits on a single device or node, and up to 41 qubits using multiple nodes.

연구 동기 및 목표

  • CPU, NVIDIA 및 AMD GPU, HPC 클러스터를 포함한 다양한 고전적 하드웨어 백엔드를 지원하는 고성능이고 이식 가능한 양자 시뮬레이터 슈트를 개발한다.
  • 자동 미분을 활용한 기울기 기반 최적화를 포함한 변이 양자 알고리즘(VQE, QAOA 등)과 같은 하이브리드 양자-고전적 워크로드를 효율적으로 실행할 수 있도록 한다.
  • MPI를 활용한 분산 시뮬레이션을 통해 다수의 노드에서 확장 가능한 분산 양자 회로 시뮬레이션을 지원하여 단일 장치의 한계를 초월한 대규모 회로 시뮬레이션을 가능하게 한다.
  • 모든 백엔드, 특히 분산 GPU 환경에서 원활한 통합을 통해 성능이 뛰어난 내장된 양자 기울기 계산(역행렬 방법 기반)을 제공한다.
  • HPC 환경에서의 자원 할당을 위한 정확한 런타임 추정 지침을 제공하여 대규모 양자 시뮬레이션의 효율적인 워크로드 기획을 가능하게 한다.

제안 방법

  • SIMD 인트린식(AVX-512, AVX2)을 사용한 최적화된 게이트 커널을 갖춘 모듈식 C++20 기반 시뮬레이터 스택을 설계 및 구현하여 CPU의 단일 및 다중 스레딩 성능을 향상시킨다.
  • PennyLane의 장치 추상화 프레임워크를 통해 통일된 인터페이스를 제공하는 lightning.qubit(CPU), lightning.gpu(NVIDIA CUDA), lightning.kokkos(AMD ROCm) 장치 백엔드를 구현한다.
  • CUDA 스트림과 다중 GPU 작업 스케줄링을 활용하여 다수의 GPU에서 독립된 회로를 배치 기반으로 작업 기반으로 실행한다.
  • MPI를 사용한 분산 상태벡터 시뮬레이션을 구현하여 다중 노드 실행을 지원하며, 클러스터 전반에 걸쳐 정방향 및 기울기 기반의 회로 평가를 가능하게 한다.
  • 모든 백엔드에서 역행렬 기반 자동 미분을 위한 내장된 지원을 통합하여 JAX, PyTorch, TensorFlow 워크플로우에서 효율적인 역방향 자동 미분을 가능하게 한다.
  • 현대적 C++20 기능과 추상화 레이어를 활용하여 Perlmutter, LUMI, AWS EC2를 포함한 다양한 HPC 플랫폼 간의 이식성과 성능을 보장한다.

실험 결과

연구 질문

  • RQ1PennyLane Lightning의 성능는 단일 노드, 다중 GPU, 분산 다중 노드 HPC 환경에서 다른 고성능 시뮬레이터와 비교해 어떻게 되는가?
  • RQ2SIMD 인트린식과 다중 스레딩은 변이 알고리즘에 대해 CPU 기반 양자 회로 시뮬레이션 성능를 얼마나 향상시킬 수 있는가?
  • RQ3MPI를 활용한 다중 노드 및 다중 GPU 환경에서의 분산 양자 회로 시뮬레이션의 확장성과 효율성은 어떠한가?
  • RQ4역행렬 방법을 통한 기울기 계산이 통합된 프레임워크에서 CPU, GPU, 분산 HPC 백엔드 전반에서 효율적이고 내장된 방식으로 지원될 수 있는가?
  • RQ5이 도구 세트를 사용하여 HPC 환경에서 대규모 양자 시뮬레이션의 자원 요구량과 런타임을 연구자가 어떻게 추정할 수 있는가?

주요 결과

  • 기울기 기반 워크로드(예: 회로 기울기)에 대해 512개 GPU에서 다른 시뮬레이터 대비 약 30% 높은 약한 스케일링 효율성을 기록하였으며, 샘플링과 기울기 워크로드의 경우 각각 8% 및 30%의 효율성을 기록하였다.
  • 30 큐비트 회로에서 AVX-512를 사용한 Lightning의 CPU 백엔드는 특정 게이트 유형에 대해 기존 구현 대비 뚜렷한 성능 향상을 보이며, 게이트 적용 시간에서 뛰어난 성능을 발휘하였다.
  • 20 큐비트를 초월하는 회로에서는 GPU 백엔드(lightning.gpu)가 CPU 대비 성능 우위를 보이며, 회로 깊이와 큐비트 수가 증가할수록 이점이 커졌다.
  • lightning.gpu는 다중 노드에서 기울기 계산을 위한 역행렬 방법을 내장으로 지원하는 유일한 분산 상태벡터 시뮬레이터로서, 대규모 시뮬레이션에서 효율적인 역방향 미분을 가능하게 한다.
  • 분산 다중 노드 실행을 통해 최대 41 큐비트의 회로를 시뮬레이션할 수 있었으며, 이는 대규모 양자 알고리즘 프로토타이핑의 가능성을 입증한다.
  • Perlmutter 및 LUMI와 같은 HPC 시스템에서 자원 할당 계획을 위한 런타임 추정 지침을 제공하였으며, 실제 HPC 하드웨어를 활용한 검증된 벤치마크를 통해 검증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.