Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient techniques to GPU Accelerations of Multi-Shot Quantum Computing Simulations

Jun Doi, Hiroshi Horii|arXiv (Cornell University)|2023. 08. 07.
Quantum Computing Algorithms and Architecture인용 수 4
한 줄 요약

이 논문은 다중 샷 양자 회로 시뮬레이션을 가속화하기 위해 배치 처리된 다중 샷 실행과 샷 브랜치 기법이라는 두 가지 GPU 최적화 기법을 제안한다. 특히 노이즈가 있는 환경에서의 성능 향상을 위해 설계되었다. 샷들을 단일 커널 실행으로 묶고 동일한 샷 경로를 공유하는 상태 벡터를 활용함으로써, 저자들은 이전 GPU 구현 대비 최대 10배의 성능 향상을 달성하였으며, 이는 작은 회로에 대해서도 GPU 시뮬레이션이 CPU보다 빠르게 만든다.

ABSTRACT

Quantum computers are becoming practical for computing numerous applications. However, simulating quantum computing on classical computers is still demanding yet useful because current quantum computers are limited because of computer resources, hardware limits, instability, and noises. Improving quantum computing simulation performance in classical computers will contribute to the development of quantum computers and their algorithms. Quantum computing simulations on classical computers require long performance times, especially for quantum circuits with a large number of qubits or when simulating a large number of shots for noise simulations or circuits with intermediate measures. Graphical processing units (GPU) are suitable to accelerate quantum computer simulations by exploiting their computational power and high bandwidth memory and they have a large advantage in simulating relatively larger qubits circuits. However, GPUs are inefficient at simulating multi-shots runs with noises because the randomness prevents highly parallelization. In addition, GPUs have a disadvantage in simulating circuits with a small number of qubits because of the large overheads in GPU kernel execution. In this paper, we introduce optimization techniques for multi-shot simulations on GPUs. We gather multiple shots of simulations into a single GPU kernel execution to reduce overheads by scheduling randomness caused by noises. In addition, we introduce shot-branching that reduces calculations and memory usage for multi-shot simulations. By using these techniques, we speed up x10 from previous implementations.

연구 동기 및 목표

  • 높은 커널 실행 오버헤드와 노이즈에 의한 무작위성으로 인해 GPU 기반 다중 샷 양자 시뮬레이션의 비효율성을 해결한다.
  • 작은 회로에서 GPU 오버헤드로 인해 CPU 시뮬레이션이 GPU를 앞서는 성능 격차를 극복한다.
  • 특히 팔리 및 크라우스 노이즈 모델을 적용한 노이즈 있는 양자 회로의 시뮬레이션 효율을 향상시킨다.
  • MPI를 활용해 다중 GPU 및 컴퓨팅 노드를 통한 확장성 있고 고성능의 다중 샷 시뮬레이션을 가능하게 한다.
  • 다양한 회로 크기와 노이즈 조건에서 성능을 향상시키기 위해 CPU 및 GPU 모두에 적용 가능한 기법을 개발한다.

제안 방법

  • 여러 샷을 단일 GPU 커널 실행으로 묶어 다중 샷 배치 처리를 구현함으로써 커널 실행 오버헤드를 줄인다.
  • 동일한 경로를 따라가는 샷들 간에 상태 벡터를 공유하는 샷 브랜치 기법을 도입하여 중복 계산과 메모리 사용을 줄인다.
  • 노이즈 샘플링 및 측정 연산 중 샷 간의 동기화 메커니즘을 적용하여 배치 실행 중에도 정확성을 유지한다.
  • Qiskit Aer 내부에 이러한 기법을 적용하여 GPU 및 다중 노드 시뮬레이션 기능을 활용해 종단 간 가속화를 달성한다.
  • 특수 API(예: cuStateVec)에 의존하지 않도록 하여 기존 양자 시뮬레이션 스택과의 호환성을 확보하고 이식성을 높인다.
  • 작은 회로와 큰 회로 모두에 대응하는 하이브리드 최적화를 위해 배치 처리된 다중 샷과 샷 브랜치 기법을 결합한다.

실험 결과

연구 질문

  • RQ1노이즈와 중간 측정으로 인해 효율적인 병렬 처리가 어려운 상황에서 GPU 기반 다중 샷 양자 시뮬레이션을 어떻게 가속화할 수 있는가?
  • RQ2배치 실행이 GPU 커널 실행 오버헤드를 줄여 작은 회로에 대해서도 GPU 시뮬레이션이 CPU보다 빠르게 만들 수 있는가?
  • RQ3낮은 오류율에서 노이즈 있는 양자 시뮬레이션에서 샷 브랜치 기법이 계산 및 메모리 사용을 얼마나 줄이는가?
  • RQ4클러스터 환경에서 다중 GPU 및 컴퓨팅 노드 간에 이러한 최적화 기법이 어떻게 확장되는가?
  • RQ5제안된 기법은 CPU 및 GPU 실행 모두에 일반화될 수 있으며, 기존 시뮬레이션 백엔드와 비교해 어떻게 성능을 냅니다?

주요 결과

  • 배치 처리된 다중 샷 최적화 기법은 GPU 커널 실행 오버헤드를 줄여, 20 큐비트 미만의 회로에 대해서도 GPU 시뮬레이션이 CPU를 앞서는 성능을 달성할 수 있도록 한다.
  • 샷 브랜치 기법은 특히 낮은 오류율에서 브랜치가 희박할 경우 노이즈 있는 시뮬레이션에서 계산 및 메모리 사용을 크게 줄인다.
  • 배치 처리된 다중 샷과 샷 브랜치 기법을 병행 적용함으로써 이전 Qiskit Aer GPU 구현 대비 최대 10배의 성능 향상을 달성한다.
  • MPI를 활용한 다중 노드 클러스터 환경에서도 최적화 기법이 강력한 확장성을 보이며, 특히 큰 샷 수와 큰 회로에서 유리하다.
  • 이 기법들은 CPU 및 GPU 모두에서 효과적이며, 큰 회로에서는 샷 브랜치 기법이 뛰어난 성능을 보이고, 작은 회로에서는 배치 처리 실행이 뛰어난 성능을 발휘한다.
  • 저자들은 새로운 구현이 이전 GPU의 비효율성 문제를 해결하고, 전체 큐비트 범위에서 CPU보다 더 빠른 시뮬레이션을 가능하게 했다고 관찰한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.