Skip to main content
QUICK REVIEW

[논문 리뷰] Distributed Memory Techniques for Classical Simulation of Quantum Circuits

Ryan LaRose|arXiv (Cornell University)|2018. 01. 02.
Quantum Computing Algorithms and Architecture참고 문헌 15인용 수 4
한 줄 요약

이 논문은 다수의 노드에 걸쳐 상태벡터를 분할하여 양자 회로의 고성능 분산 메모리 시뮬레이션 프레임워크를 제시한다. 단일 앰플리튜드 프로토콜을 통한 통신 최적화와 비순차적 상태벡터 저장을 통해, 64개 노드에서 최대 33 큐비트의 시뮬레이션을 달성하여 단일 노드의 한계를 뛰어넘는 확장 가능한 시뮬레이션 경계를 크게 확장한다.

ABSTRACT

In this paper we describe, implement, and test the performance of distributed memory simulations of quantum circuits on the MSU Laconia Top500 supercomputer. Using OpenMP and MPI hybrid parallelization, we first use a distributed matrix-vector multiplication with one-dimensional partitioning and discuss the shortcomings of this method due to the exponential memory requirements in simulating quantum computers. We then describe a more efficient method that stores only the $2^n$ amplitudes of the $n$ qubit state vector $|ψ angle$ and optimize its single node performance. In our multi-node implementation, we use a single amplitude communication protocol that maximizes the number of qubits able to be simulated and minimizes the ratio of qubits that require communication to those that do not, and we present an algorithm for efficiently determining communication pairs among processors. We simulate up to 30 qubits on a single node and 33 qubits with the state vector partitioned across 64 nodes. Lastly, we discuss the advantages and disadvantages of our communication scheme, propose potential improvements, and describe other optimizations such as storing the state vector non-sequentially in memory to map communication requirements to idle qubits in the circuit.

연구 동기 및 목표

  • 양자 회로의 고전적 시뮬레이션에서 기하급수적으로 증가하는 메모리 성장 문제를 해결하기 위해.
  • 단일 노드의 한계를 초월해 대규모 양자 회로의 확장 가능한 시뮬레이션을 가능하게 하기 위해.
  • 분산 메모리 아키텍처에서 통신 오버헤드를 최소화하면서도 큐비트 시뮬레이션 용량을 최대화하기 위해.
  • 비순차적 저장을 통해 통신 집약적인 큐비트를 유휴 회로 영역에 매핑함으로써 성능을 최적화하기 위해.
  • 다중 노드 시뮬레이션에서 프로세서 간 통신 쌍을 결정하기 위한 효율적인 알고리즘을 개발하기 위해.

제안 방법

  • 분산 메모리 시뮬레이션을 위해 MSU Laconia 슈퍼컴퓨터에서 하이브리드 MPI+OpenMP 병렬 처리를 사용한다.
  • 2^k개의 프로세서에 걸쳐 상태벡터를 분할하며, n 큐비트 상태벡터의 2^n 앰플리튜드만 저장한다.
  • 통신하는 큐비트 수를 최소화하고, 게이트당 통신이 필요 없는 큐비트 수를 최대화하는 단일 앰플리튜드 통신 프로토콜을 도입한다.
  • 프로세서 간 통신 쌍을 결정하기 위한 효율적인 알고리즘을 개발하여 조율 오버헤드를 감소시킨다.
  • 비순차적 상태벡터 저장을 적용하여 통신 요구를 회로의 유휴 큐비트에 매핑함으로써, 활성 큐비트의 고게이트 적용 시간을 줄인다.
  • 메모리 액세스 패턴 최소화와 캐시 효율성 활용을 통해 단일 노드 성능을 최적화한다.

실험 결과

연구 질문

  • RQ1어떻게 하면 단일 노드 메모리 한계를 초월해 더 큰 양자 회로를 시뮬레이션할 수 있는 분산 메모리 기법을 최적화할 수 있는가?
  • RQ2게이트 연산 중 통신이 필요한 큐비트 수를 최소화하면서도 통신 오버헤드를 최소화하는 통신 프로토콜은 무엇인가?
  • RQ3비순차적 상태벡터 저장은 통신 집약적인 큐비트로 인한 성능 저하를 줄일 수 있는가?
  • RQ4다중 노드 환경에서 통신하는 큐비트와 통신하지 않는 큐비트의 비율은 전체 시뮬레이션 시간에 어떤 영향을 미치는가?
  • RQ5분산 양자 회로 시뮬레이션에서 통신 오버헤드와 단일 게이트 적용 시간 사이의 성능 트레이드오프는 어떠한가?

주요 결과

  • 단일 노드에서 30 큐비트를 성공적으로 시뮬레이션하였으며, 인덱스가 24 이하인 모든 큐비트는 게이트당 0.55초 이내에 처리된다.
  • 64개 노드에 걸쳐 상태벡터를 분할함으로써, 프레임워크는 최대 33 큐비트의 시뮬레이션을 수행하여 확장 가능한 시뮬레이션 경계를 연장한다.
  • 단일 앰플리튜드 통신 프로토콜은 통신하는 큐비트 대비 통신이 필요 없는 큐비트의 비율을 높여 전체 통신 비용을 감소시킨다.
  • 비순차적 상태벡터 저장은 통신을 유휴 큐비트에 매핑할 수 있게 해, 활성 큐비트에서 고게이트 적용 시간으로 인한 성능 저하를 완화한다.
  • 이 프로토콜은 메모리 폭주로 17 큐비트에 한정되던 단순 행렬-벡터 곱셈 대비 더 뛰어난 확장성을 확보한다.
  • 프로세서 간 통신 쌍을 결정하기 위한 효율적인 알고리즘은 조율 오버헤드를 감소시키고 다중 노드 실행에서의 로드 밸런싱을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.