Skip to main content
QUICK REVIEW

[論文レビュー] mpiQulacs: A Distributed Quantum Computer Simulator for A64FX-based Cluster Systems

Satoshi Imamura, M. Yamazaki|arXiv (Cornell University)|Mar 30, 2022
Quantum Computing Algorithms and Architecture被引用数 9
ひとこと要約

本稿では、MPI、ベクトル化、統合スワップゲートを活用して通信を最小限に抑えることで最適化された、A64FXベースのクラスターシステム向けに高パフォーマンスな分散量子回路シミュレータであるmpiQulacsを提示する。64ノードのTodorokiクラスタ上で最大36量子ビットまでほぼ理想に近い弱スケーリングおよび強スケーリングを達成し、既存のシミュレータを上回り、新たな量子B/F比という指標により優れた効率性を示している。

ABSTRACT

Quantum computer simulators running on classical computers are essential for developing real quantum computers and emerging quantum applications. In particular, state vector simulators, which store a full state vector in memory and update it in every quantum operation, are available to simulate an arbitrary form of quantum circuits, debug quantum applications, and validate future quantum computers. However, the time and space complexity grows exponentially with the number of qubits and easily exceeds the capability of a single machine. Therefore, we develop a distributed state vector simulator, $mpiQulacs$, that is optimized for large-scale simulation on A64FX-based cluster systems. A64FX is an ARM-based CPU that is also equipped in the world's top Fugaku supercomputer. We evaluate weak and strong scaling of mpiQulacs with up to 36 qubits on a new 64-node A64FX-based cluster system named $Todoroki$. By comparing mpiQulacs with existing distributed state vector simulators, we show that mpiQulacs achieves the highest performance for large-scale simulation on tens of nodes while sustaining a nearly ideal scalability. Besides, we define a new metric, $quantum B/F ratio$, and use it to demonstrate that mpiQulacs running on Todoroki fits the requirements of distributed state vector simulation rather than the existing simulators running on general purpose CPU-based or GPU-based cluster systems.

研究の動機と目的

  • 古典的システム上で大規模量子回路シミュレーションに伴う指数的増加するメモリおよび計算負荷に対処すること。
  • 状態ベクトルシミュレーションにおいて、単一ノードシミュレータや一般用途のCPU/GPUクラスタの限界を克服すること。
  • Fugakuやその他のハイパフォーマンスシステムで使用される高帯域幅のA64FXアーキテクチャに最適化された分散量子シミュレータを最適化すること。
  • 最小限のノード間通信で数十ノードで36量子ビット回路の効率的かつスケーラブルなシミュレーションを可能にすること。
  • 分散状態ベクトルシミュレーションに適したクラスターシステムの評価に用いる新しいパフォーマンス指標、量子B/F比(QBF)を導入し、検証すること。

提案手法

  • MPIを用いて単一ノードのQulacsシミュレータを拡張し、複数のA64FXベースノードにおける分散シミュレーションを可能にする。
  • A64FX CPUのSIMDユニットと高帯域幅のHBM2メモリに特化した最適化されたベクトル化カーネルを実装する。
  • 分散状態ベクトル更新時のMPI通信量を削減するために、統合スワップゲート演算を導入する。
  • 評価とベンチマークのため、64ノードのA64FXベースクラスタシステム「Todoroki」を構築する。
  • 合計FLOPSを実行時間で除算することで定義される量子B/F比(QBF)を定義・計算し、分散シミュレーションにおけるシステム効率を評価する。

実験結果

リサーチクエスチョン

  • RQ1最新のA64FXベースクラスターシステム上で、分散状態ベクトルシミュレータはほぼ理想に近い弱スケーリングおよび強スケーリングを達成できるか?
  • RQ2同等のハードウェア環境において、mpiQulacsは既存の分散シミュレータ(Intel-QS、QuEST、Qiskit Aer)と比較してどのように性能を発揮するか?
  • RQ3mpiQulacsは、非最適化実装と比較して、A64FX CPUの高帯域幅メモリをどの程度活用しているか?
  • RQ4量子B/F比(QBF)指標は、大規模状態ベクトルシミュレーションに適したシステムを効果的に区別できるか?
  • RQ5mpiQulacsは、1024ノードのA64FXクラスタのような大規模クラスタでも高いパフォーマンスとスケーラビリティを維持できるか?

主な発見

  • mpiQulacsは64ノードのTodorokiクラスタ上で最大36量子ビットまでほぼ理想に近い弱スケーリングおよび強スケーリングを達成し、マルチノード環境においてIntel-QS、QuEST、Qiskit Aerを上回る性能を示した。
  • 単一のA64FX CPU上では、mpiQulacsが理論的HBM2メモリ帯域幅ピークの80%以上を達成し、Xeon CPU上で動作するIntel-QSと比較して実行時間を69%短縮した。
  • 統合スワップゲートの最適化により、MPI通信量が顕著に削減され、高いスケーラビリティとパフォーマンスが実現された。
  • 量子B/F比(QBF)の評価から、Todoroki上でのmpiQulacsはGPUベースのQiskit AerやCPUベースのシミュレータと比較してはるかに高い効率性を示しており、大規模分散シミュレーションに適したシステムであることが示された。
  • mpiQulacsは特にノード間通信が必要となるマルチノードシミュレーションにおいて優れたパフォーマンスを発揮し、8GPUを超える環境ではQiskit Aerを上回った。
  • 計画中の1024ノードA64FXクラスタでは40量子ビットのシミュレーションが可能になると予想され、スケーラビリティおよびエネルギー効率のさらなる向上が期待される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。