Skip to main content
QUICK REVIEW

[论文解读] Simulating Quantum Computers Using OpenCL

Adam Kelly|arXiv (Cornell University)|May 2, 2018
Quantum Computing Algorithms and Architecture参考文献 7被引用 20
一句话总结

本文提出 QCGPU,一种基于 OpenCL 的量子线路模拟器,利用 GPU 加速显著优于现有的态矢量模拟器。通过实现优化的内核启动和基于 OpenCL 的并行门应用,该模拟器在 24 量子比特时相比 Qiskit 提升超过 150 倍,相比 ProjectQ 提升 8 倍,证明了可移植硬件加速在量子算法开发中的有效性。

ABSTRACT

Quantum computing is an emerging technology, promising a paradigm shift in computing, and allowing for speedups in many different problems. However, quantum devices are still in their early stages, most with only a small number qubits. This places a reliance on simulation to develop quantum algorithms and to verify these devices. While there exists many algorithms for the simulation of quantum circuits, there is (at the time of writing) no tools which use OpenCL to parallelize this simulation, thereby taking advantage of devices such as GPUs while still remaining portable. In this paper, such a tool is described, including optimizations in areas such as gate application. This leads to a new approach that outperforms other popular state vector based simulators. An implementation of the proposed simulator is available at https://qcgpu.github.io.

研究动机与目标

  • 为解决缺乏可移植、硬件加速的量子线路模拟器(尤其是利用 GPU 的)这一问题。
  • 在当前量子设备的量子比特数量仍有限的情况下,实现对经典硬件上量子算法的高效模拟。
  • 通过使用 OpenCL 开发可移植、开源的模拟器,实现跨平台的 GPU 加速。
  • 通过优化内核设计与并行执行,超越现有态矢量模拟器的性能。
  • 通过提供免费可用的高性能模拟工具,降低研究人员的入门门槛。

提出的方法

  • 使用 OpenCL 实现量子线路模拟器,以支持包括 GPU 在内的异构硬件。
  • 在 OpenCL C 中设计计算内核,以并行方式更新量子比特门对应的态矢量。
  • 通过工作组和工作项配置优化内核启动,以最大化 GPU 占用率和内存聚合。
  • 使用主机驱动的流水线管理 CPU 与 GPU 之间的内存传输,并调度内核执行。
  • 应用算法优化,如高效的门应用和内存访问模式,以减少延迟。
  • 在 1 至 24 量子比特范围内,使用标准量子傅里叶变换电路与 Qiskit 和 ProjectQ 进行基准测试。

实验结果

研究问题

  • RQ1与现有的仅使用 CPU 的模拟器相比,基于 OpenCL 的硬件加速能否显著提升量子线路模拟的性能?
  • RQ2当量子比特数量增加,特别是超过 20 个时,基于 OpenCL 的模拟器性能如何扩展?
  • RQ3内核启动配置和内存访问模式的选择在 GPU 架构上对模拟效率的影响有多大?
  • RQ4使用 OpenCL 的可移植、跨平台解决方案能否实现与厂商特定 GPU 框架相当或更优的性能?
  • RQ5单设备 GPU 模拟在量子线路上的实际极限是什么?与分布式计算或张量网络方法相比如何?

主要发现

  • 在 24 量子比特的量子傅里叶变换电路中,QCGPU 平均相比 Qiskit 提升超过 150 倍。
  • 在 24 量子比特级别,QCGPU 平均相比 ProjectQ 提升 8 倍。
  • 使用 Welch’s t 检验的统计分析证实,与 Qiskit 和 ProjectQ 的性能差异具有显著性(p < 0.001)。
  • 该模拟器成功在单块 GPU 上实现了最多 28 个量子比特的模拟,展示了在硬件限制下的可扩展性。
  • 使用 OpenCL 实现了在多种 GPU 架构上的可移植、高性能模拟,无需厂商特定代码。
  • 基准测试结果表明,在所有测试的量子比特数量下均实现了稳定的性能提升,且在更高量子比特数量下相对提升最大。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。