Skip to main content
QUICK REVIEW

[论文解读] Using Reinforcement Learning to Perform Qubit Routing in Quantum Compilers

Matteo G. Pozzi, Steven Herbert|arXiv (Cornell University)|Jul 31, 2020
Quantum Computing Algorithms and Architecture被引用 16
一句话总结

本文提出了一种基于深度Q学习(DQN)的强化学习方法,用于量子编译器中的量子比特路由,在随机和真实近场量子电路基准测试中显著优于最先进的编译器(如Qiskit和t|ket⟩)。该方法采用新颖的状态表示和学习范式,最大限度减少SWAP门引入的电路深度,从而在最小化深度开销方面表现优异,同时保持对多样化量子架构的适应能力。

ABSTRACT

"Qubit routing" refers to the task of modifying quantum circuits so that they satisfy the connectivity constraints of a target quantum computer. This involves inserting SWAP gates into the circuit so that the logical gates only ever occur between adjacent physical qubits. The goal is to minimise the circuit depth added by the SWAP gates. In this paper, we propose a qubit routing procedure that uses a modified version of the deep Q-learning paradigm. The system is able to outperform the qubit routing procedures from two of the most advanced quantum compilers currently available, on both random and realistic circuits, across near-term architecture sizes.

研究动机与目标

  • 为解决近场量子架构中物理量子比特连接性约束带来的量子比特路由挑战,这些约束要求插入SWAP门以使任意电路可执行。
  • 改进现有量子比特路由算法,这些算法在真实硬件约束下无法有效最小化电路深度。
  • 开发一种基于强化学习的系统,可在多种量子架构上实现自适应与可扩展性,不同于静态的基于规则的路由方法。
  • 将所提方法与最先进的编译器进行基准测试,证明其在最小化深度开销方面表现更优。

提出的方法

  • 该系统将量子比特路由问题建模为强化学习问题,使用改进的深度Q网络(DQN)学习最优SWAP门插入策略。
  • 一种新的状态表示编码了当前的量子比特映射和电路结构,捕捉决策相关的连接性和门依赖关系。
  • 智能体通过试错法学习,采用奖励函数惩罚电路深度并鼓励最小化SWAP门插入。
  • 在训练过程中采用退火机制以平衡探索与利用,提升收敛性和性能。
  • 该方法采用经验回放和目标网络以稳定训练,如同标准DQN,但针对量子电路编译的动态特性进行了适配。
  • 系统在电路实例上进行训练,随后在未见过的随机和真实基准上进行评估,包括4×4网格架构。

实验结果

研究问题

  • RQ1深度Q学习方法能否有效解决量子编译器中的量子比特路由问题,实现与现有方法相当或更优的性能?
  • RQ2所提出的基于DQN的路由系统在电路深度最小化方面与Qiskit和t|ket⟩等最先进的编译器相比表现如何?
  • RQ3基于强化学习的系统能否在不同量子架构拓扑和电路类型(包括真实近场基准)上实现泛化?
  • RQ4所提方法在保持性能的同时,能否适应新型或演进中的量子硬件架构?

主要发现

  • 基于DQN的路由系统在随机和真实电路基准测试中均优于Qiskit的StochasticSwap和t|ket⟩,实现了更低的电路深度开销。
  • 在4×4网格真实基准上,该系统实现了显著优于Qiskit的StochasticSwap的CDR(电路深度比),且与t|ket⟩相当,尽管运行时间更长。
  • 该方法在不同电路类型和架构间表现出强大的泛化能力,展现出超越静态路由启发式方法的适应性。
  • 在真实测试集上,该系统平均相比Qiskit的StochasticSwap实现了15%的CDR改进,且在多个电路族中均保持一致的增益。
  • 运行时间仍是瓶颈,系统在4×4网格上每100个电路耗时约2400秒,但该性能与其它高性能方法(如LookaheadSwap)相当或更优。
  • 作者识别出若干优化路径,如神经网络剪枝、更好的并行化和自适应退火,可在不损失性能的前提下降低运行时间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。