Skip to main content
QUICK REVIEW

[论文解读] Toward Trainability of Deep Quantum Neural Networks

Kaining Zhang, Min-Hsiu Hsieh|arXiv (Cornell University)|Dec 30, 2021
Stochastic Gradient Optimization Techniques被引用 8
一句话总结

本文提出受控层量子神经网络(CL-QNNs),一种深度量子架构,通过确保梯度范数不依赖于量子比特数量和电路深度而下确界,从而避免了 barren plateau 问题。通过在不依赖不切实际的 2-design 假设的前提下分析旋转角参数空间,作者证明了理论可训练性保证,并在二分类和伊辛模型基态寻找任务中展示了优于随机和硬件高效 QNN 的收敛性能。

ABSTRACT

Quantum Neural Networks (QNNs) with random structures have poor trainability due to the exponentially vanishing gradient as the circuit depth and the qubit number increase. This result leads to a general belief that a deep QNN will not be feasible. In this work, we provide the first viable solution to the vanishing gradient problem for deep QNNs with theoretical guarantees. Specifically, we prove that for circuits with controlled-layer architectures, the expectation of the gradient norm can be lower bounded by a value that is independent of the qubit number and the circuit depth. Our results follow from a careful analysis of the gradient behaviour on parameter space consisting of rotation angles, as employed in almost any QNNs, instead of relying on impractical 2-design assumptions. We explicitly construct examples where only our QNNs are trainable and converge, while others in comparison cannot.

研究动机与目标

  • 为解决近场量子设备上深度量子神经网络(QNN)中的梯度消失问题,该问题阻碍了训练。
  • 开发一种 QNN 架构,即使在量子比特数量和电路深度增加时也能保持非零的梯度范数。
  • 在不依赖不切实际的 2-design 假设的前提下,提供可训练性的理论保证。
  • 通过实证表明,CL-QNN 在分类和基态搜索任务中优于随机和硬件高效 QNN。

提出的方法

  • 提出一种受控层(CL)架构,其中参数化量子电路被组织为带有相邻量子比特之间受控纠缠门的模块化块。
  • 在旋转角参数空间上分析梯度行为,推导出不依赖于量子比特数量和深度的期望梯度范数下界。
  • 基于迹不等式和酉矩阵分解的严格分析框架,证明梯度范数的下界为 Ω(8^{-LS})。
  • 构建显式示例,其中仅 CL-QNN 收敛,而随机和硬件高效 QNN 因梯度消失而失败。
  • 使用 13 个量子比特实现 CL-QNN,并在使用葡萄酒数据集的二分类任务中,与 HE-QNN 和随机 QNN 进行性能对比。
  • 使用随机梯度下降和 Adam 优化器,通过 100 次测量、批量大小为 8 的有限采样,在 200 次迭代内评估可训练性。

实验结果

研究问题

  • RQ1即使在随机电路中梯度呈指数级消失,能否使深度 QNN 保持可训练性?
  • RQ2受控层架构是否能实现不依赖于量子比特数量和电路深度的非零梯度范数下界?
  • RQ3能否在不依赖 2-design 假设的前提下建立可训练性的理论保证?
  • RQ4在实际训练场景中,CL-QNN 是否优于随机和硬件高效 QNN?
  • RQ5CL-QNN 与基线架构相比,梯度范数和收敛性的经验行为如何?

主要发现

  • CL-QNN 的期望梯度范数被下界限制为 Ω(8^{-LS}),其中 L 为受控层块数,S 为可观测量中的量子比特数,确保了无论深度或量子比特数量如何,均可实现可训练性。
  • 在训练过程中,CL-QNN 的梯度范数大于 0.5,而随机和 HE-QNN 的初始梯度范数显著更小。
  • 在二分类任务中,CL-QNN 明确实现了训练损失和测试误差的收敛,而 HE-QNN 和随机 QNN 的最终损失值很高,未能收敛。
  • 随机 Adam 优化器在 125 次迭代内实现 CL-QNN 的收敛,而同一优化器对 HE-QNN 和随机 QNN 未表现出明显收敛。
  • 实证结果证实,CL-QNN 是所测试架构中唯一在伊辛模型基态和葡萄酒数据集任务中均成功训练的架构。
  • 该理论框架避免了 2-design 假设,使其比先前工作更适用于现实世界中的近场量子硬件。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。