Skip to main content
QUICK REVIEW

[논문 리뷰] Toward Trainability of Deep Quantum Neural Networks

Kaining Zhang, Min-Hsiu Hsieh|arXiv (Cornell University)|2021. 12. 30.
Stochastic Gradient Optimization Techniques인용 수 8
한 줄 요약

이 논문은 깊이 있는 양자 회로에서 기울기 폭발 문제를 피하기 위해 큐비트 수와 회로 깊이에 관계없이 기울기 노름이 하한으로 제한되는 제어층 양자 신경망(CL-QNNs)을 제안한다. 2-디자인 가정에 의존하지 않고 회전각 매개변수 공간을 분석함으로써 저자들은 이론적 훈련 가능성 보장을 입증하고, 이는 이진 분류 및 이징 스핀계의 기저 상태 탐색에서 무작위 및 하드웨어 효율적 QNN보다 뛰어난 수렴 성능을 보인다.

ABSTRACT

Quantum Neural Networks (QNNs) with random structures have poor trainability due to the exponentially vanishing gradient as the circuit depth and the qubit number increase. This result leads to a general belief that a deep QNN will not be feasible. In this work, we provide the first viable solution to the vanishing gradient problem for deep QNNs with theoretical guarantees. Specifically, we prove that for circuits with controlled-layer architectures, the expectation of the gradient norm can be lower bounded by a value that is independent of the qubit number and the circuit depth. Our results follow from a careful analysis of the gradient behaviour on parameter space consisting of rotation angles, as employed in almost any QNNs, instead of relying on impractical 2-design assumptions. We explicitly construct examples where only our QNNs are trainable and converge, while others in comparison cannot.

연구 동기 및 목표

  • 근접한 양자 장치에서 훈련을 방해하는 깊이 있는 양자 신경망(QNNs)의 기울기 소실 문제를 해결하기 위해.
  • 큐비트 수와 회로 깊이가 증가함에 따라 비영인 기울기 노름을 유지할 수 있는 QNN 아키텍처를 개발하기 위해.
  • 현실적으로 구현하기 어려운 2-디자인 가정에 의존하지 않고도 훈련 가능성에 대한 이론적 보장을 제공하기 위해.
  • CL-QNNs가 분류 및 기저 상태 탐색 과제에서 무작위 및 하드웨어 효율적 QNN보다 우수한 성능을 보임을 경험적으로 입증하기 위해.

제안 방법

  • 인접한 큐비트 간에 제어된 얽힘 게이트를 갖는 블록으로 구성된 제어층(CL) 아키텍처를 제안하며, 여기서 양자 회로는 매개변수화된 회로 블록으로 구성된다.
  • 회전각 매개변수 공간에서 기울기 행동을 분석하고, 큐비트 수와 깊이에 관계없이 기울기 노름의 하한을 유도한다.
  • 트레이스 부등식과 유니터리 분해를 기반으로 한 엄밀한 분석 프레임워크를 사용하여 기울기 노름의 하한이 Ω(8^{-LS})임을 증명한다.
  • 오직 CL-QNNs만 수렴하고, 무작위 및 하드웨어 효율적 QNNs는 기울기 소실로 인해 실패하는 구체적인 예를 제시한다.
  • 13 큐비트의 CL-QNNs를 구현하고, 와인 데이터셋을 사용한 이진 분류 과제에서 HE-QNNs 및 무작위 QNNs와 성능을 비교한다.
  • 200회 반복 동안 유한 샘플링(100회 측정, 배치 크기 8)을 사용한 확률적 경사 하강법과 Adam 최적화기를 적용하여 훈련 가능성 평가를 수행한다.

실험 결과

연구 질문

  • RQ1무작위 회로에서 기울기가 지수적으로 감소하는 상황에서도 깊이 있는 QNNs를 훈련 가능하게 만들 수 있는가?
  • RQ2제어층 아키텍처가 큐비트 수와 회로 깊이에 관계없이 비영인 기울기 노름 하한을 보장하는가?
  • RQ32-디자인 가정에 의존하지 않고도 훈련 가능성에 대한 이론적 보장을 확립할 수 있는가?
  • RQ4실제 훈련 환경에서 CL-QNNs가 무작위 및 하드웨어 효율적 QNNs를 능가하는가?
  • RQ5CL-QNNs와 기준 아키텍처 간의 기울기 노름과 수렴 행동은 경험적으로 어떻게 나타나는가?

주요 결과

  • CL-QNNs의 기대 기울기 노름은 Ω(8^{-LS})로 하한이 보장되며, 여기서 L은 CL 블록 수이고 S는 관측값에 포함된 큐비트 수이다. 이는 깊이 또는 큐비트 수에 관계없이 훈련 가능성을 보장한다.
  • CL-QNNs는 훈련 중 기울기 노름이 0.5 이상을 유지하는 반면, 무작위 및 HE-QNNs는 초기 기울기 노름이 현저히 작다.
  • 이진 분류 과제에서 CL-QNNs는 훈련 손실과 검증 오차 모두 명확한 수렴을 보이며, 반면 HE-QNNs와 무작위 QNNs는 높은 최종 손실 값으로 수렴하지 못한다.
  • 확률적 Adam 최적화기는 CL-QNNs에서 125회 반복 내에 수렴을 달성하지만, 동일한 최적화기는 HE-QNNs와 무작위 QNNs에서는 명확한 수렴을 보이지 않는다.
  • 경험적 결과는 CL-QNNs가 테스트된 아키텍처 중에서 유일하게 이징 모델 기저 상태 탐색과 와인 데이터셋 과제 모두에서 성공적으로 훈련된다는 것을 확인한다.
  • 이론적 프레임워크는 2-디자인 가정을 회피하여 이전 연구들보다 근접한 양자 하드웨어에 더 적용 가능성이 높다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.