Skip to main content
QUICK REVIEW

[논문 리뷰] Exponentially Many Local Minima in Quantum Neural Networks

Xuchen You, Xiaodi Wu|arXiv (Cornell University)|2021. 10. 06.
Quantum Computing Algorithms and Architecture인용 수 4
한 줄 요약

이 논문은 과소파ram터화된 양자 신경망(QNNs)이 양자 간섭으로 인해 손실 경로상에서 지수적으로 많은 가짜 국소 최솟값을 가질 수 있음을 보여준다. 이는 고전적 네트워크에서의 비선형 활성화 함수 때문이 아니라, 양자 간섭 때문임을 시사한다. 저자들은 구성적 접근을 통해 p개의 파ram터를 가진 QNN 예시에서 손실 함수에 2^Ω(p)개의 국소 최솟값이 존재함을 증명하였고, 표준 최적화 알고리즘들이 이를 벗어나는 데 어려움을 겪는 것으로 실증적으로 검증하였다. 이는 근접한 양자 기반 기계학습에서의 근본적인 학습 과제를 드러낸다.

ABSTRACT

Quantum Neural Networks (QNNs), or the so-called variational quantum circuits, are important quantum applications both because of their similar promises as classical neural networks and because of the feasibility of their implementation on near-term intermediate-size noisy quantum machines (NISQ). However, the training task of QNNs is challenging and much less understood. We conduct a quantitative investigation on the landscape of loss functions of QNNs and identify a class of simple yet extremely hard QNN instances for training. Specifically, we show for typical under-parameterized QNNs, there exists a dataset that induces a loss function with the number of spurious local minima depending exponentially on the number of parameters. Moreover, we show the optimality of our construction by providing an almost matching upper bound on such dependence. While local minima in classical neural networks are due to non-linear activations, in quantum neural networks local minima appear as a result of the quantum interference phenomenon. Finally, we empirically confirm that our constructions can indeed be hard instances in practice with typical gradient-based optimizers, which demonstrates the practical value of our findings.

연구 동기 및 목표

  • 양자 신경망(QNNs)의 손실 경로를 조사하고, 학습 과정에서의 국소 최솟값의 성격과 수를 이해하기 위해.
  • 특히 과소파ram터화된 설정에서 QNNs의 국소 최솟값이 유익한지 또는 가짜인지 판단하기 위해.
  • QNNs에서 국소 최솟값의 근본 원인을 규명하고, 고전적 신경망과의 차이를 명확히 하기 위해.
  • 지수적으로 많은 국소 최솟값을 가진 명시적 QNN 예시를 구성하고, 그 어려움을 실증적으로 검증하기 위해.
  • 이러한 QNNs에서 가능한 국소 최솟값의 최대 수에 대한 이론적 한계를 제시하기 위해.

제안 방법

  • 두 층의 XY-에코더와 파라미터화된 유니터리 게이트를 사용하여 단순하지만 어려운 QNN 예시의 가족을 구성하기 위해.
  • 양자 간섭 효과를 통해 손실 함수에 지수적으로 많은 국소 최솟값을 유도하는 데이터셋을 설계하기 위해.
  • p개의 파라미터에 대해 국소 최솟값의 수가 적어도 2^Ω(p)임을 증명하기 위해 양자 회로 대칭성과 간섭을 활용하기 위해.
  • 국소 최솟값 수에 대한 거의 매칭되는 상한을 확립하여, 구성이 거의 최적임을 보여주기 위해.
  • 랜덤 초기화된 파라미터에서 경사 기반 최적화 알고리즘(RMSProp 등)을 사용하여 전역 최솟값과 국소 최솟값으로의 수렴을 실증적으로 평가하기 위해.
  • 라벨에 가우시안 노이즈를 도입하고, 국소 최솟값의 강건성과 전역 최적해를 찾는 데 성공률을 측정하기 위해.

실험 결과

연구 질문

  • RQ1과소파라미터화된 QNNs는 손실 경로상에서 지수적으로 많은 국소 최솟값을 가질 수 있는가?
  • RQ2QNNs의 국소 최솟값의 근원은 무엇인가—양자 간섭인가, 비선형성인가?
  • RQ3라벨 노이즈나 측정 오차와 같은 편향에 대해 이러한 국소 최솟값은 강건한가?
  • RQ4표준 경사 기반 최적화 알고리즘이 이러한 어려운 사례에서 전역 최솟값을 신뢰성 있게 찾을 수 있는가?
  • RQ5QNNs에서 국소 최솟값의 수는 파라미터 수에 따라 어떻게 증가하는가?

주요 결과

  • 일반적인 과소파라미터화된 QNNs의 손실 함수에서 가짜 국소 최솟값의 수는 파라미터 수에 따라 지수적으로 증가할 수 있으며, 구체적으로 p개의 파라미터에 대해 적어도 2^Ω(p)개의 국소 최솟값이 존재한다.
  • QNNs의 국소 최솟값은 고전적 신경망에서의 비선형 활성화 함수와는 달리, 양자 간섭으로 인해 발생한다.
  • 제시된 QNN 예시는 거의 최적임을 보여주며, 상한과 하한이 지수적 요소를 제외한 하위지수적 요소에서 거의 일치한다.
  • 실증 결과에 따르면, RMSProp과 같은 표준 경사 기반 최적화 알고리즘은 파라미터 수가 증가함에 따라 전역 최솟값을 찾는 성공률이 지수적으로 감소하는 경향을 보인다.
  • 손실 함수의 ℓ∞-노름에서 유한한 편차가 유지되는 한, 국소 최솟값은 가우시안 라벨 노이즈, 양자 노이즈, 유한한 측정 오차에 대해 강건하다.
  • 자연스럽고 선형적으로 분리 가능한 데이터셋에서도 파라미터 수가 증가함에 따라 국소 최솟값의 수가 크게 증가하고, 전역 최솟값을 찾는 데 성공률이 급격히 감소한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.