Skip to main content
QUICK REVIEW

[논문 리뷰] A quantum algorithm for training wide and deep classical neural networks

Alexander Zlokapa, Hartmut Neven|arXiv (Cornell University)|2021. 07. 19.
Quantum Computing Algorithms and Architecture참고 문헌 4인용 수 12
한 줄 요약

이 논문은 신경장점핵(kernel, NTK) 형식론을 활용하고 양자 선형계를 해결하는(Qualitative Linear System Algorithm, QLSA) 방식을 통해 넓고 깊은 고전적 신경망의 학습 시간을 다항로그 시간으로 줄이는 양자 알고리즘을 제안한다. 데이터가 효율적인 상태 준비와 읽기 가능성을 허용할 경우(예: MNIST에서 보여진 바와 같이), 고전적 경사 하강법보다 지수적 속도 향상을 달성하며, 풀링을 포함한 컨볼루션 신경망에 대한 수치적 증거를 통해 그 유효성을 입증한다.

ABSTRACT

Given the success of deep learning in classical machine learning, quantum algorithms for traditional neural network architectures may provide one of the most promising settings for quantum machine learning. Considering a fully-connected feedforward neural network, we show that conditions amenable to classical trainability via gradient descent coincide with those necessary for efficiently solving quantum linear systems. We propose a quantum algorithm to approximately train a wide and deep neural network up to $O(1/n)$ error for a training set of size $n$ by performing sparse matrix inversion in $O(\log n)$ time. To achieve an end-to-end exponential speedup over gradient descent, the data distribution must permit efficient state preparation and readout. We numerically demonstrate that the MNIST image dataset satisfies such conditions; moreover, the quantum algorithm matches the accuracy of the fully-connected network. Beyond the proven architecture, we provide empirical evidence for $O(\log n)$ training of a convolutional neural network with pooling.

연구 동기 및 목표

  • 표준 신경망 아키텍처에 대한 양자 속도 향상을 가능하게 하여 양자 머신러닝과 고전적 딥 러닝을 연결하고자 한다.
  • 양자 알고리즘이 넓고 깊은 신경망 학습에서 고전적 경사 하강법을 능가할 수 있는 조건을 규명하고자 한다.
  • 데이터 분포가 효율적인 상태 준비와 읽기 가능성을 허용할 경우(예: MNIST 데이터셋에서와 같이), 효율적인 양자 학습이 가능함을 입증하고자 한다.
  • NTK 프레임워크를 활용하여 완전히 연결된 네트워크에서의 이론적 결과를 풀링 레이어를 포함한 컨볼루션 네트워크로 확장하고자 한다.
  • 양자 알고리즘이 다항식 이하의 실행 시간 스케일링을 유지하면서도 고전적 학습과 비교해 유사한 정확도를 유지함을 경험적으로 입증하고자 한다.

제안 방법

  • 넓고 깊은 신경망의 학습을 신경장점핵(NTK)을 통해 선형방정식의 해로 형식화하며, 출력은 $ \mathbf{k}_*^T K^{-1} \mathbf{y} $ 로 주어진다.
  • NTK 행렬 $ K $ 의 역행렬을 $ O(\log n) $ 시간 내에 해결하기 위해 양자 선형계 알고리즘(QLSA)을 적용하며, 이는 $ K $ 가 희소하고 잘 조절된 조건을 만족할 경우를 전제로 한다.
  • 행렬 크기를 줄이면서도 조건수를 유지하기 위해 $ s = O(\log n) $ 의 희소성 패턴을 사용하며, 고레스코르딘 원판 정리(Gershgorin circle theorem)를 활용해 고유값의 변동을 제한한다.
  • NTK를 사전 조정(preconditioning)하여 비대각 성분을 $ O((\log n)^{9/10}) $ 정도의 요소로 억제함으로써, 크기가 증가하더라도 조건수가 유한하게 유지됨을 보장한다.
  • 성능에 미치는 영향을 최소화하면서 복잡도를 증가시키지 않기 위해, 소량의 훈련 데이터로부터 유도된 고정된 희소성 패턴을 사용해 중요한 NTK 요소를 선택한다.
  • 효율적인 양자 상태 준비 및 측정 프로토콜을 통합하여, 후속 선택(post-selection) 및 읽기 비용을 $ O(\log n) $ 으로 유지함으로써, 종단 간 다항로그 실행 시간을 달성한다.

실험 결과

연구 질문

  • RQ1넓고 깊은 고전적 신경망 학습에서 양자 알고리즘이 고전적 경사 하강법보다 지수적 속도 향상을 달성할 수 있는가?
  • RQ2데이터 분포의 어떤 조건에서 효율적인 양자 학습이 가능해지며, 특히 상태 준비 및 읽기 가능성을 포함한 조건은 무엇인가?
  • RQ3신경장점핵(NTK) 형식론이 완전히 연결된 네트워크를 넘어서, 풀링 레이어를 포함한 컨볼루션 네트워크에서도 양자 속도 향상을 가능하게 하는가?
  • RQ4NTK 행렬의 조건수는 이 맥락에서 양자 선형계 해결의 가능성과 효율성에 어떤 영향을 미치는가?
  • RQ5NTK 행렬의 희소화가 일반화 성능을 유지하면서도, MNIST와 같은 실제 데이터셋에서 다항로그 실행 시간을 달성할 수 있는가?

주요 결과

  • 효율적인 상태 준비 및 읽기 가능성을 전제로 할 경우, 넓고 깊은 완전히 연결된 신경망 학습에 대해 양자 알고리즘이 $ O(\log n) $ 실행 시간을 달성하며, 크기가 $ n $ 인 훈련 세트에서 $ O(1/n) $ 오차를 보인다.
  • 수치 실험을 통해 MNIST 데이터셋이 효율적인 상태 준비 및 읽기 가능성을 충족함을 확인하였으며, 이는 다항로그 실행 시간과 고전적 정확도를 달성할 수 있음을 뜻한다.
  • 훈련 세트 크기가 증가함에 따라 NTK 행렬의 조건수는 $ O(\log n) $ 이내로 유한하게 유지되며, 이는 효율적인 양자 선형계 해결을 뒷받침한다.
  • 풀링 레이어를 포함한 컨볼루션 신경망의 경우, NTK는 깊이가 증가함에 따라 조건수가 일정 수준에 수렴하며 잘 조절된 상태를 유지함으로써 유사한 양자 속도 향상을 가능하게 한다.
  • 소량의 데이터로부터 유도된 고정된 패턴을 사용한 NTK 행렬의 희소화는 분류 성능을 유지하면서도 $ O\left(\log n\right) $ 수준의 조건수와 실행 시간을 유지한다.
  • 희소화, 비대각 성분 억제를 통한 사전 조정, 그리고 효율적인 측정의 조합으로 전체 양자 실행 시간이 $ n $ 에 대해 다항로그로 유지되며, 이는 고전적 경사 하강법에 비해 지수적 속도 향상을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.