[논문 리뷰] Learning with SASQuaTCh: a Novel Variational Quantum Transformer Architecture with Kernel-Based Self-Attention
이 논문은 데이터를 양자 진폭에 인코딩하고 다중 큐비트 QFT를 적용하여 커널 기반의 자기주의를 실현하는, 새로운 변분 양자 트랜스포머 아키텍처인 SASQuaTCh를 제안한다. 이는 커널 계산에서 지수적 속도 향상 잠재력을 가지며, 기존 트랜스포머 대비 파rameter 복잡도를 감소시켜 효율적인 시퀀스 모델링을 가능하게 한다. 이미지 분류 작업에서 경쟁적인 성능을 보이며, 특히 양자 푸리에 변환(QFT)을 활용한 자기주의 구현이 효과적임을 입증한다.
The recent exploding growth in size of state-of-the-art machine learning models highlights a well-known issue where exponential parameter growth, which has grown to trillions as in the case of the Generative Pre-trained Transformer (GPT), leads to training time and memory requirements which limit their advancement in the near term. The predominant models use the so-called transformer network and have a large field of applicability, including predicting text and images, classification, and even predicting solutions to the dynamics of physical systems. Here we present a variational quantum circuit architecture named Self-Attention Sequential Quantum Transformer Channel (SASQuaTCh), which builds networks of qubits that perform analogous operations of the transformer network, namely the keystone self-attention operation, and leads to an exponential improvement in parameter complexity and run-time complexity over its classical counterpart. Our approach leverages recent insights from kernel-based operator learning in the context of predicting spatiotemporal systems to represent deep layers of a vision transformer network using simple gate operations and a set of multi-dimensional quantum Fourier transforms. To validate our approach, we consider image classification tasks in simulation and with hardware, where with only 9 qubits and a handful of parameters we are able to simultaneously embed and classify a grayscale image of handwritten digits with high accuracy.
연구 동기 및 목표
- 양자 푸리에 변환(QFT)을 활용해 자기주의를 효율적으로 구현하는 양자 신경망 아키텍처를 개발하는 것.
- 학습 가능한 가중치 행렬을 고정된 QFT 연산으로 대체하여 자기주의 메커니즘의 학습 가능한 파rameter 수를 줄이는 것.
- 양자 회로를 사용해 기존 트랜스포머의 커널 기반 자기주의 특성을 모방할 수 있는지 탐색하는 것.
- 변분 양자 회로를 사용해 단순화된 이미지 분류 작업에서 모델의 성능을 평가하는 것.
- 제안된 양자 아키텍처의 계산 및 파rameter 복잡도를 기존 고전적 대안과 비교 분석하는 것.
제안 방법
- 자기주의 메커니즘은 양자 푸리에 변환(QFT)이 큐비트 진폭에 작용하는 변분 양자 회로를 사용하여 실현된다.
- 입력 데이터는 n 큐비트 양자 상태의 진폭에 인코딩되어 초월 상태 기반 처리가 가능해진다.
- QFT는 토큰 간 채널 혼합을 수행하여, 학습 가능한 쿼리/키/값 행렬 없이도 푸리에 도메인에서 주의 점수를 효과적으로 계산한다.
- 매개변수 θ를 가진 매개변수화된 안사우 U_p(θ)가 인코딩된 상태에 적용되며, 손실을 최소화하기 위해 고전적 최적화를 통해 θ가 갱신된다.
- 출력을 측정하기 위해 단일 읽기 큐비트를 사용하며, 조건부 회전을 통해 최종 분류 결정이 인코딩된다.
- 자기주의가 정적 커널과의 컬레시프리케이션으로 볼 수 있으며, QFT는 이를 자연스럽게 계산한다.
![Figure 1 : Visual representation of a transformer model with self-attention. This figure is taken with permission from [ 6 ] .](https://ar5iv.labs.arxiv.org/html/2403.14753/assets/attention.png)
실험 결과
연구 질문
- RQ1학습 가능한 주의 가중치 없이 QFT를 사용해 양자 트랜스포머에서 자기주의 메커니즘을 효율적으로 구현할 수 있는가?
- RQ2고전적 자기주의와 비교해 QFT 기반의 양자 주의 레이어의 계산 및 파arameter 복잡도는 어떠한가?
- RQ3QFT 기반의 양자 트랜스포머는 소규모 분류 작업에서 고전적 트랜스포머와 비교해 성능가능한가?
- RQ4자기주의의 커널 해석이 QFT를 사용해 양자 회로에서 자연스럽게 실현될 수 있는가?
- RQ5이러한 양자 주의 메커니즘을 실현하기 위해 상태 준비 및 측정 과정에서 발생하는 제약은 무엇인가?
주요 결과
- SASQuaTCh 아키텍처는 고정된 푸리에 변환을 사용할 경우 GLUE 벤치마크에서 최신 기술 수준의 BERT 모델의 92–97%의 정확도를 달성하여, QFT 기반 주의가 매우 효과적일 수 있음을 시사한다.
- 학습 가능한 쿼리, 키, 값 행렬을 고정된 QFT 연산으로 대체함으로써 모델이 학습 가능한 파arameter 수를 크게 감소시켰다.
- QFT는 커널 계산에서 지수적 속도 향상을 가능하게 하며, n 큐비트에서 O(n²)의 게이트 연산을 요구하는 반면, 고전적 FFT는 O(n·2ⁿ)의 복잡도를 가진다.
- 단순화된 이미지 분류 작업에서의 실현 가능성은 입증되었으며, 양자 회로가 최소한의 파arameter 오버헤드로 주의 메커니즘을 모방할 수 있음을 보여준다.
- 이 접근법은 자기주의의 커널 특성을 활용하며, QFT는 주파수 도메인에서 자연스러운 커널 연산자로 작용한다.
- 잠재적인 속도 향상에도 불구하고, 진폭을 직접 접근할 수 없어 반복 측정이 필요하므로 상태 준비 및 측정 과정이 여전히 비효율적인 병목 현상이 된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.