[논문 리뷰] Noise-Robust End-to-End Quantum Control using Deep Autoregressive Policy Networks
이 논문은 깊이 있는 자동회귀 정책 네트워크를 사용하여 연속적인 게이트 지속시간과 이산적인 유니터리 시퀀스를 동시에 최적화하는 노이즈에 강건한 엔드 투 엔드 양자 제어 프레임워크인 RL-QAOA를 제안한다. 연속적이고 이산적인 행동 공간을 동시에 다루는 개선된 프록실 풍부 정책 최적화(Proximal Policy Optimization, PPO) 알고리즘을 통해, 비가역적 양자 이징 모델의 기본 상태를 고전적 노이즈와 양자 노이즈 하에서 더 뛰어난 성능으로 준비하며, 기존의 PG-QAOA 및 CD-QAOA 접근 방식을 여러 노이즈 모델에서 모두 능가한다.
Variational quantum eigensolvers have recently received increased attention, as they enable the use of quantum computing devices to find solutions to complex problems, such as the ground energy and ground state of strongly-correlated quantum many-body systems. In many applications, it is the optimization of both continuous and discrete parameters that poses a formidable challenge. Using reinforcement learning (RL), we present a hybrid policy gradient algorithm capable of simultaneously optimizing continuous and discrete degrees of freedom in an uncertainty-resilient way. The hybrid policy is modeled by a deep autoregressive neural network to capture causality. We employ the algorithm to prepare the ground state of the nonintegrable quantum Ising model in a unitary process, parametrized by a generalized quantum approximate optimization ansatz: the RL agent solves the discrete combinatorial problem of constructing the optimal sequences of unitaries out of a predefined set and, at the same time, it optimizes the continuous durations for which these unitaries are applied. We demonstrate the noise-robust features of the agent by considering three sources of uncertainty: classical and quantum measurement noise, and errors in the control unitary durations. Our work exhibits the beneficial synergy between reinforcement learning and quantum control.
연구 동기 및 목표
- 양자 제어 프로토콜에서 연속적이고 이산적인 파rameter를 동시에 최적화할 수 있는 통합 강화학습 프레임워크를 개발하는 것.
- NISQ 장치에서 흔히 발생하는 고전적 측정 노이즈, 양자 측정 노이즈, 게이트 지속시간 오류 등의 다양한 노이즈 원천에 대한 강건성을 향상시키는 것.
- 기존 QAOA 기반 방법을 확장하여, 하나의 미분 가능한 정책 내에서 유니터리 시퀀스 순서와 게이트 지속시간을 엔드 투 엔드로 최적화할 수 있도록 하는 것.
- 실제 노이즈 조건 하에서 비가역적 양자 이징 사슬의 기본 상태를 준비하는 데서 제안된 방법의 유효성을 입증하는 것.
제안 방법
- 순차적 양자 제어 프로토콜에서 행동 간의 인과적 의존성을 포착하는 하이브리드 정책을 모델링하기 위해 깊이 있는 자동회귀 신경망을 사용한다.
- 연속적 및 이산적 행동 공간을 동시에 다룰 수 있도록 수정된 Proximal Policy Optimization (PPO) 알고리즘을 사용하여 정책을 훈련시킨다.
- 유한한 범위 내에서 게이트 지속시간을 보장하기 위해 연속적 행동은 유계 베타 분포로 매개변수화한다.
- 이산적 행동은 사전 정의된 유니터리 집합에서 선택된 것을 의미하며, 시퀀스 순서는 엔드 투 엔드로 최적화된다.
- 알고리즘은 가변적인 유니터리 연산 시퀀스와 최적화된 지속시간을 허용하는 일반화된 QAOA 안사트에 적용된다.
- 세 가지 불확실성 모델 하에서 노이즈에 대한 강건성을 평가한다: 고전적 측정 노이즈, 양자 측정 노이즈, 게이트 지속시간의 확률적 오류.
실험 결과
연구 질문
- RQ1단일 강화학습 에이전트가 양자 제어에서 연속적인 게이트 지속시간과 이산적인 유니터리 시퀀스를 효과적으로 동시에 최적화할 수 있는가?
- RQ2제안된 하이브리드 정책 네트워크는 NISQ 장치에서 흔히 발생하는 실제 노이즈 원천에서 어떻게 성능을 발휘하는가?
- RQ3정책의 자동회귀 구조가 양자 제어에서 더 나은 인과성 모델링과 향상된 수렴을 가능하게 하는가?
- RQ4노이즈 하에서 PG-QAOA 및 CD-QAOA와 비교해 RL-QAOA의 강건성과 성능은 어떻게 다른가?
- RQ5아키텍처 재설계 없이도 가변 길이 제어 시퀀스에 일반화될 수 있는가?
주요 결과
- RL-QAOA는 비가역적 양자 이징 모델의 기본 상태를 고도로 비아디아바틱 영역에서 성공적으로 준비하며, 모든 테스트된 노이즈 모델에서 PG-QAOA 및 CD-QAOA를 능가한다.
- 메커니즘에 관계없이 노이즈에 대한 무지성 강건성(agnostic noise robustness)을 보이며, 고전적 또는 양자 측정 노이즈, 게이트 지속시간 오류 등 물리적 노이즈 원천에 관계없이 높은 성능 유지를 유지한다.
- 깊이 있는 자동회귀 정책 네트워크는 시간적 인과성을 효과적으로 모델링하여 순차적 양자 제어 프로토콜의 안정적이고 효율적인 최적화를 가능하게 한다.
- 하이브리드 PPO 기반 훈련 프레임워크는 연속적 및 이산적 행동 공간이 동시에 존재하는 환경에서도 안정적인 학습을 가능하게 하여, 기존 기울기 기반 최적화기의 노이즈 환경에서의 한계를 극복한다.
- 총 프로토콜 지속시간이 고정되어 있지 않은 경우에도 알고리즘이 효과적으로 작동한다. '정지' 행동을 포함함으로써 가변 길이의 시퀀스가 가능하기 때문이다.
- 수치 시뮬레이션 결과, 모든 고려된 노이즈 조건 하에서 기준 방법보다 높은 기본 상태 허용도를 달성함을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.