Skip to main content
QUICK REVIEW

[논문 리뷰] Quantum Observables for continuous control of the Quantum Approximate Optimization Algorithm via Reinforcement Learning

Artur García-Sáez, Jordi Riu|arXiv (Cornell University)|2019. 11. 21.
Quantum Computing Algorithms and Architecture참고 문헌 2인용 수 14
한 줄 요약

이 논문은 QAOA를 마르코프 결정 과정으로 간주하고, 고전적 에이전트가 양자 측정 결과를 관측으로 삼아 연속적인 파rameter (γ, β)를 제어함으로써 양자 약화 최적화 알고리즘(QAOA)을 최적화하는 연속 강화학습(RL) 프레임워크를 제안한다. 이 방법은 회로 깊이가 증가함에 따라 안정적인 학습을 가능하게 하며, N=21에 대해 p=25까지의 깊이에서 최적 또는 근사 최적의 MAXCUT 해를 달성한다. 이는 짧은 에피소드에서의 지식을 재사용함으로써 달성된다.

ABSTRACT

We present a classical control mechanism for Quantum devices using Reinforcement Learning. Our strategy is applied to the Quantum Approximate Optimization Algorithm (QAOA) in order to optimize an objective function that encodes a solution to a hard combinatorial problem. This method provides optimal control of the Quantum device following a reformulation of QAOA as an environment where an autonomous classical agent interacts and performs actions to achieve higher rewards. This formulation allows a hybrid classical-Quantum device to train itself from previous executions using a continuous formulation of deep Q-learning to control the continuous degrees of freedom of QAOA. Our approach makes a selective use of Quantum measurements to complete the observations of the Quantum state available to the agent. We run tests of this approach on MAXCUT instances of size up to N = 21 obtaining optimal results. We show how this formulation can be used to transfer the knowledge from shorter training episodes to reach a regime of longer executions where QAOA delivers higher results.

연구 동기 및 목표

  • 노이즈와 제한된 코herence 시간 등 NISQ 시대의 제약 조건 하에서 QAOA 파rameter를 효율적으로 최적화하는 데 도전한다.
  • 고깊이 QAOA 회로에서 전역 최적화기의 한계를 극복하기 위해 확장 가능하고 점진적인 학습을 가능하게 한다.
  • 단순히 목적 함수 값 외에도 풍부한 관측 자료로 활용 가능한 양자 측정 결과를 활용하여 강화학습 에이전트의 정책 학습을 향상시킨다.
  • 짧은 학습 에피소드에서의 지식을 더 깊은 QAOA 회로로 전이할 수 있음을 입증한다.
  • 기존 방법이 실패하는 대규모 회로 깊이(p > 20)에서도 QAOA의 안정적 최적화를 가능하게 한다.

제안 방법

  • 에이전트가 QAOA 회로의 변량 파rameter (γ, β)를 제어하는 연속 행동 강화학습 환경으로 QAOA를 재구성한다.
  • 딥 Q러닝을 사용하여 연속 행동 공간(예: DDPG 또는 NAF 기반 알고리즘)을 활용해 양자 장치의 최적 제어 정책을 학습한다.
  • 목적 함수 값(예: MAXCUT의 기대 컷 크기)을 기반으로 보상 함수를 설계하고, 학습 안정성을 향상시키기 위해 지연 보상을 적용한다.
  • 상태 정보를 추출하기 위해 선택적 양자 측정을 사용하여 고전적 목적 함수 값 외에도 관측 자료를 풍부하게 한다.
  • 점진적 학습을 구현: 짧은 깊이(p)에서의 정책을 재사용하여 더 깊은 깊이(p′ > p)에서의 학습을 초기화함으로써, 큰 p에서의 안정적 수렴을 가능하게 한다.
  • 관측 빈도를 줄이고 장기적 제어를 지원하기 위해 단계 간의 과거 파rameter {γ, β}를 고전적 메모리에 유지한다.

실험 결과

연구 질문

  • RQ1전역 최적화에 의존하지 않고도 연속 강화학습이 증가하는 회로 깊이(p)에서 QAOA 파arameter를 효과적으로 최적화할 수 있는가?
  • RQ2목적 함수 값 외에 양자 측정 결과를 관측 자료로 사용할 경우, 고전적 목적 함수 값만 사용할 때보다 강화학습 에이전트의 성능이 어떻게 향상되는가?
  • RQ3예를 들어 p=10에서의 학습에서의 지식을 성공적으로 전이하여 p=25와 같은 더 깊은 회로에서의 안정적 학습을 가능하게 할 수 있는가?
  • RQ4N=21까지의 MAXCUT 문제에서 RL 기반 QAOA 최적화의 성능 상한선은 무엇이며, 최적 해에 도달하는가?
  • RQ5지연 보상 및 선택적 측정 전략은 깊은 QAOA 회로에서의 학습 안정성과 수렴에 어떤 영향을 미치는가?

주요 결과

  • 에이전트는 N=21까지의 문제 인스턴스에서 최적 또는 근사 최적의 MAXCUT 결과를 달성하였으며, 보상 값이 전역 최적값과 일치하였다.
  • 이 방법은 전역 최적화기가 계산적으로 비가능한 영역이 되는 p=25까지의 회로 깊이에서 에이전트를 성공적으로 학습시켰다.
  • p=10에서 p=25로의 점진적 학습은 안정적인 수렴을 가능하게 하였으며, 각 깊이 전이 단계에서 보상 값이 점차 향상되었다.
  • 양자 측정 데이터를 관측 자료로 사용함으로써 학습 효율성이 크게 향상되었으며, 더 빠른 수렴과 더 나은 정책 일반화를 가능하게 하였다.
  • 에이전트의 정책은 깊이 간에 일반화되었으며, 짧은 에피소드에서의 지식을 더 긴 에피소드로 전이함으로써 큰 p에서의 냉시작 필요성을 줄였다.
  • 지연 보상 및 선택적 측정 전략은 특히 고깊이 영역에서 수치적 안정성에 기여하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.