Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement-Learning-Based Variational Quantum Circuits Optimization for Combinatorial Problems

Sami Khairy, Ruslan Shaydulin|arXiv (Cornell University)|2019. 11. 11.
Quantum Computing Algorithms and Architecture참고 문헌 18인용 수 12
한 줄 요약

이 논문은 조합 최적화 문제를 위한 양자 근사 최적화 알고리즘(QAOA) 회로에서 변분 매개변수를 최적화하기 위해 강화학습(RL)-기반 정책 네트워크를 제안한다. 소규모 그래프 인스턴스에서 학습한 후, 더 큰 미리보지 않은 인스턴스로 일반화한다. RL 정책은 Nelder-Mead와 같은 표준 옵티마이저보다 최적성 갭을 최대 8.61배까지 감소시켜, 더 적은 양자 회로 평가 수로도 훨씬 높은 해의 품질을 달성한다.

ABSTRACT

Quantum computing exploits basic quantum phenomena such as state superposition and entanglement to perform computations. The Quantum Approximate Optimization Algorithm (QAOA) is arguably one of the leading quantum algorithms that can outperform classical state-of-the-art methods in the near term. QAOA is a hybrid quantum-classical algorithm that combines a parameterized quantum state evolution with a classical optimization routine to approximately solve combinatorial problems. The quality of the solution obtained by QAOA within a fixed budget of calls to the quantum computer depends on the performance of the classical optimization routine used to optimize the variational parameters. In this work, we propose an approach based on reinforcement learning (RL) to train a policy network that can be used to quickly find high-quality variational parameters for unseen combinatorial problem instances. The RL agent is trained on small problem instances which can be simulated on a classical computer, yet the learned RL policy is generalizable and can be used to efficiently solve larger instances. Extensive simulations using the IBM Qiskit Aer quantum circuit simulator demonstrate that our trained RL policy can reduce the optimality gap by a factor up to 8.61 compared with other off-the-shelf optimizers tested.

연구 동기 및 목표

  • 근시일 내에 양자 우월성을 달성하는 데 제약가 되는 QAOA에서의 비효율적인 고전적 최적화 문제를 해결하기 위해.
  • QAOA 매개변수 최적화가 개별 인스턴스에 특화된 최적화 작업이 아니라 학습 문제로 재정의될 수 있는지 탐색하기 위해.
  • 소규모 문제 인스턴스에서 학습한 일반화 가능한 RL 정책을 개발하여 더 큰, 미리보지 않은 조합 그래프로 확장하기 위해.
  • QAOA에서 고급 품질의 해를 달성하기 위해 필요한 양자 회로 평가 횟수를 줄이기 위해.
  • 표준 비도함수 기반 옵티마이저인 Nelder-Mead와 같은 방법과 비교하여 학습된 RL 정책의 성능을 평가하기 위해.

제안 방법

  • RL 에이전트는 IBM Qiskit Aer 양자 회로 시뮬레이터를 사용하여 소규모 Max-Cut 문제 인스턴스(예: G_R(16,0.5))에서 훈련된다.
  • 정책 네트워크는 기대 에너지 f(β,γ) = ⟨ψ(β,γ)|H_C|ψ(β,γ)⟩를 최대화함으로써 QAOA 매개변수 β와 γ를 최적화하는 데 학습된다.
  • QAOA 회로는 믹서(H_M)와 비용(H_C) 해밀토니안가 번갈아가며 작동하는 매개변수화된 진화를 사용하며, 균일 초구성 상태에서 시작된다.
  • RL 환경은 현재 매개변수 집합(β,γ)을 상태 공간으로 정의하고, 정책 기반 기울기 기반의 작은 매개변수 갱신을 행동 공간으로 정의한다.
  • 성능 평가를 위해 랜덤, 커뮤니티, 래더 그래프를 포함한 더 큰 테스트 인스턴스(G_Test)에서 정책을 평가하며, 근사 비율과 최적성 갭을 측정한다.
  • 하이브리드 전략(RLNM)을 사용하여, B/2번의 평가 후 Nelder-Mead에서 가장 좋은 결과를 기반으로 RL을 계속 진행함으로써 수렴 속도를 향상시킨다.

실험 결과

연구 질문

  • RQ1소규모 QAOA 인스턴스에서 훈련된 강화학습 정책이 더 큰, 미리보지 않은 조합 문제 인스턴스를 최적화하는 데 일반화될 수 있는가?
  • RQ2표준 오프더셰프 옵티마이저와 비교했을 때, RL은 QAOA 매개변수 최적화에서 최적성 갭을 얼마나 줄일 수 있는가?
  • RQ3RL 정책은 비볼록 QAOA 비용 표면의 기하학적 규칙성을 활용하여 수렴 속도를 가속화하는가?
  • RQ4다양한 그래프 유형(랜덤, 커뮤니티, 래더)과 QAOA 회로 깊이에 따라 RL 정책의 성능은 어떻게 변화하는가?
  • RQ5RL과 고전적 옵티마이저(예: Nelder-Mead)를 조합하면 단독으로 사용할 경우보다 더 뛰어난 성능을 낼 수 있는가?

주요 결과

  • RL 정책는 다양한 그래프 하위군과 QAOA 깊이에서 Nelder-Mead 옵티마이저보다 최적성 갭을 최대 8.61배까지 감소시킨다.
  • p=1일 때, RL 정책의 중앙값 최적성 비율은 Nelder-Mead를 초월하며, 그래프 유형에 따라 1.16에서 8.61까지의 갭 감소 요인을 보인다.
  • RLNM 하이브리드 전략은 p=1,2,4일 때 중앙값 최적성 비율에서 뛰어난 성능을 기록한다.
  • RL 정책는 소규모 훈련 인스턴스(예: G_R(16,0.5))에서 학습한 후 더 큰 테스트 인스턴스(예: G_L(8), G_B(8), G_C(2,8))로 효과적으로 일반화되어 강력한 전이 성능를 보인다.
  • RL 정책는 평균 약 20회 반복 내에 고급 품질의 해를 달성하며, 비볼록 표면임에도 불구하고 빠르게 전역 최대값에 접근하는 경로를 보인다.
  • QAOA 깊이 p가 증가할수록 근사 비율이 향상되며, RL 정책는 모든 테스트된 깊이와 그래프 유형에서 일관된 성능 향상을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.