[논문 리뷰] Reinforcement Learning Assisted Recursive QAOA
이 논문은 깊이-1 RQAOA의 성능을 향상시키기 위해 강화학습을 통합한 RL-RQAOA를 제안한다. RQAOA의 변수 제거 과정을 강화학습 문제로 재구성함으로써, 최적의 제거 순서와 QAOA 파arameter를 학습하며, 어려운 이징 스핀 모델에 대해 표준 RQAOA보다 뛰어난 성능을 보이며, 더 쉬운 문제들에 대해서도 뛰어난 성능 유지를 한다.
Variational quantum algorithms such as the Quantum Approximation Optimization Algorithm (QAOA) in recent years have gained popularity as they provide the hope of using NISQ devices to tackle hard combinatorial optimization problems. It is, however, known that at low depth, certain locality constraints of QAOA limit its performance. To go beyond these limitations, a non-local variant of QAOA, namely recursive QAOA (RQAOA), was proposed to improve the quality of approximate solutions. The RQAOA has been studied comparatively less than QAOA, and it is less understood, for instance, for what family of instances it may fail to provide high quality solutions. However, as we are tackling $\mathsf{NP}$-hard problems (specifically, the Ising spin model), it is expected that RQAOA does fail, raising the question of designing even better quantum algorithms for combinatorial optimization. In this spirit, we identify and analyze cases where RQAOA fails and, based on this, propose a reinforcement learning enhanced RQAOA variant (RL-RQAOA) that improves upon RQAOA. We show that the performance of RL-RQAOA improves over RQAOA: RL-RQAOA is strictly better on these identified instances where RQAOA underperforms, and is similarly performing on instances where RQAOA is near-optimal. Our work exemplifies the potentially beneficial synergy between reinforcement learning and quantum (inspired) optimization in the design of new, even better heuristics for hard problems.
연구 동기 및 목표
- 깊이-1 재귀적 QAOA(RQAOA)가 이징 스핀 모델에서 실패하는 경우를 특정하고 분석한다. 특히 근사 비율이 0.95 이하로 떨어지는 경우를 대상으로 한다.
- 이러한 어려운 인스턴스에서 RQAOA가 실패하는 근본 원인을 분석한다. 주로 비최적의 변수 제거 순서와 QAOA 파arameter 선택에 초점을 맞춘다.
- 변수 제거 순서와 QAOA 파arameter를 동시에 최적화하는 하이브리드 양자-고전 알고리즘을 설계하여 RQAOA를 개선한다.
- 제안된 방법의 양자 우월성을 검증하기 위해, 양자 회로를 사용하지 않고 브루트포스 탐색을 모방하는 순수 고전적 강화학습 에이전트(RL-RONE)와 비교한다.
- RL-RQAOA의 양자 회로가 성능 향상에 기여하는 비중 있는 요소임을 입증한다. 즉, 고전적 시뮬레이션의 단순 대체물이 아니라 실제 기여를 한다.
제안 방법
- 깊이-1 RQAOA가 근사 비율 ≤ 0.95를 보이는 작은 스케일의 이징 문제 인스턴스(예: (3,12)-cage 그래프)를 식별한다.
- RQAOA의 변수 제거 단계를 강화학습(RL)의 의사결정 과정으로 재구성하며, 에이전트가 제거할 변수를 선택하도록 학습한다.
- RL-RQAOA에 양자 인spired 정책 네트워크를 도입하여 제거 과정에서 탐색과 이용의 균형을 유지한다.
- 정책 기반 강화학습 방법을 사용해 각 재귀 단계에서 QAOA 파arameter(각도)를 최적화하며, 에너지 최적 파arameter를 사용하지 않는다.
- RL-RQAOA를 표준 RQAOA 및 순수 고전적 RL 기반 기준(RL-RONE)과 비교한다. RL-RONE은 양자 회로를 사용하지 않으며 브루트포스 탐색을 시뮬레이션한다.
- 랜덤 가중치 d-정규 그래프(100 및 200 노드의 3-정규 그래프 포함)의 앙상블에 대해 고전적 시뮬레이션을 수행하여 다수의 실행에서 성능을 평가한다.
실험 결과
연구 질문
- RQ1깊이-1 RQAOA가 높은 품질의 해를 도출하지 못하는 이징 문제 인스턴스의 구조적 또는 조합적 특성은 무엇인가?
- RQ2RQAOA에서 변수 제거 순서의 선택이 최종 해 품질에 미치는 영향은 무엇이며, 이를 학습을 통해 최적화할 수 있는가?
- RQ3강화학습이 재귀적 QAOA에서 제거할 변수 선택과 QAOA 파arameter를 동시에 향상시켜 더 높은 근사 비율을 달성할 수 있는가?
- RQ4RL-RQAOA의 양자 회로가 성능 향상에 기여하는 정도는 어느 정도이며, 순수 고전적 RL에 비해 어떤가?
- RQ5하이브리드 양자-고전적 RL-RQAOA 알고리즘이 동일한 문제 인스턴스에서 순수 고전적 RL 에이전트보다 더 빠르게 수렴하고 더 나은 해에 도달하는가?
주요 결과
- RL-RQAOA는 (3,12)-cage 그래프를 포함한 모든 어려운 인스턴스에서 표준 RQAOA를 일관되게 능가한다. 특히 RQAOA가 최적 해에 도달하지 못하는 경우에도 성능이 뛰어나다.
- 15회의 독립 실행 평균에서, RL-RQAOA는 어려운 인스턴스에서 RQAOA보다 더 높은 최고 근사 비율을 기록하며 통계적으로 유의미한 향상을 보였다.
- RL-RQAOA의 학습 곡선은 QAOA 파arameter가 무작위로 초기화된 경우에도 순수 고전적 RL-RONE 에이전트보다 더 빠른 수렴과 더 나은 최종 성능를 보였다.
- RL-RQAOA의 양자 회로는 성능 향상에 비중 있는 기여를 하며, 양자 자원을 갖지 않은 고전적 RL-RONE 에이전트보다 뚜렷한 성능 우위를 보였다.
- RL-RQAOA는 쉬운 인스턴스에서도 뛰어난 성능을 유지하며, RQAOA의 거의 최적의 결과를 그대로 재현하여 문제 난이도 전반에 걸친 강건성을 입증했다.
- 제안된 방법은 깊이-1 RQAOA를 초월해 더 높은 회로 깊이로도 확장 가능하며, NISQ 시대 최적화에 광범위하게 적용 가능할 것으로 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.