Skip to main content
QUICK REVIEW

[논문 리뷰] Automated quantum programming via reinforcement learning for combinatorial optimization

Keri A. McKiernan, Erik Davis|arXiv (Cornell University)|2019. 08. 21.
Quantum Computing Algorithms and Architecture참고 문헌 1인용 수 13
한 줄 요약

이 논문은 시뮬레이션된 및 실제 게이트 기반 양자 컴퓨터에서 조합 최적화 문제를 해결하기 위한 자동화된 양자 프로그래밍을 위한 강화 학습 프레임워크를 제안한다. Proximal Policy Optimization (PPO)를 사용하여 에이전트는 짧고 고성능의 양자 회로를 학습 생성하며, 미학습된 에이전트와 p=1 QAOA를 능가함으로써 문제 인스턴스 간 및 시뮬레이션과 실제 하드웨어 간의 일반화 성능을 입증한다.

ABSTRACT

We develop a general method for incentive-based programming of hybrid quantum-classical computing systems using reinforcement learning, and apply this to solve combinatorial optimization problems on both simulated and real gate-based quantum computers. Relative to a set of randomly generated problem instances, agents trained through reinforcement learning techniques are capable of producing short quantum programs which generate high quality solutions on both types of quantum resources. We observe generalization to problems outside of the training set, as well as generalization from the simulated quantum resource to the physical quantum resource.

연구 동기 및 목표

  • 하이브리드 양자-클래식 시스템에서 자동화된 양자 프로그래밍을 위한 일반적인 강화 학습 프레임워크를 개발하기 위해.
  • 노이즈와 제한된 큐비트 협응 시간으로 인해 직관적이지 않고 오류가 쉽게 발생하는 근접 양자 하드웨어 프로그래밍의 과제를 해결하기 위해.
  • 에이전트가 조합 최적화 문제(COPs)에 대해 고성능 솔루션을 생성하는 컴act한 양자 회로를 생성할 수 있도록 하기 위해.
  • 학습된 에이전트의 일반화 능력을 새로운 문제 인스턴스와 시뮬레이션 및 실제 양자 자원 간에 평가하기 위해.
  • 기존의 히ュ리스틱 방법(예: QAOA)을 초월해 강화 학습의 확장성과 이식 가능성에 대해 탐색하기 위해.

제안 방법

  • OpenAI Gym의 API를 사용하여 양자 프로그램 합성용 강화 학습 환경을 정형화하며, 상태 공간, 행동 공간, 보상 함수를 정의한다.
  • 행동 공간을 유한한 이산 단일 큐비트 게이트 집합(예: RZ, RY 회전)으로 정의하여 양자 회로 구축에 대한 이산적 제어를 가능하게 한다.
  • 문제에 특화된 비용 해밀토니안의 기대값을 보상 신호로 사용하며, 안정적인 학습을 위해 [0,1] 범위로 스케일링한다.
  • PPO 알고리즘을 사용하여 공유된 액터-크리틱 신경망 아키텍처를 활용해 양자 회로 생성을 위한 정책을 최적화한다.
  • 게이트를 차례로 추가하면서 양자 자원(시뮬레이터 또는 실제 QPU)에서 평가하고, 관측된 보상에 기반해 정책을 업데이트함으로써 반복적으로 양자 프로그램을 구축한다.
  • 관측치는 양자 상태 측정값과 문제에 특화된 특징(예: 그래프 구조)을 모두 포함하여 에이전트가 문제 맥락을 이해할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1강화 학습은 시뮬레이션 및 실제 양자 하드웨어에서 조합 최적화 문제에 대해 짧고 고성능의 양자 프로그램을 효과적으로 생성할 수 있는가?
  • RQ2학습된 에이전트가 학습 분포 외의 문제 인스턴스에 대해 얼마나 잘 일반화되는가?
  • RQ3동일한 문제 세트에서 RL로 생성된 프로그램의 성능은 표준 p=1 QAOA 히ュ리스틱과 비교해 어떻게 되는가?
  • RQ4노이즈와 게이트 정밀도의 차이가 있는 현실의 양자 프로세서로의 일반화가 가능한가?
  • RQ5문제 크기가 증가함에 따라 이 방법의 확장성은 어떻게 되며, 특히 학습 시간과 회로 깊이 측면에서 어떤 의미를 갖는가?

주요 결과

  • 학습된 강화 학습 에이전트는 시뮬레이션 및 실제 양자 자원 모두에서 미학습 에이전트와 p=1 QAOA를 능가하는 고성능 솔루션 생성을 일관되게 수행하였다.
  • 에이전트는 학습 데이터에 과적합되지 않고 이전에 본 적 없는 문제 인스턴스로의 일반화를 보이며, 과적합을 넘어서는 이식 가능한 전략이 도출되었음을 시사한다.
  • 시뮬레이션된 양자 자원에서 실제 양자 프로세서로의 일반화가 관측되어 노이즈와 하드웨어 결함에 대한 강건성을 시사한다.
  • 특정 문제에 대해 가장 짧은 게이트 시퀀스(예: X 게이트만)가 최적임을 발견하였으며, 정책은 비최적의 회전을 피하는 방식으로 학습하여 이론적 기대와 일치하였다.
  • PPO 알고리즘이 광범위한 초모수 조정 없이도 안정적이고 효율적인 학습을 가능하게 하여, 이 프레임워크의 실용적 구현 가능성에 기여하였다.
  • 관측치와 보상 설계의 수정을 통해 이 프레임워크는 비대칭 해밀토니안 및 기타 양자 프로그래밍 작업으로의 확장 가능성이 있으며, 특히 이는 향후 연구의 잠재력을 지닌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.