Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning with Quantum Variational Circuits

Owen Lockwood, Mei Si|arXiv (Cornell University)|2020. 08. 15.
Quantum Computing Algorithms and Architecture참고 문헌 29인용 수 16
한 줄 요약

이 논문은 딥 Q-네트워크(DQN) 및 더블 DQN 알고리즘에서 강화학습 성능을 향상시키기 위해 양자 변분 회로(QVCs)를 사용하는 것을 제안한다. 순수한 양자 및 하이브리드 양자 접근 방식을 비교하며, 두 가지 새로운 고전-양자 데이터 인코딩 기법인 스케일드 및 방향성 인코딩을 도입한다. 결과적으로 QVCs는 훨씬 적은 파라미터로도 고전적 신경망과 유사하거나 더 뛰어난 성능을 달성하며, 특히 OpenAI Gym의 CartPole 및 블랙잭 환경에서 뛰어난 성능을 보였다.

ABSTRACT

The development of quantum computational techniques has advanced greatly in recent years, parallel to the advancements in techniques for deep reinforcement learning. This work explores the potential for quantum computing to facilitate reinforcement learning problems. Quantum computing approaches offer important potential improvements in time and space complexity over traditional algorithms because of its ability to exploit the quantum phenomena of superposition and entanglement. Specifically, we investigate the use of quantum variational circuits, a form of quantum machine learning. We present our techniques for encoding classical data for a quantum variational circuit, we further explore pure and hybrid quantum algorithms for DQN and Double DQN. Our results indicate both hybrid and pure quantum variational circuit have the ability to solve reinforcement learning tasks with a smaller parameter space. These comparison are conducted with two OpenAI Gym environments: CartPole and Blackjack, The success of this work is indicative of a strong future relationship between quantum machine learning and deep reinforcement learning.

연구 동기 및 목표

  • 양자 변분 회로(QVCs)가 파라미터 복잡도를 줄이며 강화학습 성능을 향상시킬 수 있는지 조사하기.
  • 강화학습 입력을 위한 새로운 고전-양자 데이터 인코딩 기법을 개발하고 평가하기.
  • DQN 및 더블 DQN 프레임워크에서 순수 QVCs와 하이브리드 양자-고전 모델을 비교하기.
  • QVC 기반 강화학습의 일반화 및 확장성, 특히 CartPole 및 블랙잭과 같은 다양한 환경에서의 성능 평가하기.
  • 최소한의 파라미터 공간으로도 비트라이비얼 강화학습 과제를 해결할 수 있는 QVCs의 실현 가능성 입증하기.

제안 방법

  • 저자들은 DQN 및 더블 DQN 알고리즘에서 Q-값 함수를 표현하기 위해 매개변수화된 양자 게이트를 사용하는 QVCs를 구현한다.
  • 두 가지 인코딩 기법을 설계한다: 유한하고 비편향된 부동소수점 입력에 적합한 스케일드 인코딩과, 무한하거나 크기 기반 범위가 없는 입력에 적합한 방향성 인코딩.
  • QVCs는 양자 시뮬레이터를 사용해 훈련되며, 최적화를 위해 파라미터 이동 규칙을 통해 기울기를 계산한다.
  • 더블 DQN에서는 고전적 DQN과 유사하게 리PLAY 버퍼와 타겟 네트워크를 사용해 학습 안정성을 확보한다.
  • 동일한 강화학습 환경에서 다양한 깊이와 파라미터 수를 가진 고전적 신경망과 양자 모델을 비교한다.
  • 훈련 과정은 텐서플로우 큐앙텀과 양자 회로 최적화를 활용하여 평균 제곱 벨먼 오차를 최소화한다.

실험 결과

연구 질문

  • RQ1양자 변분 회로가 훨씬 적은 파라미터로도 고전적 신경망과 유사하거나 더 뛰어난 강화학습 성능를 달성할 수 있는가?
  • RQ2다양한 고전-양자 데이터 인코딩 기법(스케일드 및 방향성)이 강화학습 과제에서 QVC 성능에 어떤 영향을 미치는가?
  • RQ3DQN 및 더블 DQN 알고리즘에서 순수 QVCs와 하이브리드 양자-고전 모델의 상대적 성능는 어떠한가?
  • RQ4하이브리드 모델에서의 빠른 수렴이 조기 수렴으로 이어져 최적의 정책을 도출하지 못하는가?
  • RQ5QVC 기반 강화학습이 CartPole 및 블랙잭과 같은 다양한 환경에서 얼마나 일반화될 수 있는가?

주요 결과

  • 순수 QVC 모델은 더블 DQN에서 CartPole 환경에서 하이브리드 모델과 고전적 신경망을 모두 압도하며 더 적은 파라미터로 뛰어난 성능을 달성했다.
  • 하이브리드 QVC 모델은 고전적 네트워크보다 수렴 속도가 빠르지만, 때로는 국소 최적점에 도달하여 CartPole 실험에서 순수 QVC보다 약간 열등한 성능를 보였다.
  • 블랙잭 환경에서는 순수 및 하이브리드 QVCs가 모두 고전적 네트워크와 유사한 성능를 달성했으며, 파라미터 수가 1,250에서 33으로 줄어들어 매우 높은 샘플 효율성을 보였다.
  • 스케일드 인코딩 기법은 유한하고 비편향된 입력을 양자 상태로 안정적으로 매핑하여 다양한 환경에서의 안정적 훈련을 가능하게 했다.
  • 방향성 인코딩 기법은 크기 정보가 중요하지 않은 입력 유형을 위해 설계되었으며, 다양한 입력 유형으로의 일반화를 지원한다.
  • 결과적으로 QVCs는 특히 낮은 파라미터 수 환경에서 고전적 신경망보다 뛰어난 표현 능력을 지닐 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.