Skip to main content
QUICK REVIEW

[논문 리뷰] Variational Quantum Soft Actor-Critic

Qingfeng Lan|arXiv (Cornell University)|2021. 12. 20.
Quantum Computing Algorithms and Architecture인용 수 15
한 줄 요약

이 논문은 변량 양자 회로(VQC)와 고전적 신경망을 조합하여 정책 네트워크를 구성하는 하이브리드 양자-고전적 강화학습 알고리즘인 변량 양자 소프트 액터-크리틱(QuantumSAC)을 제안한다. 이 알고리즘은 훨씬 적은 학습 가능한 파라미터(41 대 1,250)를 사용하여 Pendulum-v0 환경에서 고전적 소프트 액터-크리틱(SAC)과 유사한 성능을 달성하여 양자적 우월성을 파라미터 효율성 측면에서 입증한다.

ABSTRACT

Quantum computing has a superior advantage in tackling specific problems, such as integer factorization and Simon's problem. For more general tasks in machine learning, by applying variational quantum circuits, more and more quantum algorithms have been proposed recently, especially in supervised learning and unsupervised learning. However, little work has been done in reinforcement learning, arguably more important and challenging. Previous work in quantum reinforcement learning mainly focuses on discrete control tasks where the action space is discrete. In this work, we develop a quantum reinforcement learning algorithm based on soft actor-critic -- one of the state-of-the-art methods for continuous control. Specifically, we use a hybrid quantum-classical policy network consisting of a variational quantum circuit and a classical artificial neural network. Tested in a standard reinforcement learning benchmark, we show that this quantum version of soft actor-critic is comparable with the original soft actor-critic, using much less adjustable parameters. Furthermore, we analyze the effect of different hyper-parameters and policy network architectures, pointing out the importance of architecture design for quantum reinforcement learning.

연구 동기 및 목표

  • 양자 강화학습 분야에서 아직 탐색이 부족한 연속 제어 작업을 위한 양자 강화학습 알고리즘을 개발하는 것.
  • 최신 기술인 소프트 액터-크리틱(SAC) 프레임워크에 변량 양자 회로(VQC)를 통합하는 것.
  • 양자 강화된 정책 네트워크가 고전적 SAC 성능을 유지하면서도 모델 파라미터를 줄일 수 있는지 평가하는 것.
  • 특히 층 수와 데이터 재업로드 기법을 포함한 VQC 아키텍처 설계가 학습 성능와 안정성에 미치는 영향을 조사하는 것.

제안 방법

  • 변량 양자 회로(VQC)가 상태 임bedding을 처리하고 고전적 피드포워드 신경망이 행동을 출력하는 하이브리드 양자-고전적 정책 네트워크를 제안한다.
  • 입력 상태가 여러 층에 걸쳐 반복적으로 양자 회로에 인코딩되어 표현력이 향상되는 데이터 재업로드 VQC 아키텍처를 사용한다.
  • 고전적 정책 네트워크를 하이브리드 양자-고전적 네트워크로 대체함으로써 소프트 액터-크리틱(SAC) 알고리즘을 변형하며, SAC의 최대 엔트로피 목표를 유지한다.
  • 학습 안정성을 위해 경험 리플레이와 타겟 네트워크를 사용하며, 초모수는 격자 탐색을 통해 최적화한다.
  • Adam 최적화를 적용하며 정책과 Q-네트워크에 대해 별도의 학습률을 사용하고, 온도 계수 α는 고정된 0.2를 사용한다.
  • 최근 10개의 학습 에피소드 동안의 평균 수익을 성능 평가 지표로 사용하며, 결과는 10개의 랜덤 시드로 평균화하고 지수 이동 평균을 적용하여 부드럽게 한다.

실험 결과

연구 질문

  • RQ1SAC에 통합된 변량 양자 회로가 연속 제어 작업에서 고전적 SAC와 유사한 성능을 달성할 수 있는가?
  • RQ2양자 정책 네트워크의 사용이 샘플 효율성이나 성능을 저하시키지 않으면서도 학습 가능한 파라미터 수를 줄일 수 있는가?
  • RQ3VQC 아키텍처—특히 일반 VQC 대 비해 데이터 재업로드 VQC—가 학습 성능와 안정성에 어떤 영향을 미치는가?
  • RQ4VQC의 층 수를 늘릴 경우 정책 성능와 분산에 어떤 영향을 미치는가?

주요 결과

  • 데이터 재업로드 VQC를 사용한 QuantumSAC(n=2 층)는 50,000 스텝 후 약 1400의 평균 수익을 기록하여 고전적 SAC와 거의 동일한 성능를 달성했다.
  • 양자 정책 네트워크는 단지 41개의 학습 가능한 파라미터만을 사용하여 고전적 SAC의 1,250개 대비 96.7% 감소시켰다.
  • 일반 VQC 아키텍처는 고전적 SAC와 데이터 재업로드 변형 모두보다 성능이 열 劣했으며, 이는 양자 강화학습에서 아키텍처 설계의 중요성을 시사한다.
  • 두 아키텍처 모두 VQC 층 수가 증가할수록 성능이 향상되었지만, 데이터 재업로드 VQC는 2층을 초과해도 성능 향상가 뚜렷하지 않아 최적의 정책 모델링을 위해 2층이 충분할 수 있음을 시사한다.
  • 같은 수의 파라미터로도 데이터 재업로드 VQC는 일반 VQC보다 수익의 분산이 적어 학습 안정성이 향상됨을 보였다.
  • 결과는 VQC 아키텍처 설계—특히 데이터 재업로드 기법—가 성능에 상당한 영향을 미칠 수 있음을 시사하며, 양자 신경망 설계가 고전적 딥 러닝의 통찰을 기반으로 발전시킬 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.