Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning Using Quantum Boltzmann Machines

Daniel J. Crawford, Anna Levit|arXiv (Cornell University)|2016. 12. 17.
Stochastic Gradient Optimization Techniques인용 수 16
한 줄 요약

이 논문은 시뮬레이션된 양자 앤날링(SQA)을 통해 훈련되는 양자 볼츠만 기계(QBM)를 사용한 강화학습 프레임워크를 제안한다. 깊이 있는 볼츠만 기계(DBM) 아키텍처를 활용해 상태-행동 의존성을 모델링하며, 전이장이 있는 QBM-RL이 복잡한 미로 환경에서 마르코프 결정 과정의 최적 정책을 학습하는 데서 고전적 RBM- 및 DBM-기반 방법보다 뛰어난 성능을 보임을 입증한다. 이는 고차원 상태 공간에서 더 뛰어난 샘플링 효율성과 일반화 능력 덕분이다.

ABSTRACT

We investigate whether quantum annealers with select chip layouts can outperform classical computers in reinforcement learning tasks. We associate a transverse field Ising spin Hamiltonian with a layout of qubits similar to that of a deep Boltzmann machine (DBM) and use simulated quantum annealing (SQA) to numerically simulate quantum sampling from this system. We design a reinforcement learning algorithm in which the set of visible nodes representing the states and actions of an optimal policy are the first and last layers of the deep network. In absence of a transverse field, our simulations show that DBMs are trained more effectively than restricted Boltzmann machines (RBM) with the same number of nodes. We then develop a framework for training the network as a quantum Boltzmann machine (QBM) in the presence of a significant transverse field for reinforcement learning. This method also outperforms the reinforcement learning method that uses RBMs.

연구 동기 및 목표

  • 특정 큐비트 레이아웃을 가진 양자 앤날링 기계가 강화학습 과제에서 고전적 시스템을 능가할 수 있는지 조사하는 것.
  • 양자 볼츠만 기계를 영감으로 삼은 깊이 있는 네트워크 아키텍처를 기반으로 한 강화학습 알고리즘을 설계하는 것.
  • 시뮬레이션된 양자 앤날링 하에서 마르코프 결정 과정의 최적 정책 학습에 있어 DBM과 QBM의 성능을 평가하는 것.
  • 증가하는 미로 복잡성에 따라 QBM-RL, DBM-RL, RBM-RL의 학습 효율성과 정밀도를 비교하는 것.
  • 개선된 샘플링과 표현 학습을 통해 강화학습에서 양자 우월성 잠재력을 평가하는 것.

제안 방법

  • 저자들은 깊이 있는 볼츠만 기계(DBM) 유사 큐비트 레이아웃을 가진 전이장 이sovings 해밀토니안으로 강화학습 문제를 매핑한다.
  • 진화 과정 중 해밀토니안의 순간적 양자 분포에서 샘플링하기 위해 시뮬레이션된 양자 앤날링(SQA)을 사용한다.
  • DBM의 가시층은 상태와 행동을 나타내며, 은닉층은 잠재적 상태-행동 상관관계를 모델링한다.
  • RBM/DBM/QBM 파라미터에 대해 경사 하강법을 사용해 수축 사상 연산자의 연속 적용 간 거리 최소화를 통해 정책을 학습한다.
  • 훈련은 SQA 샘플로부터 유도된 노드 활성화의 기대값을 사용하며, 전이장 강도를 조정하여 양자 앤날링 역학을 시뮬레이션한다.
  • 고전적 RBM 기반 학습과 DBM 및 QBM 기반 접근법을 비교하며, QBM는 최종 전이장이 상당히 크다(Γf = 2.00).

실험 결과

연구 질문

  • RQ1시뮬레이션된 양자 앤날링을 통해 훈련된 양자 볼츠만 기계가 강화학습 과제에서 고전적 제한된 및 깊이 있는 볼츠만 기계를 능가할 수 있는가?
  • RQ2해밀토니안에 전이장이 포함될 경우 복잡한 환경에서 정책 학습 정밀도와 수렴 속도가 향상되는가?
  • RQ3미로 크기와 과제 복잡성이 증가함에 따라 DBM 및 QBM 기반 강화학습의 성능은 어떻게 변화하는가?
  • RQ4DBM이 RBM보다 더 높은 차수의 상관관계를 더 잘 모델링함으로써 정책 학습에 얼마나 더 큰 개선을 이룰 수 있는가?
  • RQ5깊이 있는 생성 모델을 위한 강화학습 훈련에서 고전적 샘플링 대비 양자 샘플링(SQA를 통한)이 측정 가능한 이점을 제공하는가?

주요 결과

  • 최종 전이장이 Γf = 2.00인 QBM-RL은 모든 미로 크기에서 DBM-RL 및 RBM-RL보다 높은 학습 정밀도를 기록했다.
  • DBM-RL은 동일한 은닉 노드 수에도 불구하고 더 높은 정밀도를 달성했으며, 이는 더 나은 고차원 상관관계 모델링 덕분이었다.
  • 미로 크기가 커지면서 RBM-RL의 평균 정밀도(avℓ)는 빠르게 무작위 정책 수준으로 감소했지만, DBM-RL 및 QBM-RL은 높은 성능을 유지했다.
  • QBM-RL의 정밀도 곡선은 훈련 샘플이 균일하게 무작위로 선택된 경우에도 DBM 및 RBM-RL을 항상 뛰어넘었으며, 순차적 스윕에서 관찰된 주기성 영향을 제거했다.
  • Γf = 0.01인 SQA는 고전적 앤날링(SA)의 정밀도 곡선과 일치했으며, 전이장이 점점 줄어드는 극한에서 고전적 볼츠만 샘플링과 일致함을 확인했다.
  • 결과적으로 QBM-RL은 양자 우월성 잠재력을 지닌 것으로 보이며, RBM 기반 방법은 더 큰 미로 문제를 해결하기 위해 지수적으로 더 큰 아키텍처가 필요할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.