Skip to main content
QUICK REVIEW

[논문 리뷰] Hybrid actor-critic algorithm for quantum reinforcement learning at CERN beam lines

Michael Schenk, Elías F. Combarro|arXiv (Cornell University)|2022. 09. 22.
Advancements in Semiconductor Devices and Circuit Design인용 수 4
한 줄 요약

이 논문은 입자 가속기 빔 라인에서 연속 상태-행동 공간 제어를 위해 고전적 딥 디터미니스트릭 포licy 그레디언트(DDPG) 액터와 양자 볼츠만 기반 비평가(QBM-based critic)를 융합한 하이브리드 액터-비평가 강화학습 알고리즘을 제안한다. 이는 이산 행동 환경에서 고전적 DQN에 비해 더 높은 샘플 효율성을 보이며, 시뮬레이션된 환경과 D-Wave 양자 안내 하드웨어를 모두 사용하여 실제 AWAKE 전자 빔 라인에 훈련된 에이전트를 성공적으로 구현한다. 하이브리드 모델은 추론 시 오직 고전적 액터 네트워크만을 사용함으로써 가능해진다.

ABSTRACT

Free energy-based reinforcement learning (FERL) with clamped quantum Boltzmann machines (QBM) was shown to significantly improve the learning efficiency compared to classical Q-learning with the restriction, however, to discrete state-action space environments. In this paper, the FERL approach is extended to multi-dimensional continuous state-action space environments to open the doors for a broader range of real-world applications. First, free energy-based Q-learning is studied for discrete action spaces, but continuous state spaces and the impact of experience replay on sample efficiency is assessed. In a second step, a hybrid actor-critic scheme for continuous state-action spaces is developed based on the Deep Deterministic Policy Gradient algorithm combining a classical actor network with a QBM-based critic. The results obtained with quantum annealing, both simulated and with D-Wave quantum annealing hardware, are discussed, and the performance is compared to classical reinforcement learning methods. The environments used throughout represent existing particle accelerator beam lines at the European Organisation for Nuclear Research (CERN). Among others, the hybrid actor-critic agent is evaluated on the actual electron beam line of the Advanced Plasma Wakefield Experiment (AWAKE).

연구 동기 및 목표

  • 자유 에너지 기반 강화학습(FERL)에 QBM를 적용해 이전에 이산 행동 공간에 국한되어 있던 기존 제약를 극복하고 연속 상태-행동 공간으로 확장함으로써 가속기 제어 분야에서 더 넓은 실세계 적용 가능성을 확보한다.
  • 복잡한 빔라인 환경에서의 연속 제어 작업을 위해 고전적 딥 강화학습과 QBM 기반 비평가를 융합한 하이브리드 액터-비평가 아키텍처를 개발한다.
  • 시뮬레이션된 양자 안내와 실제 D-Wave 양자 안내 하드웨어를 모두 활용하여, 하이브리드 양자-고전적 RL 에이전트의 샘플 효율성과 성능을 고전적 기준 모델과 비교 평가한다.
  • CERN의 실제 AWAKE 전자 빔 라인에서 훈련된 에이전트의 시뮬레이션에서 실세계로의 전이 능력을 검증한다.
  • 추론 시 오직 고전적 액터 네트워크만을 사용함으로써 실세계 통합이 간소화됨을 보여줌으로써 실용적 구현 가능성을 입증한다.

제안 방법

  • 하이브리드 액터-비평가 프레임워크는 DDPG의 고전적 비평가를 클램프된 양자 볼츠만 기반 기반 비평가(QBM)로 대체하여 자유 에너지 최소화 기반으로 Q-값을 추정한다.
  • QBM 비평가는 자유 에너지 기반 강화학습(FERL)을 통해 훈련되며, Q-함수 근사치를 계산하기 위해 양자 안내를 활용한다.
  • 경험 재생 기법이 이산 행동 단계에 통합되어 특히 연속 상태 공간에서 샘플 효율성을 향상시킨다.
  • 알고리즘은 먼저 연속 상태와 이산 행동을 갖는 일차원 빔 조정 작업에서 검증된 후, 10차원 연속 상태-행동 공간으로 확장된다.
  • 성능 차이를 평가하기 위해 시뮬레이션된 양자 안내(SQA)와 실제 D-Wave Advantage 양자 안내 하드웨어를 모두 사용하여 훈련을 수행한다.
  • 추론 단계에서는 오직 고전적 액터 네트워크만 사용되며, 이는 가속기 제어실에서 양자 하드웨어 없이도 실용적인 구현을 가능하게 한다.

실험 결과

연구 질문

  • RQ1자유 에너지 기반 강화학습(FERL)에 QBM 비평가를 적용해 이전에 이산 행동 공간에 국한되어 있던 제약를 극복하고 연속 상태-행동 공간으로 확장할 수 있는가?
  • RQ2경험 재생이 이산 행동을 갖는 연속 상태 공간에서 FERL의 샘플 효율성에 어떤 영향을 미치는가?
  • RQ3하이브리드 양자-고전적 액터-비평가 모델이 연속 제어 작업에서 고전적 DDPG에 비해 샘플 효율성과 수렴 속도 측면에서 뛰어나게 성능을 발휘하는가?
  • RQ4시뮬레이션된 양자 안내와 실제 D-Wave 양자 안내 하드웨어 간의 성능 격차는 훈련된 하이브리드 에이전트의 성능에 어떤 영향을 미치는가?
  • RQ5시뮬레이션에서 훈련된 하이브리드 에이전트가 실제 AWAKE 전자 빔 라인 환경로로 성공적으로 전이되어 안정적으로 작동할 수 있는가?

주요 결과

  • FERL에 QBM 비평가를 적용한 결과, 이산 행동, 연속 상태 TT24-T4 프로톤 빔 라인 작업에서 경험 재생 유무에 관계없이 고전적 DQN보다 유의미하게 높은 샘플 효율성을 확보하였다.
  • 경험 재생은 이산 행동 설정에서 샘플 효율성을 추가로 향상시켜 보상 목표에 도달하기 위한 상호작용 횟수를 감소시켰다.
  • 하이브리드 액터-비평가 모델은 시뮬레이션과 실제 환경 모두에서 AWAKE 전자 빔 라인의 10차원 연속 상태-행동 제어 문제를 성공적으로 해결하였다.
  • D-Wave 양자 안내 하드웨어로 훈련한 에이전트가 SQA로 훈련한 에이전트보다 약간 더 높은 평균 성능을 보였으며, 특히 최종 보상 분포와 스텝 수 효율성 측면에서 뚜렷한 우수성을 보였다.
  • SQA 및 D-Wave로 훈련한 에이전트 모두 시뮬레이션에서 실세계 AWAKE 빔 라인으로의 일반화 성능이 뛰어나 추가 정밀조정 없이도 안정적으로 작동함을 입증하여 강력한 시뮬레이션-실세계 전이 능력을 보였다.
  • D-Wave 하드웨어를 사용할 경우, 한 가지 초기 상태에서 훈련된 하이브리드 에이전트가 작업을 성공적으로 해결하지 못했으며, 이는 제한된 QPU 시간으로 인한 훈련 수렴 불완전성 때문일 가능성이 높다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.