[论文解读] Hybrid actor-critic algorithm for quantum reinforcement learning at CERN beam lines
本文提出了一种混合演员-评论家强化学习算法,将经典的深度确定性策略梯度(DDPG)演员与基于量子玻尔兹曼机(QBM)的评论家相结合,用于粒子加速器束流线中连续状态-动作空间的控制。该方法在离散动作环境中的样本效率优于经典DQN,并成功地将训练好的智能体部署于真实AWAKE电子束流线,同时使用了模拟和D-Wave量子退火硬件,混合模型使得推理仅需经典演员网络即可完成。
Free energy-based reinforcement learning (FERL) with clamped quantum Boltzmann machines (QBM) was shown to significantly improve the learning efficiency compared to classical Q-learning with the restriction, however, to discrete state-action space environments. In this paper, the FERL approach is extended to multi-dimensional continuous state-action space environments to open the doors for a broader range of real-world applications. First, free energy-based Q-learning is studied for discrete action spaces, but continuous state spaces and the impact of experience replay on sample efficiency is assessed. In a second step, a hybrid actor-critic scheme for continuous state-action spaces is developed based on the Deep Deterministic Policy Gradient algorithm combining a classical actor network with a QBM-based critic. The results obtained with quantum annealing, both simulated and with D-Wave quantum annealing hardware, are discussed, and the performance is compared to classical reinforcement learning methods. The environments used throughout represent existing particle accelerator beam lines at the European Organisation for Nuclear Research (CERN). Among others, the hybrid actor-critic agent is evaluated on the actual electron beam line of the Advanced Plasma Wakefield Experiment (AWAKE).
研究动机与目标
- 将基于自由能的强化学习(FERL)与量子玻尔兹曼机(QBM)从离散状态-动作空间扩展至连续状态-动作空间,以实现加速器控制中更广泛的实际应用。
- 开发一种混合演员-评论家架构,结合经典深度强化学习与基于QBM的评论家,用于复杂束流线环境中的连续控制任务。
- 通过使用模拟量子退火和真实D-Wave量子退火硬件,评估混合量子-经典强化学习智能体的样本效率和性能,与经典基线方法进行对比。
- 在CERN实际AWAKE电子束流线上验证训练智能体的仿真到现实的迁移能力。
- 通过证明推理阶段仅需经典演员网络,展示实际部署的可行性,从而简化现实世界中的集成。
提出的方法
- 混合演员-评论家框架将DDPG中的经典评论家替换为钳位量子玻尔兹曼机(QBM),通过自由能最小化来估计Q值。
- QBM评论家通过基于自由能的强化学习(FERL)进行训练,利用量子退火计算Q函数近似。
- 在离散动作阶段引入经验回放,以提升样本效率,特别是在连续状态空间中。
- 该算法首先在具有连续状态和离散动作的一维束流转向任务中进行验证,随后扩展至十维连续状态-动作空间。
- 训练过程使用了模拟量子退火(SQA)和真实D-Wave Advantage量子退火硬件,以评估性能差异。
- 在推理阶段,仅使用经典演员网络,从而实现在加速器控制室中无需量子硬件的实用部署。
实验结果
研究问题
- RQ1基于自由能的强化学习(FERL)与QBM评论家能否扩展至连续状态-动作空间,从而克服先前仅限于离散动作空间的局限?
- RQ2在具有离散动作的连续状态空间中,经验回放对FERL的样本效率有何影响?
- RQ3混合量子-经典演员-评论家模型在连续控制任务中是否优于经典DDPG,在样本效率和收敛速度方面?
- RQ4在训练混合智能体时,模拟量子退火与真实D-Wave量子退火硬件之间的性能差距如何?
- RQ5在仿真中训练的混合智能体能否成功迁移到真实世界的AWAKE电子束流线环境中并实现可靠运行?
主要发现
- 在离散动作、连续状态的TT24-T4质子束流线任务中,FERL结合QBM评论家的样本效率显著优于经典DQN,无论是否使用经验回放。
- 在离散动作设置中,经验回放进一步提升了样本效率,减少了达到奖励目标所需的交互次数。
- 混合演员-评论家模型在仿真和真实世界部署中均成功解决了AWAKE电子束流线中的十维连续状态-动作控制问题。
- 在D-Wave量子退火硬件上训练的智能体平均性能略优于SQA训练的智能体,尤其在最终奖励分布和步数效率方面表现更优。
- 无论是SQA还是D-Wave训练的智能体,均无需额外微调即可从仿真泛化至真实AWAKE束流线,证明了强大的仿真到现实迁移能力。
- 使用D-Wave硬件训练的智能体在真实环境中对一个初始状态未能成功解决问题,可能由于受限的QPU时间导致训练收敛不完全。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。