Skip to main content
QUICK REVIEW

[论文解读] Model-free and Bayesian Ensembling Model-based Deep Reinforcement Learning for Particle Accelerator Control Demonstrated on the FERMI FEL

Simon Hirlaender, Niky Bruchon|arXiv (Cornell University)|Dec 17, 2020
Advancements in Semiconductor Devices and Circuit Design被引用 11
一句话总结

该论文提出了一种无模型且基于贝叶斯集成的模型化深度强化学习方法,用于优化FEL自由电子激光器中的辐射强度。通过使用带有锚定集成的AE-DYNA进行不确定性感知的动力学建模,并采用定制的深度Q-learning实现无模型控制,该方法仅用3–5步即达到超过95%的最大强度,且数据点少于1,000个,展现出在真实加速器控制中极高的样本效率和鲁棒性。

ABSTRACT

Reinforcement learning holds tremendous promise in accelerator controls. The primary goal of this paper is to show how this approach can be utilised on an operational level on accelerator physics problems. Despite the success of model-free reinforcement learning in several domains, sample-efficiency still is a bottle-neck, which might be encompassed by model-based methods. We compare well-suited purely model-based to model-free reinforcement learning applied to the intensity optimisation on the FERMI FEL system. We find that the model-based approach demonstrates higher representational power and sample-efficiency, while the asymptotic performance of the model-free method is slightly superior. The model-based algorithm is implemented in a DYNA-style using an uncertainty aware model, and the model-free algorithm is based on tailored deep Q-learning. In both cases, the algorithms were implemented in a way, which presents increased noise robustness as omnipresent in accelerator control problems. Code is released in https://github.com/MathPhysSim/FERMI_RL_Paper.

研究动机与目标

  • 为了证明强化学习在真实粒子加速器控制中的实际适用性,特别是针对FERMI自由电子激光器的强度优化。
  • 为了在真实加速器环境中,比较无模型与模型化深度强化学习在样本效率、渐近性能和抗噪声能力方面的表现。
  • 为了开发并验证一种新型模型化算法AE-DYNA,该算法结合不确定性感知的动力学模型与锚定集成,以提升稳定性和泛化能力。
  • 为了实现在极小数据量下的高性能控制,从而支持时间可变系统在加速器物理中常见的实时再训练。
  • 通过架构和训练方面的创新(如噪声注入和集成正则化),确保对噪声的强健性并降低模型偏差。

提出的方法

  • 采用AE-DYNA,一种基于神经网络动力学模型的模型化强化学习算法,通过锚定集成实现不确定性感知预测,以减少偏差并提升鲁棒性。
  • 通过在损失函数中添加正则化项实现锚定集成,以鼓励多个模型之间产生多样化、类似MAP的参数估计,从而模拟贝叶斯后验近似。
  • 使用对角线正则化矩阵Γ,其元素由数据噪声方差与先验方差的比值导出,以稳定训练过程并改善不确定性估计。
  • 实现一种带有噪声注入和状态归一化的无模型深度Q-learning变体,以增强对测量噪声的鲁棒性并提升样本效率。
  • 将两种算法整合进一个实时学习框架,支持基于新数据的再训练,从而适应时间可变的系统动力学。
  • 为模型化方法采用基于SAC的演员-评论家架构处理连续动作空间,为无模型基线采用定制的DQN变体,两者均基于真实的FERMI FEL数据进行训练。

实验结果

研究问题

  • RQ1在真实加速器控制中,模型化深度强化学习是否能相比无模型方法展现出更优的样本效率?
  • RQ2在FEL控制的动力学建模中,使用带有锚定正则化的贝叶斯集成在多大程度上提升了模型稳定性与不确定性估计?
  • RQ3在噪声环境下的真实加速器环境中,无模型与模型化强化学习方法在有限数据(<1,000个数据点)下能达到多高的性能?
  • RQ4在人工噪声和真实噪声条件下,两种方法的抗噪声能力如何比较?
  • RQ5所提出的算法是否能够实现实时再训练以适应时变系统行为,从而实现在动态环境中的实际部署?

主要发现

  • 模型化AE-DYNA算法仅用3–5次优化步骤即达到最大辐射强度的95%以上,展现出极高的样本效率。
  • AE-DYNA在少于1,000个数据点的情况下即达到接近最优性能,其数据效率显著优于无模型方法。
  • 无模型深度Q-learning方法在渐近性能上略优于AE-DYNA,但其样本需求显著更高。
  • 在AE-DYNA中使用带有不确定性感知的动力学建模的锚定集成,降低了模型偏差并提升了训练稳定性,尤其在噪声条件下表现更优。
  • 训练期间的噪声注入增强了两种算法的鲁棒性,但AE-DYNA在人工噪声下表现更优,具有更小的奖励波动和更快的收敛速度。
  • 三模型集成在AE-DYNA中提供了性能与训练时间的最佳平衡,其收敛速度和稳定性优于单个网络及更大规模的集成。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。