[论文解读] Dynamic Control of a Fiber Manufacturing Process using Deep Reinforcement Learning
该论文提出了一种用于紧凑型光纤拉制系统中动态光纤直径调节的无模型深度强化学习(DRL)控制器,无需预先了解物理模型即可学习跟踪时变参考轨迹。经过3小时训练后,DRL控制器的性能与二次动态矩阵控制器(QDMC)相当,并在跟踪精度和响应速度上优于PI控制器,时间延迟低于1秒,而PI控制器为3.5秒。
This paper presents a model-free deep reinforcement learning (DRL) approach for controlling a fiber drawing system. The custom DRL-based control system predictively regulates fiber diameter and produces a fiber with a desired, constant or non-constant, diameter trajectory, i.e. diameter variation along the fiber length. Physical models of the system are not used. The system was trained and tested on a compact fiber drawing system, which has non-linear delayed dynamics and stochastic behaviors. For a reference trajectory with random step changes, after 1 hour of training, the DRL controller showed the same root mean squared error (RMSE) as an optimized PI controller; after 3 hours of training, it achieved the performance of a quadratic dynamic matrix controller (QDMC). While the PI feedback controller showed 3.5 seconds of time lag in a step response, the DRL controller showed less than a second of time lag. Controller performance tests on trajectories not used in the training process are conducted; for a sine sweep reference trajectory, the DRL controller maintained an RMSE under 40 um up to a frequency of 45 mHz, compared to 25 mHz for QDMC.
研究动机与目标
- 开发一种用于物理上复杂、具有随机性和非线性特性的光纤拉制过程中动态光纤直径调节的实时、无模型控制系 统。
- 实现在不依赖解析或数值系统模型的前提下,对非恒定、时变轨迹的光纤直径预测控制。
- 证明DRL控制器能够泛化到训练过程中未见过的参考轨迹,包括正弦扫频和阶跃变化。
- 在真实物理系统中,与传统控制器(如PI和QDMC)相比,实现更优的跟踪误差和响应时间性能。
提出的方法
- 采用具有双分枝结构的深度Q网络(DQN)进行价值函数近似,以实现稳定训练和动作选择。
- 使用滑动窗口内当前及历史观测值的组合作为状态表示(50个时间步长,12.5秒),以捕捉系统延迟动态特性。
- 实施线性动作-速度映射,确保低速控制的精确性,这对实现精确的直径调节至关重要。
- 引入“when-label”嵌入以编码时间上下文,加速学习过程并提升策略的一致性。
- 使用基于直径跟踪误差的稀疏且形状化奖励函数对DRL智能体进行训练,累积回报按γ=0.95进行折扣。
- 采用经验回放和目标网络更新策略,以稳定深度神经网络策略的训练过程,防止发散。
实验结果
研究问题
- RQ1无模型的DRL智能体是否能在具有非线性、延迟和随机动态特性的真实物理系统上,实现高精度的光纤直径调节?
- RQ2与基于模型的传统控制器相比,DRL控制器在跟踪快速变化的直径轨迹(如正弦扫频)时表现如何?
- RQ3DRL控制器在泛化到训练数据中未包含的参考轨迹方面的能力有多大?
- RQ4哪些架构和训练组件(如窗口长度、动作映射、when-label)对实现高性能至关重要?
- RQ5DRL控制器在跟踪误差和响应时间方面能否达到或超越经过优化的PI和QDMC控制器的性能?
主要发现
- 经过1小时训练,DRL控制器实现了与优化后的PI控制器相同的均方根误差(RMSE),尽管PI控制器存在3.5秒的时间延迟。
- 经过3小时训练,DRL控制器的性能与基于模型的最优控制器——二次动态矩阵控制器(QDMC)相当。
- 对于正弦扫频参考轨迹,DRL控制器在高达45 mHz的频率下保持RMSE低于40 μm,而QDMC的上限仅为25 mHz。
- 在阶跃变化响应中,DRL控制器的时间延迟小于1秒,显著优于PI控制器的3.5秒延迟。
- 线性动作-速度映射将平均直径误差降低了约20 μm,尤其在低速区域显著提升了控制性能。
- 至少需要50个时间步长(12.5秒)的窗口长度才能捕捉系统响应中的8.0秒延迟,窗口长度更短会导致控制不稳定且不准确。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。