[论文解读] An application of data driven reward of deep reinforcement learning by dynamic mode decomposition in active flow control
本论文提出了一种用于圆柱体主动流动控制(AFC)中深度强化学习(DRL)的数据驱动奖励函数,利用动态模态分解(DMD)从仿真数据中提取全局流动特征。通过在基于PPO的DRL框架中优化该基于DMD的奖励函数,该方法将阻力降低了最多10.8%,并将回流区面积提高了124%,显著稳定了卡门涡街结构,相较于基于探针的奖励函数表现更优。
This paper focuses on the active flow control (AFC) of the flow over a circular cylinder with synthetic jets through deep reinforcement learning (DRL) by implementing a reward function based on dynamic mode decomposition (DMD). As a main factor that affects the DRL model, the reward is determined by the information extracted from flow field by performing DMD on measurements through simulation. With the data-driven reward, the DRL model is able to learn the AFC policy through the more global information of the field, and instructs the mass flow rate of the synthetic jets. As a result of this type of AFC, the vortex street is stabilized with a reduction of approximately 8% in drag and an improvement of approximately 109% in recirculation area. Furthermore, the configuration of the flow modified by the AFC is studied with DMD on the velocity measurement of the complete flow field.
研究动机与目标
- 通过用基于全局流动动力学的数据驱动奖励替代传统探针基奖励,提升深度强化学习(DRL)在主动流动控制(AFC)中的性能。
- 利用全场速度测量数据对动态模态分解(DMD)进行处理,提取主导流动结构,并将其振幅作为DRL智能体的奖励信号。
- 评估基于DMD的奖励在降低圆柱体二维流动中合成射流控制下的阻力和提升回流区面积方面的有效性。
- 验证该方法在不同训练时长和测量分辨率下的鲁棒性与可扩展性。
- 通过设计兼容分布式传感器测量和延长episode长度的DRL框架,为未来实验应用提供支持。
提出的方法
- DRL智能体使用近端策略优化(PPO)算法控制圆柱体上合成射流的质量流量。
- 基于从全场速度测量中通过压缩动态模态分解(DMDc)提取的动态模态振幅,构建数据驱动的奖励函数。
- DMDc处理时间分辨的流动场数据,识别相干结构及其时间动力学,用于计算奖励信号。
- 奖励函数强调抑制主导不稳定模态(特别是主要涡脱落模态),以促进流动稳定化。
- 该方法使用雷诺数为100的二维圆柱体流动仿真数据进行训练,合成射流作为控制执行器。
- 在不同训练时长(400和800个epoch)下评估该框架,并与仅使用探针测量的基线方法进行对比。
实验结果
研究问题
- RQ1与传统探针基奖励相比,基于DMD的数据驱动奖励函数是否能提升DRL在主动流动控制中的性能?
- RQ2通过DMDc利用全场流动信息,对涡街控制中的阻力降低和回流区面积改善有何影响?
- RQ3基于DMD的奖励在抑制涡街频率和模态振幅方面,能在多大程度上增强卡门涡街的稳定性?
- RQ4学习效率和最终性能如何随训练时长延长和测量分辨率提升而变化?
- RQ5所提出的基于DMD奖励的DRL框架能否适配使用分布式传感器的实验实现?
主要发现
- 在训练800个epoch后,基于DMD的奖励使平均阻力系数降低了约10.8%,优于仅使用探针奖励时获得的8.6%降低效果。
- 在800个epoch的训练后,回流区面积最高提升了124%,而400个epoch时的提升为109%。
- 受控流动中涡脱落的基本频率降低了约11%,表明流动结构更加稳定且周期性减弱。
- 对受控流动进行的DMD分析显示,主导模态的振幅显著降低,尤其是在尾迹近区,证实了对非定常不稳定性的有效抑制。
- 基于DMD模态重构的速度幅值等值线显示,下游波动模态之间的空间分离度增加,表明涡对配对减少,流动相干性增强。
- 该方法在不同训练周期和测量分辨率下均表现出鲁棒性,阻力降低和回流区面积提升均保持一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。