[论文解读] Data Driven Control with Learned Dynamics: Model-Based versus Model-Free Approach
该论文比较了基于模型的数据驱动控制方法——基于深度神经网络学习升维空间中线性化动力学模型的深度Koopman表示控制(DKRC)与无模型方法——深度确定性策略梯度(DDPG)。DKRC在仅需70个训练周期(vs. DDPG的50,000个)和更少样本的情况下,实现了与DDPG相当的控制性能,同时由于其物理信息驱动的模型结构,展现出更好的可解释性和鲁棒性,其与解析的Euler-Lagrange线性化方法的相关系数高达0.8926,验证了其有效性。
This paper compares two different types of data-driven control methods, representing model-based and model-free approaches. One is a recently proposed method - Deep Koopman Representation for Control (DKRC), which utilizes a deep neural network to map an unknown nonlinear dynamical system to a high-dimensional linear system, which allows for employing state-of-the-art control strategy. The other one is a classic model-free control method based on an actor-critic architecture - Deep Deterministic Policy Gradient (DDPG), which has been proved to be effective in various dynamical systems. The comparison is carried out in OpenAI Gym, which provides multiple control environments for benchmark purposes. Two examples are provided for comparison, i.e., classic Inverted Pendulum and Lunar Lander Continuous Control. From the results of the experiments, we compare these two methods in terms of control strategies and the effectiveness under various initialization conditions. We also examine the learned dynamic model from DKRC with the analytical model derived from the Euler-Lagrange Linearization method, which demonstrates the accuracy in the learned model for unknown dynamics from a data-driven sample-efficient approach.
研究动机与目标
- 比较基于模型的数据驱动控制(DKRC)与无模型强化学习(DDPG)在连续控制任务中的表现。
- 评估DKRC与DDPG在不同初始条件下的样本效率和鲁棒性。
- 通过与基于Euler-Lagrange线性化的解析模型对比,验证DKRC中学习到的动力学模型的准确性。
- 评估在DKRC学习到的升维线性系统中应用模型预测控制(MPC)的性能,特别是在模型不确定性下的表现。
- 证明数据驱动的Koopman表示无需系统方程的先验知识,即可实现高保真度的系统建模。
提出的方法
- 使用深度神经网络学习有限维的Koopman表示,将非线性系统提升至高维线性空间,从而通过模型预测控制(MPC)实现线性控制。
- 采用零阶保持(ZOH)方法对Koopman动力学进行离散化,实现升维系统模型的数值化。
- 利用CVXPY求解MPC中的凸优化问题,借助升维系统线性结构实现实时、鲁棒的控制。
- 仅使用来自倒立摆环境的2,000个数据点训练DKRC框架,以学习Koopman算子的近似。
- 将深度确定性策略梯度(DDPG)算法作为无模型基线,直接在相同具有连续动作空间的环境中端到端训练。
- 通过皮尔逊相关系数(PCC)量化模型相似性,将DKRC学习到的动力学与Euler-Lagrange方法得到的解析线性化结果进行对比。
实验结果
研究问题
- RQ1DKRC在学习非线性动力系统有效控制策略方面,其样本效率与DDPG相比如何?
- RQ2DKRC中学习到的Koopman表示与基于Euler-Lagrange方程推导出的解析线性化动力学在多大程度上一致?
- RQ3与无模型的DDPG相比,基于模型的DKRC在不同初始条件下的表现如何?
- RQ4在存在模型不准确的情况下,应用于DKRC升维线性系统的MPC能否实现鲁棒控制性能?
- RQ5在使用物理信息驱动的基于模型方法(DKRC)与纯粹数据驱动的策略梯度方法(DDPG)之间,可解释性与性能的权衡如何?
主要发现
- DKRC在倒立摆和月球着陆器任务中实现了与DDPG相当的控制性能,但仅需70个训练周期,而DDPG需要50,000个周期。
- DKRC学习到的动力学与解析的Euler-Lagrange线性化结果具有高达0.8926的皮尔逊相关系数,表明其与真实系统动力学高度一致。
- DKRC在约20%的时间内收敛至直立位置,相比Euler-Lagrange MPC方法,表现出显著更快的收敛速度。
- 基于模型的DKRC框架在应对初始条件变化方面比DDPG更具鲁棒性,尤其在处理大初始偏差时表现更优。
- 应用于DKRC学习到的线性模型的MPC控制器对小的模型误差表现出容忍性,证实了基于模型学习中闭环控制的优势。
- 仅使用2,000个数据点,数据驱动的Koopman表示成功捕捉了系统的内在动力学,凸显其样本效率及在实际部署中的潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。