[论文解读] Infinite-Horizon Differentiable Model Predictive Control
该论文提出了一种可微分的、无限时域线性二次MPC框架,通过离散时间代数 Riccati 方程(DARE)确保闭环稳定性。通过推导DARE解的解析梯度,该方法实现了模仿学习中的基于梯度的训练,同时通过增广拉格朗日法和预稳定控制实现硬约束,实现了在短预测时域下的稳定、鲁棒控制。
This paper proposes a differentiable linear quadratic Model Predictive Control (MPC) framework for safe imitation learning. The infinite-horizon cost is enforced using a terminal cost function obtained from the discrete-time algebraic Riccati equation (DARE), so that the learned controller can be proven to be stabilizing in closed-loop. A central contribution is the derivation of the analytical derivative of the solution of the DARE, thereby allowing the use of differentiation-based learning methods. A further contribution is the structure of the MPC optimization problem: an augmented Lagrangian method ensures that the MPC optimization is feasible throughout training whilst enforcing hard constraints on state and input, and a pre-stabilizing controller ensures that the MPC solution and derivatives are accurate at each iteration. The learning capabilities of the framework are demonstrated in a set of numerical studies.
研究动机与目标
- 开发一种可微分的MPC框架,以在安全关键系统中实现模仿学习的闭环稳定性。
- 通过推导DARE解的解析导数,实现MPC代价函数的基于梯度的优化。
- 在训练过程中通过增广拉格朗日法稳健地强制执行状态和输入的硬约束。
- 通过预稳定线性反馈控制器改善MPC优化的数值精度和条件性。
- 证明短有限预测时域可实现无限时域性能和稳定性保证。
提出的方法
- 无限时域代价函数由离散时间代数 Riccati 方程(DARE)的解导出,确保闭环中的稳定特性。
- 利用矩阵微积分推导出DARE解的解析导数,实现对稳态解的反向传播。
- 应用预稳定线性状态反馈控制器,以改善QP的条件性和MPC解的数值精度。
- MPC优化采用增广拉格朗日法,强制执行对状态和输入的硬约束,确保训练过程中的可行性。
- 总控制输入作为预稳定反馈的扰动进行计算,确保稳定性并实现精确的梯度计算。
- 使用可微分的二次规划(QP)求解器,实现通过反向传播对MPC代价矩阵的端到端训练。
实验结果
研究问题
- RQ1离散时间代数 Riccati 方程(DARE)的解能否实现完全可微分,以支持MPC中基于梯度的学习?
- RQ2在训练过程中如何强制执行对状态和输入的硬约束,同时保持可行性与收敛性?
- RQ3MPC中的短有限预测时域能否实现无限时域的稳定性与性能保证?
- RQ4预稳定控制器在改善MPC优化的数值精度和条件性以及梯度计算方面发挥什么作用?
- RQ5在使用基于DARE的终端代价的可微分MPC时,模仿学习在多大程度上能恢复专家MPC控制器的真实代价函数?
主要发现
- 所提方法成功学习了质量-弹簧-阻尼系统的真实代价矩阵 $ Q $ 和 $ R $,模仿损失收敛至较低值,尤其在较长预测时域($ N = 15, 20 $)时表现更优。
- 对于车辆队列模型,所有学习到的控制器均满足车辆间距离的硬约束,并收敛至正确的稳态间距,即使在 $ N = 5 $ 时亦然。
- 当 $ N = 20 $ 时预测误差最小化,表明长期预测准确且无限时域代价被有效利用;而当约束活跃时,较短时域的误差较大。
- DARE解的解析导数实现了稳定且精确的梯度计算,使两种测试案例均能收敛至局部极小值。
- 增广拉格朗日法确保了在整个训练过程中严格满足约束条件并保持问题可行性,即使在约束活跃时亦然。
- 预稳定控制器显著改善了QP的条件性,提升了MPC解及其梯度的精度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。