[论文解读] Learning Constrained Adaptive Differentiable Predictive Control Policies With Guarantees
本文提出可微分预测控制(DPC),一种通过自动微分计算通过可微闭环动态模型的直接策略梯度,以学习线性系统的约束神经控制策略的方法。该方法实现了稳定、满足约束的策略的离线无监督训练,并提供概率性能保证,在可扩展性、样本效率和计算速度方面优于隐式、显式和近似MPC,且无需专家示范。
We present differentiable predictive control (DPC), a method for learning constrained neural control policies for linear systems with probabilistic performance guarantees. We employ automatic differentiation to obtain direct policy gradients by backpropagating the model predictive control (MPC) loss function and constraints penalties through a differentiable closed-loop system dynamics model. We demonstrate that the proposed method can learn parametric constrained control policies to stabilize systems with unstable dynamics, track time-varying references, and satisfy nonlinear state and input constraints. In contrast with imitation learning-based approaches, our method does not depend on a supervisory controller. Most importantly, we demonstrate that, without losing performance, our method is scalable and computationally more efficient than implicit, explicit, and approximate MPC. Under review at IEEE Transactions on Automatic Control.
研究动机与目标
- 开发一种可扩展的可微分方法,用于在无需专家示范或在线优化的情况下学习显式、约束控制策略。
- 为学习到的神经控制策略提供闭环稳定性和约束满足的概率保证。
- 克服传统MPC的计算局限性和模型无关强化学习在约束控制场景下的数据低效性。
- 利用自动微分实现系统动态和控制策略的端到端学习。
- 与隐式、显式和近似MPC方法相比,展示在样本效率、训练速度和执行时间方面的优越性能。
提出的方法
- 该方法使用自动微分(AD)将模型预测控制(MPC)问题建模为可微分计算图,以反向传播通过MPC损失和约束惩罚。
- 通过随机梯度下降在离线状态下训练神经控制策略,利用在预测时域内系统轨迹计算的直接策略梯度。
- 将闭环系统动态建模为可微分神经网络,实现通过控制策略和系统模型的端到端反向传播。
- 基于采样的系统轨迹,利用Hoeffding不等式推导出稳定性与约束满足的概率保证。
- 通过收缩条件和Banach不动点定理应用于具有神经网络策略的线性系统,确保稳定性。
- 通过学习显式、闭式控制策略避免在线优化,实现快速推理并降低内存使用。
实验结果
研究问题
- RQ1可微分编程能否用于在无需监督控制器的情况下,为线性系统学习显式、约束控制策略?
- RQ2所提方法能否在不依赖于实际模型匹配的情况下,提供闭环稳定性和约束满足的概率保证?
- RQ3与基于模仿学习的近似MPC相比,DPC方法在样本效率和训练速度方面表现如何?
- RQ4与基于多参数规划的显式MPC相比,DPC方法是否具有更高的可扩展性?
- RQ5与隐式MPC相比,DPC方法是否在降低计算和内存开销的同时保持性能?
主要发现
- DPC在数据有限的情况下,为不稳定线性系统学习到了性能与LQR和MPC相当的稳定神经控制策略。
- DPC在样本效率方面优于基于模型的深度强化学习,收敛到最优性能所需的训练样本更少。
- DPC的训练速度优于基于模仿学习的近似MPC,显著缩短了训练时间,同时保持或提升了策略质量。
- DPC的执行速度优于依赖实时优化求解器的隐式MPC。
- 与显式MPC相比,DPC显著减少了内存占用,使其在更大系统中更具可扩展性。
- 通过经验风险评估验证了约束满足和稳定性的概率保证,DPC在5,000个训练样本上实现了97.9%的平均性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。