Skip to main content
QUICK REVIEW

[论文解读] Safe and Near-Optimal Policy Learning for Model Predictive Control using Primal-Dual Neural Networks

Xiaojing Zhang, Monimoy Bujarbaruah|arXiv (Cornell University)|Jun 19, 2019
Advanced Control Systems Optimization参考文献 33被引用 6
一句话总结

本文提出了一种原始-对偶神经网络框架,用于在时变线性参数系统中学习安全、近似最优的模型预测控制(MPC)律。通过联合训练一个用于控制的原始策略和一个用于次优性认证的对偶策略,该方法实现了基于随机验证的在线可行性与最优性保证,从而在仅损失极少性能的前提下,相较于最先进求解器实现了高达100倍的速度提升。

ABSTRACT

In this paper, we propose a novel framework for approximating the explicit MPC law for linear parameter-varying systems using supervised learning. In contrast to most existing approaches, we not only learn the control policy, but also a "certificate policy", that allows us to estimate the sub-optimality of the learned control policy online, during execution-time. We learn both these policies from data using supervised learning techniques, and also provide a randomized method that allows us to guarantee the quality of each learned policy, measured in terms of feasibility and optimality. This in turn allows us to bound the probability of the learned control policy of being infeasible or suboptimal, where the check is performed by the certificate policy. Since our algorithm does not require the solution of an optimization problem during run-time, it can be deployed even on resource-constrained systems. We illustrate the efficacy of the proposed framework on a vehicle dynamics control problem where we demonstrate a speedup of up to two orders of magnitude compared to online optimization with minimal performance degradation.

研究动机与目标

  • 为解决在资源受限系统上部署MPC的挑战,通过快速学习策略替代在线优化。
  • 在不依赖昂贵在线优化或训练期间施加严格约束的前提下,确保学习控制策略的安全性与性能。
  • 提供一种随机验证框架,以概率方式界定运行时学习策略的不可行性或次优性风险。
  • 通过具有可证明保证的函数逼近,将显式MPC近似方法扩展至线性参数时变(LPV)系统。
  • 通过将昂贵优化与运行时执行解耦,实现MPC在嵌入式平台上的部署。

提出的方法

  • 使用离线生成的数据,通过监督学习训练一个原始神经网络策略,以近似显式MPC控制律。
  • 训练一个对偶神经网络策略,以估计对偶间隙,从而为原始策略输出的次优性与可行性提供在线边界。
  • 利用基于浓度不等式的样本量边界,通过随机验证对两种策略的质量进行概率性认证。
  • 应用凸优化中的对偶理论,将对偶策略定义为最优代价的估计器,从而实现实时性能监控。
  • 在运行时部署训练好的原始-对偶网络对:原始策略输出控制动作,对偶策略检查其质量;若检查失败,则激活备用控制器。
  • 采用基于ReLU的深度神经网络进行函数逼近,使该框架兼容任意可微架构,并可扩展至复杂系统。

实验结果

研究问题

  • RQ1所学习的MPC控制策略是否既能快速评估,又能在运行时被证明是安全且近似最优的?
  • RQ2能否训练一个对偶神经网络,以提供针对原始控制策略的在线、数据驱动的次优性与可行性证书?
  • RQ3使用有限样本量的随机验证能否以高概率保证学习到的MPC策略性能?
  • RQ4所提出的原始-对偶学习框架是否在实现相比在线优化数量级的速度提升的同时,仍保持近似最优性能?
  • RQ5该框架能否扩展至系统矩阵依赖于时变参数的线性参数时变系统?

主要发现

  • 与Gurobi相比,该方法在2016年款MacBook上实现了平均超过65倍的速度提升,与Mosek相比则超过100倍,DNN-ReLU策略的平均推理时间为0.023 ms。
  • 在100,000组测试参数下,对偶间隙(次优性度量)的中位数为0.00083,最差情况下的对偶间隙为1.2732,表明其具有极强的近似最优性。
  • 当对偶间隙超过阈值γ=1时,经验违规概率为0.005%,远低于目标值ε=1%,证实了理论样本量边界的保守性。
  • 对偶策略成功实现实时检测次优或不可行动作,并在需要时触发备用控制器。
  • 该框架表现出鲁棒性与一致性,DNN推理时间的标准差仅为0.0023 ms,优于Gurobi和Mosek的性能波动。
  • 该方法具有通用性,适用于任何函数逼近器(包括深度神经网络),并可在无需在线优化的情况下实现MPC在嵌入式系统中的安全部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。