[论文解读] Near-Optimal Rapid MPC using Neural Networks: A Primal-Dual Policy Learning Framework
本文提出了一种原始-对偶策略学习框架,利用深度神经网络近似线性参数变化系统的显式模型预测控制(MPC)律,以高概率确保可行性与近似最优性。通过联合学习原始控制策略与对偶最优性证书,该方法可在推理时实现近实时的次优性验证,实验中在台式机上实现最高62倍加速,在车载电子控制单元(ECU)上实现10倍加速,同时保持近似最优性能,且在实验中零次激活备用控制器。
In this paper, we propose a novel framework for approximating the explicit MPC policy for linear parameter-varying systems using supervised learning. Our learning scheme guarantees feasibility and near-optimality of the approximated MPC policy with high probability. Furthermore, in contrast to most existing approaches that only learn the MPC policy, we also learn the "dual policy", which enables us to keep a check on the approximated MPC's optimality online during the control process. If the check deems the control input from the approximated MPC policy safe and near-optimal, then it is applied to the plant, otherwise a backup controller is invoked, thus filtering out (severely) suboptimal control inputs. The backup controller is only invoked with a bounded (low) probability, where the exact probability level can be chosen by the user. Since our framework does not require solving any optimization problem during the control process, it enables the deployment of MPC on resource-constrained systems. Specifically, we illustrate the utility of the proposed framework on a vehicle dynamics control problem. Compared to online optimization methods, we demonstrate a speedup of up to 62x on a desktop computer and 10x on an automotive-grade electronic control unit, while maintaining a high control performance.
研究动机与目标
- 为解决在资源受限的嵌入式系统(如车载ECU)上部署计算密集型MPC的挑战。
- 开发一种基于学习的MPC近似方法,以高概率保证可行性与近似最优性,克服现有函数逼近方法的局限性。
- 引入一种对偶策略,实现实时、在线的原始策略次优性验证,确保部署过程中的安全性。
- 通过消除在线优化的计算开销,降低运行时的计算负担,实现在低功耗硬件上的实时控制。
- 在具有高速度和高精度要求的真实车辆动力学控制应用中,验证该框架的有效性。
提出的方法
- 该框架将原始-对偶策略学习表述为一个受训练数据集(来自显式MPC的状态-控制对)约束的随机优化问题。
- 利用统计学习理论与场景优化,推导出确保所学策略具有高概率可行性与近似最优性的样本量边界。
- 对偶策略源自MPC优化问题的对偶变量,作为原始策略输出次优性的实时证书。
- 对偶策略计算开销轻量,支持在线验证:若次优性超过用户定义的阈值,则调用备用控制器。
- 原始策略以深度神经网络(DNN)或基函数的线性组合形式实现,通过在离线MPC解上进行监督学习进行训练。
- 该方法确保备用控制器激活的概率有界,且可由用户调节,从而在不牺牲速度的前提下提供安全性保障。
实验结果
研究问题
- RQ1能否保证基于神经网络的显式MPC近似在高概率下具有可行性与近似最优性?
- RQ2能否学习一种对偶策略,在不求解优化问题的前提下实现实时、在线的原始策略次优性验证?
- RQ3所提出的框架能否在嵌入式系统上实现显著的加速,同时保持高性能控制?
- RQ4在实际应用中,对偶策略的验证能力如何降低对备用控制器的依赖?
- RQ5在实时MPC部署中,近似精度、计算效率与内存使用之间的权衡关系如何?
主要发现
- 所提框架在台式机上实现了相比CVXGEN求解器高达62倍的加速,在车载级电子控制单元(ECU)上实现了10倍加速。
- 在ECU上,DNN-ReLU控制器的平均计算时间为1.8 ms,支持100 Hz的实时运行,而CVXGEN需18.7 ms。
- DNN-ReLU控制器实现了仅1.1%的平均相对原始次优性,证实了其在实际应用中的近似最优性。
- 在伯克利自动驾驶汽车的完整12秒变道实验中,备用控制器从未被激活,表明其具有高度的可靠性和安全性。
- 该框架将DNN-ReLU模型的内存占用降低至114 KB,显著低于CVXGEN的322 KB,使其更适合嵌入式部署。
- 理论分析表明,备用控制器激活的概率有界,且可由用户调节,从而在高置信度下确保安全性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。