Skip to main content
QUICK REVIEW

[论文解读] Learning Convex Optimization Control Policies

Akshay Agrawal, Shane Barratt|arXiv (Cornell University)|Dec 19, 2019
Advanced Control Systems Optimization参考文献 70被引用 9
一句话总结

本文提出一种基于近似梯度下降的自动化方法,用于调节凸优化控制策略(COCPs)的参数,利用凸优化解的高效导数。该方法通过在真实控制任务(如供应链管理)中将成本降低22.35%(在200次迭代训练中),显著提升了性能,证明了该方法在无需性能指标凸性假设下,具备鲁棒且可扩展的参数调优能力。

ABSTRACT

Many control policies used in various applications determine the input or action by solving a convex optimization problem that depends on the current state and some parameters. Common examples of such convex optimization control policies (COCPs) include the linear quadratic regulator (LQR), convex model predictive control (MPC), and convex control-Lyapunov or approximate dynamic programming (ADP) policies. These types of control policies are tuned by varying the parameters in the optimization problem, such as the LQR weights, to obtain good performance, judged by application-specific metrics. Tuning is often done by hand, or by simple methods such as a crude grid search. In this paper we propose a method to automate this process, by adjusting the parameters using an approximate gradient of the performance metric with respect to the parameters. Our method relies on recently developed methods that can efficiently evaluate the derivative of the solution of a convex optimization problem with respect to its parameters. We illustrate our method on several examples.

研究动机与目标

  • 自动化调节广泛应用于控制系统中的凸优化控制策略(COCPs)的参数,这些策略传统上依赖人工或网格搜索进行调优。
  • 开发一种可扩展的、可微分的方法,通过性能指标相对于策略参数的近似梯度,优化COCP参数。
  • 通过利用凸优化解映射的固有可微性,实现高效、安全且稳定的参数调优。
  • 将该方法扩展至状态估计和预测任务,适用于涉及COCPs的场景。
  • 在真实世界应用(如供应链管理与模型预测控制)中验证该方法的有效性。

提出的方法

  • 该方法使用投影随机梯度下降,通过计算性能指标相对于参数的近似梯度,来优化COCP参数。
  • 其依赖于近期发展的技术,高效计算凸优化问题解相对于其参数的导数。
  • 该方法结合自动微分与凸优化问题的敏感性分析,实现通过解映射的反向传播。
  • 性能指标通过闭环系统的仿真进行评估,梯度通过在扰动上进行蒙特卡洛采样来估计。
  • 该方法适用于任何COCP,包括LQR、MPC和ADP策略,通过将它们的参数化优化问题视为可微函数来处理。
  • 支持多组件的联合调优,例如MPC中的控制器参数与扰动预测模型。

实验结果

研究问题

  • RQ1我们能否通过基于梯度的优化实现COCP的自动化调优,从而避免人工或网格搜索?
  • RQ2当策略由求解凸优化问题定义时,如何高效计算性能指标相对于COCP参数的梯度?
  • RQ3与基线调优方法相比,该方法在真实世界控制与供应链系统中的性能提升程度如何?
  • RQ4该方法能否扩展至控制策略与状态估计算法或预测模型的联合调优?
  • RQ5当应用于非凸或启发式控制策略时,即使解为局部最优,该方法在实际性能上能带来多大提升?

主要发现

  • 在供应链控制任务中,该方法在200次迭代内将平均成本降低了22.35%,从-0.279降至-0.341。
  • 调优后的策略学会了对供应商成本高或消费者需求低的节点施加更高的存储惩罚,这一行为在学习到的$ S^T S $和$ q $参数中得到体现。
  • 该方法成功调优了一个包含$n=4$个节点和$T=20$个时间步的供应链策略,证明了其在非平凡系统中的可扩展性。
  • 即使性能指标在参数空间中非凸,该方法仍实现了稳定且有意义的性能提升,表明其对局部最优的鲁棒性。
  • 凸优化问题的解映射具有可微性,从而支持高效的梯度计算,并可与自动微分框架无缝集成。
  • 该方法具有通用性,适用于广泛的COCP,包括LQR、MPC和ADP,也适用于状态估计与预测任务。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。