Skip to main content
QUICK REVIEW

[论文解读] Imitation Learning with Stability and Safety Guarantees

He Yin, Peter Seiler|arXiv (Cornell University)|Dec 16, 2020
Fault Detection and Control Systems参考文献 23被引用 7
一句话总结

本文提出了一种新颖的模仿学习框架,通过将凸的李雅普诺夫稳定性条件与局部二次约束整合到学习目标中,实现了对神经网络控制器的可证明稳定性和安全性保证。该方法通过基于ADMM的优化,同时最小化模仿损失并最大化吸引域区域,展示了在倒立摆、飞机和车辆控制任务中相较于专家策略的更强鲁棒性。

ABSTRACT

A method is presented to learn neural network (NN) controllers with stability and safety guarantees through imitation learning (IL). Convex stability and safety conditions are derived for linear time-invariant plant dynamics with NN controllers by merging Lyapunov theory with local quadratic constraints to bound the nonlinear activation functions in the NN. These conditions are incorporated in the IL process, which minimizes the IL loss, and maximizes the volume of the region of attraction associated with the NN controller simultaneously. An alternating direction method of multipliers based algorithm is proposed to solve the IL problem. The method is illustrated on an inverted pendulum system, aircraft longitudinal dynamics, and vehicle lateral dynamics.

研究动机与目标

  • 解决深度模仿学习在非线性控制策略中缺乏稳定性与安全性保证的问题。
  • 为神经网络控制的线性时不变(LTI)系统,开发基于李雅普诺夫的稳定性与安全性条件的可处理凸公式。
  • 将稳定性与安全性约束直接整合到模仿学习目标中,以平衡策略精度与鲁棒性。
  • 实现神经网络控制器的吸引域区域大于专家策略,同时保持高模仿保真度。

提出的方法

  • 通过结合李雅普诺夫理论与基于局部扇区的二次约束,推导出用于有界ReLU和tanh激活函数的凸稳定性与安全性条件,以限制深度神经网络中的激活函数。
  • 提出一个双目标优化问题,以最小化模仿损失并最大化吸引域(ROA)的内近似体积。
  • 通过环路变换将先前工作中非凸的稳定性条件凸化,从而在训练过程中实现高效约束强制。
  • 采用交替方向乘子法(ADMM)算法求解带约束的模仿学习问题,保证收敛性。
  • 将神经网络控制器参数化为具有tanh或ReLU激活函数的两层前馈网络,并将安全性约束表述为对称多面体状态集。
  • 通过正定矩阵变量对吸引域的椭球内近似进行参数化,以实现可处理的体积最大化。

实验结果

研究问题

  • RQ1我们能否推导出保证线性时不变系统中神经网络控制器稳定性与安全性的凸且可处理的条件?
  • RQ2如何在不牺牲策略精度的前提下,将稳定性与安全性约束整合到模仿学习目标中?
  • RQ3所提方法能否生成吸引域区域大于专家策略的神经网络控制器?
  • RQ4在实际控制任务中,模仿精度与吸引域大小之间的权衡在多大程度上影响控制器性能?

主要发现

  • 在倒立摆和飞机纵向动力学的实例中,所提方法生成的神经网络控制器的吸引域(ROA)内近似体积大于专家LQR策略。
  • 在GTM飞机实例中,当η₂ = 20(更高ROA强调)时,神经网络控制器的ROA体积大于η₂ = 5时的体积,尽管模仿精度有所降低。
  • 在车辆横向控制实例中,当η₂ = 500时,神经网络控制器的ROA体积为663(det(Q₁)),超过η₂ = 100时的543,证实了更高η₂值可获得更大的ROA。
  • 尽管ROA更大,但η₂ = 500的神经网络控制器表现出更高的模仿误差,Frobenius范数为0.08,而η₂ = 100时为0.14,证实了鲁棒性与精度之间的权衡。
  • ADMM算法在所有实验中均在20次迭代内收敛,证明了计算上的可处理性。
  • 神经网络控制器在笔记本电脑上每500步耗时0.011–0.012秒,远快于显式模型预测控制(MPC)律的0.38秒,突显了其在实时应用中的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。