Skip to main content
QUICK REVIEW

[论文解读] Enforcing robust control guarantees within neural network policies

Priya L. Donti, Melrose Roderick|arXiv (Cornell University)|Nov 16, 2020
Adversarial Robustness in Machine Learning参考文献 41被引用 12
一句话总结

该论文提出了一种方法,通过集成基于可微凸优化的投影层,将经典鲁棒控制中的可证明鲁棒性保证嵌入深度神经网络策略中。该方法在通过深度强化学习训练非线性高性能控制器的同时,保持了在最坏情况扰动下的稳定性,其在平均情况性能和最坏情况鲁棒性方面均优于传统鲁棒控制方法和非鲁棒深度强化学习方法。

ABSTRACT

When designing controllers for safety-critical systems, practitioners often face a challenging tradeoff between robustness and performance. While robust control methods provide rigorous guarantees on system stability under certain worst-case disturbances, they often yield simple controllers that perform poorly in the average (non-worst) case. In contrast, nonlinear control methods trained using deep learning have achieved state-of-the-art performance on many control tasks, but often lack robustness guarantees. In this paper, we propose a technique that combines the strengths of these two approaches: constructing a generic nonlinear control policy class, parameterized by neural networks, that nonetheless enforces the same provable robustness criteria as robust control. Specifically, our approach entails integrating custom convex-optimization-based projection layers into a neural network-based policy. We demonstrate the power of this approach on several domains, improving in average-case performance over existing robust control methods and in worst-case stability over (non-robust) deep RL methods.

研究动机与目标

  • 解决安全关键系统控制策略中鲁棒性与性能之间的权衡问题。
  • 使基于深度神经网络的控制器能够继承经典鲁棒控制方法中的可证明鲁棒性保证。
  • 开发一种可训练的非线性策略类别,使其在不牺牲平均情况性能的前提下,对最坏情况扰动保持稳定。
  • 将基于凸优化的投影层集成到神经网络策略中,以强制执行鲁棒控制约束。
  • 在多种控制领域(包括小车间、四旋翼飞行器和微电网系统)中展示该方法的有效性。

提出的方法

  • 该方法以一个名义上的深度神经网络策略作为基础控制器。
  • 应用可微的、基于凸优化的投影层,将网络输出映射到满足鲁棒控制约束的动作集合上。
  • 通过线性矩阵不等式(LMI)或系统不确定性非线性动态包含(NLDI)模型推导出的条件,强制实现稳定性。
  • 投影层被设计为可微,从而支持通过标准深度强化学习算法进行端到端训练。
  • 该方法支持多种鲁棒控制框架,包括H∞控制和线性微分包含(LDI)模型。
  • 通过多面体或范数有界的线性化(PLDI/NLDI)近似系统动力学,该方法可应用于线性和非线性系统。

实验结果

研究问题

  • RQ1是否可以训练深度神经网络策略,使其在实现高平均性能的同时,具备可证明的最坏情况鲁棒性?
  • RQ2如何在不牺牲可训练性的前提下,将鲁棒控制保证嵌入非线性、数据驱动的策略中?
  • RQ3可微投影层在多大程度上能够实现在深度强化学习框架内对鲁棒控制稳定性准则的强制执行?
  • RQ4在对抗性扰动下,该方法的性能与传统鲁棒控制和非鲁棒深度强化学习方法相比如何?
  • RQ5该方法是否可泛化至多种控制任务,包括非线性和时变系统?

主要发现

  • 所提出的方法在平均情况性能上优于传统鲁棒控制方法(如鲁棒LQR),同时在最坏情况扰动下仍保持稳定。
  • 在小车间任务中,该方法在对抗性扰动下保持稳定,而无鲁棒性的深度强化学习方法则变得不稳定或损失显著增加。
  • 在四旋翼飞行器和微电网任务中,该方法在最坏情况扰动下表现出稳定性能,且在稳定性和平均损失方面均优于非鲁棒深度强化学习基线方法。
  • 可微投影层的集成实现了端到端训练,同时保持了可证明的鲁棒性,该结论通过基于LMI的稳定性条件得到验证。
  • 通过使用数值推导的、可能更宽松但更实用的不确定性边界,该方法获得了比标准NLDI转换方法更紧致的鲁棒性边界。
  • 实验结果表明,该方法在平均情况场景下优于鲁棒LQR,且未牺牲最坏情况下的稳定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。