Skip to main content
QUICK REVIEW

[论文解读] Online switching control with stability and regret guarantees

Yingying Li, James A. Preiss|arXiv (Cornell University)|Jan 20, 2023
Advanced Bandit Algorithms ResearchDecision Sciences被引用 3
一句话总结

本文提出了一种在线切换控制算法,适用于具有未知动态特性和时变成本的系统,使用有限数量的候选控制器(其中一些可能不稳定),同时保证有限增益稳定性以及相对于最佳稳定控制器的次线性遗憾。该方法结合了自适应切换与稳定性感知探索,即使在初始时未知稳定控制器的情况下,也能确保鲁棒性能。

ABSTRACT

This paper considers online switching control with a finite candidate controller pool, an unknown dynamical system, and unknown cost functions. The candidate controllers can be unstabilizing policies. We only require at least one candidate controller to satisfy certain stability properties, but we do not know which one is stabilizing. We design an online algorithm that guarantees finite-gain stability throughout the duration of its execution. We also provide a sublinear policy regret guarantee compared with the optimal stabilizing candidate controller. Lastly, we numerically test our algorithm on quadrotor planar flights and compare it with a classical switching control algorithm, falsification-based switching, and a classical multi-armed bandit algorithm, Exp3 with batches.

研究动机与目标

  • 解决具有未知非线性动态特性和时变成本函数的在线切换控制问题。
  • 即使仅有一个候选控制器是稳定的,且该控制器事先未知,也确保有限增益稳定性。
  • 与最优稳定候选控制器相比,实现次线性策略遗憾。
  • 设计一种实用算法,在不确定性下平衡稳定性探索与性能优化。
  • 在真实系统动力学(如四旋翼平面飞行)上验证该方法,并与经典基准进行对比。

提出的方法

  • 该算法使用有限数量的候选控制器(包括可能不稳定的策略),并根据实时反馈动态切换这些控制器。
  • 引入一种稳定性感知探索机制,优先选择可能维持系统稳定性的控制器,利用至少一个候选控制器是稳定的这一假设。
  • 采用遗憾最小化框架,将性能与事后最优稳定控制器进行比较。
  • 基于李雅普诺夫的稳定性分析确保在整个控制时域内实现有限增益稳定性,即使在探索过程中也成立。
  • 该算法设计为自适应且在线,实时更新控制器选择,无需系统模型知识。
  • 整合了在线学习与鲁棒控制的原理,结合了稳定性保证与性能遗憾边界。

实验结果

研究问题

  • RQ1当仅有一个候选控制器是稳定控制器且该控制器事先未知时,在线切换控制算法能否保证有限增益稳定性?
  • RQ2在存在未知动态特性和时变成本的情况下,此类算法能否实现相对于最优稳定控制器的次线性遗憾?
  • RQ3在真实系统中,该算法在性能与稳定性方面相较于经典切换控制和多臂赌博机方法表现如何?
  • RQ4在具有不稳定候选策略的在线控制中,稳定性探索与性能优化之间的权衡是什么?
  • RQ5该算法能否在不事先掌握系统模型或成本函数的情况下维持稳定性和性能?

主要发现

  • 所提出的算法保证在整个控制时域内实现有限增益稳定性,即使稳定控制器事先未知。
  • 该算法相对于最优稳定候选控制器实现了次线性策略遗憾,表明长期性能接近最佳可能选择。
  • 四旋翼平面飞行的数值实验表明,该算法在稳定性和成本最小化方面优于基于 falsification 的切换方法和 Exp3 赌博机算法。
  • 该方法通过自适应切换有效识别并利用稳定控制器,即使初始控制器不稳定也能实现。
  • 在具有过程噪声的一般非线性动态下,该稳定性保证成立,且无需完整系统模型知识。
  • 在具有时变成本函数的动态环境中,该算法保持了鲁棒性与高性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。