Skip to main content
QUICK REVIEW

[论文解读] Safe Adaptive Learning-based Control for Constrained Linear Quadratic Regulators with Regret Guarantees

Yingying Li, Subhro Das|arXiv (Cornell University)|Oct 31, 2021
Advanced Control Systems Optimization参考文献 42被引用 11
一句话总结

该论文提出了一种多项式时间、基于单轨迹的自适应学习控制算法,用于具有安全保证的约束性线性二次型调节器(LQR),其在模型不确定条件下确保可行性与约束满足,并实现了与已知动态最优安全线性控制器相比的次线性遗憾,遗憾度为$ ilde{O}(T^{2/3})$。

ABSTRACT

We study the adaptive control of an unknown linear system with a quadratic cost function subject to safety constraints on both the states and actions. The challenges of this problem arise from the tension among safety, exploration, performance, and computation. To address these challenges, we propose a polynomial-time algorithm that guarantees feasibility and constraint satisfaction with high probability under proper conditions. Our algorithm is implemented on a single trajectory and does not require system restarts. Further, we analyze the regret of our learning algorithm compared to the optimal safe linear controller with known model information. The proposed algorithm can achieve a $ ilde O(T^{2/3})$ regret, where $T$ is the number of stages and $ ilde O(\cdot)$ absorbs some logarithmic terms of $T$.

研究动机与目标

  • 解决在具有状态和输入约束的未知线性系统中实现安全自适应控制的挑战。
  • 设计一种单轨迹算法,避免系统重启,并以高概率保证可行性与约束满足。
  • 通过最小化与已知模型基准的遗憾,实现接近最优安全线性控制器的性能。
  • 将适用于安全策略更新的慢变性技巧扩展至模型不确定性和时变估计的情形。
  • 提供适用于一般(可能非线性)策略在模型不确定条件下的模型估计误差界。

提出的方法

  • 使用最小二乘估计(LSE)从单条轨迹中递归更新系统模型估计。
  • 应用确定性等价结合鲁棒约束满足方法,以处理模型不确定性并确保约束遵守。
  • 提出SafeTransit算法,通过将慢变性技术扩展至不确定模型,实现安全的策略更新。
  • 采用时间平均化与基于鞅的分析方法,以界定向估计误差与遗憾误差。
  • 通过递归分解遗憾为估计误差与策略误差两部分,利用集中不等式进行分析。
  • 推导出适用于一般非线性策略的通用模型估计误差界,扩展了以往仅限于线性策略的研究结果。

实验结果

研究问题

  • RQ1能否为具有约束的LQR设计一种基于单轨迹的自适应控制算法,使其在模型不确定条件下保证安全与约束满足?
  • RQ2在具有约束的LQR自适应控制中,探索、安全与性能之间的根本权衡是什么?
  • RQ3能否相对于已知模型信息下最优安全线性控制器,实现$ ilde{O}(T^{2/3})$量级的遗憾边界?
  • RQ4当模型估计为时变且不确定时,如何确保安全的策略更新?
  • RQ5在模型不确定条件下,非线性策略的一般模型估计误差界是什么?

主要发现

  • 所提出的算法在满足适当条件时,以高概率保证可行性与约束满足,且无需系统重启。
  • 该算法相对于使用已知模型信息的最优安全线性控制器,实现了$ ilde{O}(T^{2/3})$的遗憾边界。
  • 当与Mayne等人(2005)提出的RMPC策略比较时,该遗憾边界依然成立,表明其相对于鲁棒控制基准具有优异性能。
  • 推导出的模型估计误差界适用于一般且可能非线性策略,扩展了以往仅限于线性策略的研究结果。
  • SafeTransit算法成功地将慢变性技巧推广至不确定模型,实现了在单条轨迹上安全且自适应的策略更新。
  • 分析过程利用了鞅集中不等式与时间平均化技术,以界定向累计遗憾与估计误差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。