[论文解读] Learning convex bounds for linear quadratic control policy synthesis
该论文提出了一种贝叶斯优化方法,通过在未知系统参数的后验分布上最小化期望LQR代价,从有限数据中学习鲁棒的线性二次型控制策略。结合序列凸规划与主要化-最小化原理,该方法确保了局部收敛性与鲁棒稳定性,在模拟和真实倒立摆实验中均优于最坏情况法与名义法,展现出高数据效率以及在不同系统维数下的稳定一致表现。
Learning to make decisions from observed data in dynamic environments remains a problem of fundamental importance in a number of fields, from artificial intelligence and robotics, to medicine and finance. This paper concerns the problem of learning control policies for unknown linear dynamical systems so as to maximize a quadratic reward function. We present a method to optimize the expected value of the reward over the posterior distribution of the unknown system parameters, given data. The algorithm involves sequential convex programing, and enjoys reliable local convergence and robust stability guarantees. Numerical simulations and stabilization of a real-world inverted pendulum are used to demonstrate the approach, with strong performance and robustness properties observed in both.
研究动机与目标
- 开发一种在未知线性动态系统中实现数据高效控制策略学习并保证鲁棒稳定性的方法。
- 在系统参数的后验分布上优化期望LQR代价,平衡性能与鲁棒性。
- 通过利用概率不确定性量化,克服最坏情况鲁棒控制的保守性。
- 通过凸近似确保所学策略的可靠局部收敛性与稳定性。
- 在模拟与真实世界控制任务中展示出色性能与鲁棒性。
提出的方法
- 该方法采用贝叶斯框架,从观测数据中对系统参数的不确定性进行建模,形成后验分布。
- 应用主要化-最小化(MM)原理,构建期望LQR代价的凸上界,从而实现序列凸优化。
- 通过半定规划求解这些凸近似,确保计算可行性与局部收敛性。
- 通过引入源自后验不确定性集的凸约束,保证鲁棒稳定性。
- 使用后验分布的蒙特卡洛采样来近似期望代价,并验证在合理系统模型下的稳定性。
- 在模拟与真实硬件实验中,将该方法与最坏情况法、名义法以及基于$H_2/H_∞$的方法进行对比。
实验结果
研究问题
- RQ1我们能否学习到一种控制策略,在模型不确定性下既能优化期望LQR性能,又能保证鲁棒稳定性?
- RQ2在高维系统中,期望代价优化的性能与稳定性相较于最坏情况或名义策略设计方法如何?
- RQ3贝叶斯不确定性量化在控制策略学习中能在多大程度上提升数据效率?
- RQ4当数据稀缺或系统维数增加时,所提方法是否仍能保持可行性与稳定性?
- RQ5在真实硬件中,所提方法的控制信号与系统响应与基线方法相比如何?
主要发现
- 在所有测试的系统维数下,该方法在95%后验置信区域采样的所有模型中均实现了100%的稳定,包括$n_x = 12$的情况,而最坏情况方法在46%的案例中失败。
- 对于$n_x = 3$,当$M \geq 800$个蒙特卡洛样本时,该方法的中位数不稳定性率仅为0.10%,表明即使在有限采样下也具有鲁棒性。
- 在旋转倒立摆的真实世界实验中,该方法在低数据环境下实现了比基线方法更低的LQR代价与更小的控制信号幅值。
- 当最坏情况法与$H_2/H_\infty$方法因高不确定性而变得不可行时,该方法仍保持可行与稳定。
- 性能快速收敛,仅需10次滚动试验即在真实硬件上实现稳定,展现出高数据效率。
- 对于$n_x = 12$,该方法的次优性仅比最优策略高0.27%,同时保持了鲁棒性与可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。