[论文解读] Sample Complexity of Linear Quadratic Gaussian (LQG) Control for Output Feedback Systems
本文为在部分可观测系统中学习鲁棒线性二次高斯(LQG)控制器建立了端到端的样本复杂度边界。通过结合非渐近系统辨识与H-infinity有界估计误差,并利用输入-输出参数化(IOP)进行鲁棒控制器综合,该方法实现了LQG性能随模型误差线性退化,与开环稳定系统下全状态LQR学习的最优缩放一致。
This paper studies a class of partially observed Linear Quadratic Gaussian (LQG) problems with unknown dynamics. We establish an end-to-end sample complexity bound on learning a robust LQG controller for open-loop stable plants. This is achieved using a robust synthesis procedure, where we first estimate a model from a single input-output trajectory of finite length, identify an H-infinity bound on the estimation error, and then design a robust controller using the estimated model and its quantified uncertainty. Our synthesis procedure leverages a recent control tool called Input-Output Parameterization (IOP) that enables robust controller design using convex optimization. For open-loop stable systems, we prove that the LQG performance degrades linearly with respect to the model estimation error using the proposed synthesis procedure. Despite the hidden states in the LQG problem, the achieved scaling matches previous results on learning Linear Quadratic Regulator (LQR) controllers with full state observations.
研究动机与目标
- 填补在系统动态未知且状态部分可观测时,学习LQG控制器的理论样本复杂度保证方面的空白。
- 开发一种鲁棒控制综合程序,确保在模型不确定性下保持稳定性和性能,而无需重构完整状态。
- 在存在隐藏状态和输出反馈的挑战下,实现与全状态LQR学习相当的样本复杂度缩放。
- 利用输入-输出参数化(IOP)实现基于量化模型不确定性的凸、可处理的鲁棒控制器设计。
提出的方法
- 使用有限长度的单个输入-输出轨迹,通过非渐近系统辨识技术估计系统模型。
- 利用系统失配的非渐近H-infinity范数边界量化估计误差。
- 应用输入-输出参数化(IOP)将所有稳定控制器表示为凸集,从而实现鲁棒控制设计的凸优化。
- 基于估计模型及其H-infinity不确定性边界设计鲁棒LQG控制器,确保闭环稳定性。
- 证明所得控制器的次优性差距与模型估计误差呈线性关系。
- 通过结合系统辨识误差边界与鲁棒控制性能保证,建立端到端的样本复杂度边界。
实验结果
研究问题
- RQ1我们能否在动态未知且仅使用输出反馈的情况下,为LQG控制建立与全状态LQR学习性能相当的样本复杂度边界?
- RQ2当真实系统模型未知且仅能观测到输出轨迹时,如何确保鲁棒稳定性和性能?
- RQ3在部分可观测的LQG问题中,模型估计误差与控制器次优性之间的最优权衡是什么?
- RQ4能否将基于IOP的凸鲁棒控制综合与非渐近系统辨识有效结合,以获得紧致的性能边界?
主要发现
- 所提出的鲁棒控制器综合程序确保LQG性能随模型估计误差线性退化,次优性差距为O(ε),其中ε为估计误差的H-infinity范数。
- 对于开环稳定系统,该方法实现了与全状态LQR学习相同的样本复杂度缩放,即O(N⁻¹),与文献中已知的最佳结果一致。
- 使用输入-输出参数化(IOP)可实现鲁棒控制器设计的凸优化,使综合过程具有可处理性和可扩展性。
- 对系统估计误差的非渐近H-infinity边界在连接系统辨识误差与控制器性能退化方面起着关键作用。
- 该方法无需重构内部状态空间表示,可直接利用输入-输出数据进行控制器学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。