[论文解读] Regret Lower Bounds for Learning Linear Quadratic Gaussian Systems
本文为未知线性二次高斯(LQG)系统的自适应控制建立了信息论意义上的后悔下界,证明了后悔的规模为 Ω(√T),且其行为关键取决于系统理论特性,如可控制性、可观察性和格拉米安结构。下界表明,可控制性或可观察性较差的系统在学习控制方面本质上更困难,且在系统理论常数方面的缩放关系优于先前工作。
TWe establish regret lower bounds for adaptively controlling an unknown linear Gaussian system with quadratic costs. We combine ideas from experiment design, estimation theory and a perturbation bound of certain information matrices to derive regret lower bounds exhibiting scaling on the order of magnitude $\sqrt{T}$ in the time horizon $T$. Our bounds accurately capture the role of control-theoretic parameters and we are able to show that systems that are hard to control are also hard to learn to control; when instantiated to state feedback systems we recover the dimensional dependency of earlier work but with improved scaling with system-theoretic constants such as system costs and Gramians. Furthermore, we extend our results to a class of partially observed systems and demonstrate that systems with poor observability structure also are hard to learn to control.
研究动机与目标
- 建立未知线性高斯系统在二次代价下的自适应控制性能的理论极限。
- 量化系统理论特性(如可控制性和可观察性)如何影响学习控制的难度。
- 推导能准确反映系统参数(包括格拉米安和代价矩阵)缩放关系的后悔下界。
- 将结果扩展至部分可观测系统,表明可观察性差也会增加学习难度。
- 证明在一般情况下,即使测量噪声为满秩,也无法实现对数后悔,除非满足更强的假设。
提出的方法
- 结合实验设计、估计理论和信息矩阵扰动分析的工具,推导出下界。
- 利用费雪信息矩阵的扰动界,将估计不确定性与控制后悔联系起来。
- 应用极小化极大框架,在参数邻域 B(θ, ε) 上分析后悔,确保对模型不确定性的鲁棒性。
- 通过极限协方差矩阵推导渐近后悔下界,特别是 Σ̂X¹(滤波后的状态协方差)。
- 引入具有不稳定模态和部分可观察性的结构化系统模型,以暴露学习中的失效模式。
- 采用矩阵分析方法,对涉及系统动态和控制增益的信息矩阵乘积的迹进行上界估计。
实验结果
研究问题
- RQ1学习未知线性高斯系统并最小化二次代价时,后悔的根本下界是什么?
- RQ2可控制性和可观察性等系统理论特性如何影响学习控制的难度?
- RQ3当测量噪声为满秩时,能否在部分可观测的 LQG 系统中实现对数后悔?
- RQ4控制策略的选择如何影响学习过程中探索与利用之间的权衡?
- RQ5费雪信息矩阵的结构在决定根本学习极限方面起什么作用?
主要发现
- 后悔下界以 Ω(√T) 的形式缩放,确认学习未知 LQG 系统不可避免地产生次线性但不消失的后悔。
- 可控制性或可观察性结构较差的系统表现出显著更高的后悔下界,证实控制难度直接影响学习难度。
- 与先前工作相比,所推导的下界在系统理论常数(如格拉米安和代价矩阵)的缩放关系上有所改进。
- 在部分可观测系统中,当不稳定模态的可观察性丧失时(特别是当 ‖C23‖op → 0 时),后悔下界发散。
- 滤波后的状态协方差 Σ̂X¹ 而非原始状态协方差,决定了渐近后悔下界,反映了可检测性和稳定性的影响。
- 本文表明仅 ΣV ≻ 0 不足以实现对数后悔,挑战了先前工作中的假设,并强调了持续激励等更强条件的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。