Skip to main content
QUICK REVIEW

[论文解读] Regret Lower Bounds for Learning Linear Quadratic Gaussian Systems

Ingvar Ziemann, Henrik Sandberg|arXiv (Cornell University)|Jan 5, 2022
Gaussian Processes and Bayesian Inference被引用 6
一句话总结

本文为未知线性二次高斯(LQG)系统的自适应控制建立了信息论意义上的后悔下界,证明了后悔的规模为 Ω(√T),且其行为关键取决于系统理论特性,如可控制性、可观察性和格拉米安结构。下界表明,可控制性或可观察性较差的系统在学习控制方面本质上更困难,且在系统理论常数方面的缩放关系优于先前工作。

ABSTRACT

TWe establish regret lower bounds for adaptively controlling an unknown linear Gaussian system with quadratic costs. We combine ideas from experiment design, estimation theory and a perturbation bound of certain information matrices to derive regret lower bounds exhibiting scaling on the order of magnitude $\sqrt{T}$ in the time horizon $T$. Our bounds accurately capture the role of control-theoretic parameters and we are able to show that systems that are hard to control are also hard to learn to control; when instantiated to state feedback systems we recover the dimensional dependency of earlier work but with improved scaling with system-theoretic constants such as system costs and Gramians. Furthermore, we extend our results to a class of partially observed systems and demonstrate that systems with poor observability structure also are hard to learn to control.

研究动机与目标

  • 建立未知线性高斯系统在二次代价下的自适应控制性能的理论极限。
  • 量化系统理论特性(如可控制性和可观察性)如何影响学习控制的难度。
  • 推导能准确反映系统参数(包括格拉米安和代价矩阵)缩放关系的后悔下界。
  • 将结果扩展至部分可观测系统,表明可观察性差也会增加学习难度。
  • 证明在一般情况下,即使测量噪声为满秩,也无法实现对数后悔,除非满足更强的假设。

提出的方法

  • 结合实验设计、估计理论和信息矩阵扰动分析的工具,推导出下界。
  • 利用费雪信息矩阵的扰动界,将估计不确定性与控制后悔联系起来。
  • 应用极小化极大框架,在参数邻域 B(θ, ε) 上分析后悔,确保对模型不确定性的鲁棒性。
  • 通过极限协方差矩阵推导渐近后悔下界,特别是 Σ̂X¹(滤波后的状态协方差)。
  • 引入具有不稳定模态和部分可观察性的结构化系统模型,以暴露学习中的失效模式。
  • 采用矩阵分析方法,对涉及系统动态和控制增益的信息矩阵乘积的迹进行上界估计。

实验结果

研究问题

  • RQ1学习未知线性高斯系统并最小化二次代价时,后悔的根本下界是什么?
  • RQ2可控制性和可观察性等系统理论特性如何影响学习控制的难度?
  • RQ3当测量噪声为满秩时,能否在部分可观测的 LQG 系统中实现对数后悔?
  • RQ4控制策略的选择如何影响学习过程中探索与利用之间的权衡?
  • RQ5费雪信息矩阵的结构在决定根本学习极限方面起什么作用?

主要发现

  • 后悔下界以 Ω(√T) 的形式缩放,确认学习未知 LQG 系统不可避免地产生次线性但不消失的后悔。
  • 可控制性或可观察性结构较差的系统表现出显著更高的后悔下界,证实控制难度直接影响学习难度。
  • 与先前工作相比,所推导的下界在系统理论常数(如格拉米安和代价矩阵)的缩放关系上有所改进。
  • 在部分可观测系统中,当不稳定模态的可观察性丧失时(特别是当 ‖C23‖op → 0 时),后悔下界发散。
  • 滤波后的状态协方差 Σ̂X¹ 而非原始状态协方差,决定了渐近后悔下界,反映了可检测性和稳定性的影响。
  • 本文表明仅 ΣV ≻ 0 不足以实现对数后悔,挑战了先前工作中的假设,并强调了持续激励等更强条件的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。