Skip to main content
QUICK REVIEW

[论文解读] Regret Minimization in Partially Observable Linear Quadratic Control

Sahin Lale, Kamyar Azizzadenesheli|arXiv (Cornell University)|Jan 31, 2020
Advanced Bandit Algorithms Research参考文献 45被引用 9
一句话总结

该论文提出 ExpCommit,一种用于部分可观测线性二次控制中后悔最小化的探索-然后-承诺算法,其系统动态未知。通过使用 Ho-Kalman 算法估计马尔可夫参数,并应用面对不确定性的乐观策略,ExpCommit 实现了 $ ilde{ackslash mathcal extasciotilde{O}}(T^{2/3})$ 的次线性后悔界,这是该设置下的首个此类结果。

ABSTRACT

We study the problem of regret minimization in partially observable linear quadratic control systems when the model dynamics are unknown a priori. We propose ExpCommit, an explore-then-commit algorithm that learns the model Markov parameters and then follows the principle of optimism in the face of uncertainty to design a controller. We propose a novel way to decompose the regret and provide an end-to-end sublinear regret upper bound for partially observable linear quadratic control. Finally, we provide stability guarantees and establish a regret upper bound of $ ilde{\mathcal{O}}(T^{2/3})$ for ExpCommit, where $T$ is the time horizon of the problem.

研究动机与目标

  • 解决在系统动态事先未知的情况下,部分可观测线性二次控制中的后悔最小化挑战。
  • 设计一种在探索与利用之间取得平衡的算法,以最小化与最优控制器的累积成本偏差。
  • 为部分可观测 LQ 系统建立有限时间后悔上界,即使存在潜在状态估计误差,该上界仍保持次线性。
  • 为基于估计系统参数合成的控制器提供稳定性保证。
  • 提出一种基于平均成本 LQG 控制贝尔曼最优性方程的新型后悔分解方法。

提出的方法

  • ExpCommit 采用两阶段结构:在探索阶段使用高斯噪声输入收集数据并估计系统马尔可夫参数。
  • 在探索阶段,利用非渐近系统辨识技术,在估计的马尔可夫参数周围构建高概率置信集。
  • 在承诺阶段,算法应用面对不确定性的乐观原则(OFU),从置信集中选择最乐观的控制器。
  • 通过 Ho-Kalman 实现算法,利用估计的马尔可夫参数设计控制器,以确保控制器稳定且次优。
  • 基于平均成本 LQG 控制的贝尔曼最优性方程,推导出一种新颖的后悔分解方法,用于分析性能差距。
  • 技术工具包括自归一化鞅界限、覆盖论证以及次高斯浓度不等式,以控制估计误差和后悔误差。

实验结果

研究问题

  • RQ1在系统动态未知的部分可观测线性二次控制中,能否实现次线性后悔界?
  • RQ2如何有效将面对不确定性的乐观策略应用于存在潜在状态估计误差的部分可观测系统?
  • RQ3在 LQG 控制中,后悔标度的探索与利用之间最优权衡是什么?
  • RQ4能否为基于估计马尔可夫参数设计的控制器建立有限时间稳定性保证?
  • RQ5分析具有模型不确定性的平均成本 LQG 控制,需要哪些新颖的后悔分解技术?

主要发现

  • ExpCommit 实现了 $ackslash extbackslash textasciitilde{O}(T^{2/3})$ 的后悔上界,这是部分可观测线性二次控制中系统动态未知情况下的首个次线性后悔界。
  • 该算法确保了即使在模型不确定条件下,基于估计马尔可夫参数合成的控制器也具有稳定性。
  • 基于贝尔曼最优性方程的后悔分解技术,能够精确量化由模型估计误差导致的成本差距。
  • 通过非渐近系统辨识技术,构建了马尔可夫参数的高概率置信集,从而支持基于 OFU 的可靠控制器选择。
  • 使用 Ho-Kalman 算法进行系统实现,确保了估计模型的一致性和可稳定化。
  • 理论保证由先进的浓度不等式支持,包括自归一化界限和矩阵范数的覆盖论证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。