Skip to main content
QUICK REVIEW

[论文解读] Episodic Linear Quadratic Regulators with Low-rank Transitions

Tianyu Wang, Lin F. Yang|arXiv (Cornell University)|Nov 3, 2020
Advanced Bandit Algorithms Research参考文献 42被引用 4
一句话总结

该论文提出了一种基于模型的强化学习算法,用于具有低秩系统动态的周期性线性二次调节器(LQR)。通过结合乐观控制与基于主成分分析(PCA)的低秩近似,该算法实现了 $\widetilde{\mathcal{O}}(m^{3/2}\sqrt{K})$ 的遗憾边界,其中 $m$ 为系统的固有秩,与环境状态维度 $d$ 无关,从而在图像控制等高维设置中实现了高效学习。

ABSTRACT

Linear Quadratic Regulators (LQR) achieve enormous successful real-world applications. Very recently, people have been focusing on efficient learning algorithms for LQRs when their dynamics are unknown. Existing results effectively learn to control the unknown system using number of episodes depending polynomially on the system parameters, including the ambient dimension of the states. These traditional approaches, however, become inefficient in common scenarios, e.g., when the states are high-resolution images. In this paper, we propose an algorithm that utilizes the intrinsic system low-rank structure for efficient learning. For problems of rank-$m$, our algorithm achieves a $K$-episode regret bound of order $\widetilde{O}(m^{3/2} K^{1/2})$. Consequently, the sample complexity of our algorithm only depends on the rank, $m$, rather than the ambient dimension, $d$, which can be orders-of-magnitude larger.

研究动机与目标

  • 为解决现有 LQR 学习算法在环境状态维度 $d$ 上呈现多项式依赖的问题,尤其是在图像控制等高维设置中效率低下。
  • 探究是否可通过利用系统动态中的低秩结构来降低样本复杂度。
  • 设计一种在线学习算法,实现仅依赖于系统固有秩 $m$ 的次线性遗憾,而非 $d$。
  • 实现在状态为高维但具有低固有维度的周期性 LQR 问题中的高效学习。

提出的方法

  • 该算法采用基于模型的方法,通过收集轨迹上的最小二乘回归来估计系统动态 $M = [A\; B]$。
  • 它对状态-动作数据应用主成分分析(PCA),将其投影到秩为 $m$ 的低维子空间,以捕捉内在动态。
  • 利用低秩模型上的不确定性估计,计算乐观控制策略,通过 OFU(面对不确定性时的乐观性)原则平衡探索与利用。
  • 该算法在最后一轮中将所有数据点投影到 PCA 子空间,以在各轮之间稳定子空间估计。
  • 它采用自归一化随机过程分析,以界定累积不确定性,确保遗憾与环境维度 $d$ 无关。
  • 最终的遗憾边界通过矩阵行列式不等式和对数迹界推导得出,利用低秩结构解耦了对 $d$ 的依赖。

实验结果

研究问题

  • RQ1我们能否设计一种 LQR 学习算法,其样本复杂度仅依赖于系统的固有秩 $m$,而非环境维度 $d$?
  • RQ2如何有效结合低秩近似与在线控制学习,以维持遗憾保证?
  • RQ3当系统动态为低秩但观测空间为高维时,可实现的根本遗憾边界是什么?
  • RQ4当底层状态空间具有低固有维度时,我们能否在周期性 LQR 中维持次线性遗憾,即使观测状态为高维?
  • RQ5在顺序学习设置中,如何处理因各轮间 PCA 子空间变化而引入的不稳定性?

主要发现

  • 所提出的算法实现了 $K$ 轮的遗憾边界为 $\widetilde{\mathcal{O}}(m^{3/2}\sqrt{K})$,该边界仅依赖于系统动态的固有秩 $m$。
  • 遗憾边界与环境状态维度 $d$ 无关,因此适用于图像等高维输入。
  • 该算法的样本复杂度在 $m$ 上为多项式,显著优于以往依赖于 $\mathrm{poly}(d)$ 的方法。
  • 分析建立了对秩亏自归一化过程行列式的新型界,使遗憾中的 $m$-依赖成为可能。
  • 在图像控制任务(如 Cart-Pole)上的实验结果表明,尽管观测维度高,该算法仍具有良好的泛化能力。
  • 当底层系统具有低固有维度时,该方法在样本效率上优于标准 LQR 学习基线。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。