Skip to main content
QUICK REVIEW

[论文解读] Logarithmic regret for episodic continuous-time linear-quadratic reinforcement learning over a finite-time horizon

Matteo Basei, Xin Guo|arXiv (Cornell University)|Jun 27, 2020
Advanced Bandit Algorithms Research参考文献 33被引用 12
一句话总结

本文提出了一种用于具有未知系统动态特性的周期性连续时间线性二次调节器(LQR)问题的最小二乘强化学习算法。通过利用Riccati方程的扰动分析以及连续时间估计器的次指数性质,该方法在 $M$ 个学习周期内实现了 $\mathcal{O}((\ln M)(\ln\ln M))$ 阶的对数 regret 上界,并将结果推广至离散时间实现形式,在时间离散化误差界内保持了类似的 regret 性能。

ABSTRACT

We study finite-time horizon continuous-time linear-quadratic reinforcement learning problems in an episodic setting, where both the state and control coefficients are unknown to the controller. We first propose a least-squares algorithm based on continuous-time observations and controls, and establish a logarithmic regret bound of order $O((\ln M)(\ln\ln M))$, with $M$ being the number of learning episodes. The analysis consists of two parts: perturbation analysis, which exploits the regularity and robustness of the associated Riccati differential equation; and parameter estimation error, which relies on sub-exponential properties of continuous-time least-squares estimators. We further propose a practically implementable least-squares algorithm based on discrete-time observations and piecewise constant controls, which achieves similar logarithmic regret with an additional term depending explicitly on the time stepsizes used in the algorithm.

研究动机与目标

  • 解决具有未知状态与控制系数的周期性连续时间线性二次调节器强化学习问题。
  • 在有限horizon 设置下,为连续时间 LQR 问题建立非渐近 regret 上界。
  • 基于离散时间观测与分段常数控制,开发一种实用算法,同时保持对数 regret 性能。
  • 通过 Riccati 方程的鲁棒性分析,研究参数估计误差与系统稳定性之间的相互作用。
  • 弥合理论上的连续时间强化学习与可实现算法之间的差距,并量化离散化效应的影响。

提出的方法

  • 设计一种基于完整路径观测的连续时间最小二乘估计器,用于估计未知系统参数。
  • 采用 Riccati 微分方程的扰动分析方法,量化在参数不确定性下的鲁棒性与稳定性。
  • 利用连续时间最小二乘估计器的次指数尾部界,控制参数估计误差。
  • 提出一种离散时间变体,采用分段常数控制与时间离散化,步长为 $\tau = T/N$。
  • 引入一种递归学习方案,结合置信区域与自适应样本量 $m_\ell = 2^\ell m_0$,以在各周期间逐步优化参数估计。
  • 通过结合估计误差界与由时间离散化及参数不确定性引起的控制性能损失,推导出 regret 上界。

实验结果

研究问题

  • RQ1连续时间最小二乘算法是否能在具有未知动态特性的周期性 LQR 中实现对数 regret?
  • RQ2Riccati 方程的正则性如何影响在参数不确定性下的控制策略鲁棒性?
  • RQ3在使用离散时间观测与分段常数控制时,时间离散化对 regret 的影响是什么?
  • RQ4一种基于离散采样的实用算法能否实现与连续时间理想情况相当的 regret 性能?
  • RQ5在何种条件下,可确保参数估计误差以足够快的速度衰减,从而实现对数 regret?

主要发现

  • 所提出的连续时间最小二乘算法在 $M$ 个周期内实现了 $\mathcal{O}((\ln M)(\ln\ln M))$ 的 regret 上界,其中 $M$ 为学习周期数。
  • 该 regret 上界通过两部分分析建立:Riccati 方程的扰动分析与最小二乘估计器的次指数尾部界。
  • 对于离散时间实现,regret 上界为 $\mathcal{O}((\ln M)(\ln\ln M))$ 加上由于时间离散化误差导致的额外项 $\sum_{\ell=0}^{\ln M} m_\ell N_\ell^{-2}$。
  • 参数估计误差以高概率衰减为 $\mathcal{O}(\sqrt{(-\ln \delta)/m} + (-\ln \delta)/m + ((-\ln \delta)^2)/m^2 + 1/N)$,其中 $m$ 为样本数,$N$ 为时间离散化步数。
  • 期望 Fisher 信息矩阵 $\mathbb{E}[V^{\psi^{\theta,\tau}}]$ 的可逆性在所有周期中保持一致有界,确保了参数估计的稳定性。
  • 分析结果表明,在满足适度正则性与可辨识性条件的前提下,即使控制器对系统动态特性事先一无所知,该算法仍能保持对数 regret 性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。