Skip to main content
QUICK REVIEW

[论文解读] Exploration-exploitation trade-off for continuous-time episodic reinforcement learning with linear-convex models

Łukasz Szpruch, Tanut Treetanthiploet|arXiv (Cornell University)|Dec 19, 2021
Advanced Bandit Algorithms Research被引用 4
一句话总结

该论文为具有未知线性动力学的连续时间周期性强化学习提出了一种概率框架。它建立了估计参数与真实参数之间性能差距的二次型关系,从而支持一种分阶段学习算法,该算法在 $N$ 个周期内实现了次线性遗憾——以高概率的 $Ó(\sqrt{N}\ln N)$ 和期望遗憾的 $Ó((\ln N)^2)$,并利用针对相关连续时间观测的新颖集中不等式。

ABSTRACT

We develop a probabilistic framework for analysing model-based reinforcement learning in the episodic setting. We then apply it to study finite-time horizon stochastic control problems with linear dynamics but unknown coefficients and convex, but possibly irregular, objective function. Using probabilistic representations, we study regularity of the associated cost functions and establish precise estimates for the performance gap between applying optimal feedback control derived from estimated and true model parameters. We identify conditions under which this performance gap is quadratic, improving the linear performance gap in recent work [X. Guo, A. Hu, and Y. Zhang, arXiv preprint, arXiv:2104.09311, (2021)], which matches the results obtained for stochastic linear-quadratic problems. Next, we propose a phase-based learning algorithm for which we show how to optimise exploration-exploitation trade-off and achieve sublinear regrets in high probability and expectation. When assumptions needed for the quadratic performance gap hold, the algorithm achieves an order $\mathcal{O}(\sqrt{N} \ln N)$ high probability regret, in the general case, and an order $\mathcal{O}((\ln N)^2)$ expected regret, in self-exploration case, over $N$ episodes, matching the best possible results from the literature. The analysis requires novel concentration inequalities for correlated continuous-time observations, which we derive.

研究动机与目标

  • 为具有未知线性动力学的连续时间周期性模型化强化学习建立概率框架。
  • 分析代价函数的正则性,并量化基于估计参数与真实参数的最优控制之间的性能差距。
  • 建立性能差距为二次型的条件,优于以往工作的线性界。
  • 设计一种分阶段学习算法,以最优方式平衡探索与利用。
  • 推导出与文献中最新结果相匹配的高概率与期望遗憾界。

提出的方法

  • 使用概率表示方法研究未知漂移参数下线性-凸随机控制问题中代价函数的正则性。
  • 精确估计基于估计参数与真实参数的反馈控制之间的性能差距,在适当条件下表明其具有二次依赖关系。
  • 提出一种分阶段学习算法,通过顺序贝叶斯推断在探索与利用阶段之间交替进行。
  • 利用针对相关连续时间观测量身定制的新颖集中不等式,分析估计误差与遗憾。
  • 应用 Lévy 的特征刻画方法,证明滤波过程为布朗运动,从而实现状态过程的半鞅表示。
  • 通过渐进可测性与鞅性质,建立估计参数 $\hat{\bm{\theta}}^{\bm{\Psi},m}$ 关于 ${\mathcal{G}}^{\bm{\Psi}}_m$ 的可测性。

实验结果

研究问题

  • RQ1在何种条件下,基于估计参数与真实参数的最优控制之间的性能差距呈现二次型而非线性?
  • RQ2在具有未知线性动力学的连续时间周期性强化学习中,如何最优地平衡探索与利用?
  • RQ3在存在相关连续时间观测的情况下,分阶段学习算法可实现何种遗憾界?
  • RQ4能否推导并应用针对依赖连续时间过程的新颖集中不等式于强化学习?
  • RQ5在线性-凸控制问题中,模型不确定性、代价函数正则性与学习性能之间存在何种相互作用?

主要发现

  • 在适当的正则性条件下,基于估计参数与真实参数的最优反馈控制之间的性能差距为二次型,优于以往工作的线性差距。
  • 当满足二次差距条件时,所提出的分阶段算法在 $N$ 个周期内实现了 $\mathcal{O}(\sqrt{N}\ln N)$ 的高概率遗憾。
  • 在自探索情形下,该算法实现了 $\mathcal{O}((\ln N)^2)$ 的期望遗憾,与文献中最佳已知结果一致。
  • 该分析引入了针对相关连续时间观测的新颖集中不等式,这对于在序列学习中界定估计误差至关重要。
  • 相对于观测滤波器的半鞅表示方法,使状态过程的严格可测性与推断结果成为可能,从而支持对估计参数的严谨分析。
  • 该框架适用于一般凸的、可能不规则的代价函数,包括非光滑与受约束的控制,突破了线性-二次模型的限制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。