Skip to main content
QUICK REVIEW

[论文解读] Efficient Learning in Non-Stationary Linear Markov Decision Processes

Abdelaziz Touati, Pascal Vincent|arXiv (Cornell University)|Oct 24, 2020
Advanced Bandit Algorithms Research参考文献 21被引用 7
一句话总结

该论文提出 opt-wlsvi,一种用于非平稳线性马尔可夫决策过程的乐观无模型在线强化学习算法,采用带指数遗忘的加权最小二乘值迭代方法,以适应时变奖励和转移概率。其遗憾界为 $ frac{ ilde{ m O}}{(d^{5/4}H^{2} ilde{ m extstyle extbackslash Delta}^{1/4}K^{3/4})}$,其中 $d$ 为特征维度,$H$ 为时域长度,$K$ 为训练轮数,$ ilde{ m extstyle extbackslash Delta}$ 衡量非平稳性。

ABSTRACT

We study episodic reinforcement learning in non-stationary linear (a.k.a. low-rank) Markov Decision Processes (MDPs), i.e, both the reward and transition kernel are linear with respect to a given feature map and are allowed to evolve either slowly or abruptly over time. For this problem setting, we propose OPT-WLSVI an optimistic model-free algorithm based on weighted least squares value iteration which uses exponential weights to smoothly forget data that are far in the past. We show that our algorithm, when competing against the best policy at each time, achieves a regret that is upper bounded by $\widetilde{\mathcal{O}}(d^{5/4}H^2 Δ^{1/4} K^{3/4})$ where $d$ is the dimension of the feature space, $H$ is the planning horizon, $K$ is the number of episodes and $Δ$ is a suitable measure of non-stationarity of the MDP. Moreover, we point out technical gaps in the study of forgetting strategies in non-stationary linear bandits setting made by previous works and we propose a fix to their regret analysis.

研究动机与目标

  • 解决在奖励和转移动态随时间演变的周期性非平稳线性 MDP 中高效强化学习的挑战。
  • 克服先前基于平稳 MDP 的算法所存在的局限性,这些算法假设环境动态固定,在时变条件下失效。
  • 开发一种计算高效的无模型算法,在高维或连续状态空间中实现探索与利用的平衡。
  • 在非平稳条件下提供严格的遗憾分析,将性能与每轮中的最优策略进行比较。
  • 纠正先前关于非平稳线性Bandit中遗忘策略遗憾分析的技术缺陷,特别是误差传播的控制问题。

提出的方法

  • 提出 opt-wlsvi,一种基于带指数权重的加权最小二乘值迭代的乐观无模型算法,以平滑遗忘过时数据。
  • 通过衰减因子 $\eta \in (0,1)$ 实现指数遗忘,为较旧的转移和奖励分配更低的权重,从而适应动态环境。
  • 提出一种适用于序列加权最小二乘估计器的新偏差不等式,以控制非独立同分布设定下的估计误差。
  • 引入一种置信区间构造方法,同时考虑模型估计误差和非平稳性,确保在不确定性面前保持乐观。
  • 通过矩阵范数和特征空间几何结构,控制值迭代步骤中真实值函数与估计值函数之间差异,实现误差传播的控制。
  • 利用参数空间的覆盖论证控制函数类的复杂度,通过 $\epsilon$-网控制所需近似数量。

实验结果

研究问题

  • RQ1我们能否设计一种在非平稳线性 MDP 中具有理论保证的高效强化学习算法,以适应奖励和转移函数的缓慢或突然变化?
  • RQ2与周期性重初始化相比,加权最小二乘估计中指数遗忘对非平稳 MDP 中遗憾的影响如何?
  • RQ3在时变动态下,非平稳线性 MDP 中探索、泛化与适应之间的根本权衡是什么?
  • RQ4我们能否纠正先前关于非平稳线性Bandit中遗忘策略遗憾分析的技术缺陷?
  • RQ5遗憾对非平稳性预算 $\Delta$、时域长度 $H$、特征维度 $d$ 和训练轮数 $K$ 的最优依赖关系是什么?

主要发现

  • 所提出的 opt-wlsvi 算法在非平稳线性 MDP 中与每轮中的最优策略竞争时,实现了动态遗憾界 $\widetilde{\mathcal{O}}(d^{5/4}H^{2}\Delta^{1/4}K^{3/4})$。
  • 遗憾界对 $K$、$H$ 和 $\Delta$ 呈次线性依赖,对 $d$ 呈次二次依赖,表明在高维特征空间中具有良好的泛化能力。
  • 该算法通过平滑遗忘实现持续适应,避免了突然的策略重置,因此优于朴素的周期性重初始化策略。
  • 作者识别并纠正了先前关于非平稳线性Bandit中遗忘策略遗憾分析的技术错误,特别是在迭代间误差传播的控制方面。
  • 分析建立了适用于序列加权最小二乘估计器的新偏差不等式,这对控制非独立同分布数据下的估计误差至关重要。
  • 遗憾界在 $d$、$H$、$\Delta$ 和 $K$ 的依赖关系上是紧致的,与同期方法(如 LSVI-UCB 的周期重启)的最先进性能相当。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。