Skip to main content
QUICK REVIEW

[论文解读] Frequentist Regret Bounds for Randomized Least-Squares Value Iteration

Andrea Zanette, David Brandfonbrener|arXiv (Cornell University)|Nov 1, 2019
Advanced Bandit Algorithms Research参考文献 34被引用 17
一句话总结

本文提出了一种针对具有线性函数逼近的有限horizon强化学习的随机化最小二乘值迭代(RLSVI)的乐观初始化变体。在低秩转移动态条件下,建立了首个频率学 regret 边界 $\widetilde{O}(d^2H^2\sqrt{T})$,为大规模 MDP 中带有函数逼近的随机探索提供了理论保证。

ABSTRACT

We consider the exploration-exploitation dilemma in finite-horizon reinforcement learning (RL). When the state space is large or continuous, traditional tabular approaches are unfeasible and some form of function approximation is mandatory. In this paper, we introduce an optimistically-initialized variant of the popular randomized least-squares value iteration (RLSVI), a model-free algorithm where exploration is induced by perturbing the least-squares approximation of the action-value function. Under the assumption that the Markov decision process has low-rank transition dynamics, we prove that the frequentist regret of RLSVI is upper-bounded by $\widetilde O(d^2 H^2 \sqrt{T})$ where $ d $ are the feature dimension, $ H $ is the horizon, and $ T $ is the total number of steps. To the best of our knowledge, this is the first frequentist regret analysis for randomized exploration with function approximation.

研究动机与目标

  • 解决在大规模强化学习中,带有函数逼近的随机探索算法缺乏频率学 regret 分析的问题。
  • 弥合如 RLSVI 等在实践中有效的随机算法与非表格设置下理论化 regret 边界之间的差距。
  • 提供一种可证明高效的探索机制,将乐观性与有限horizon MDP 中的线性函数逼近相结合。
  • 将基于 Thompson 采样风格探索的理论理解从表格型 MDP 扩展到结构化、高维状态空间。
  • 在低秩动态条件下,建立一个与特征维度 $d$、horizon $H$ 和总步数 $T$ 均呈多项式关系的 regret 边界。

提出的方法

  • 提出 RLSVI 的一种乐观初始化变体,通过缩放最小二乘估计的扰动,以确保以常数概率保持乐观性。
  • 使用与特征协方差矩阵的逆成比例的高斯扰动,并调整其大小以覆盖估计误差。
  • 利用自归一化的鞅集中不等式(引理 11)来控制估计误差随时间的增长。
  • 应用覆盖数论证(引理 15)和特征范数界(引理 13)以管理高维参数空间中的不确定性。
  • 引入一种改进的置信集构造方法,以考虑值迭代步骤中扰动的累积效应。
  • 使用 Sherman-Morrison 公式,通过每次更新 $O(d^2)$ 时间更新逆协方差矩阵,以保持计算效率。

实验结果

研究问题

  • RQ1在具有函数逼近的非表格设置下,是否可以对 RLSVI 的随机探索进行理论验证?
  • RQ2当使用线性函数逼近和乐观扰动时,随机化值迭代算法的频率学 regret 是多少?
  • RQ3在低秩动态条件下,regret 如何随特征维度 $d$、horizon $H$ 和步数 $T$ 变化?
  • RQ4尽管扰动传播,乐观性属性是否能在多个值迭代步骤中保持?
  • RQ5是否可能实现一个与 $d$ 和 $H$ 呈多项式关系的 regret 边界,而非与状态数相关?

主要发现

  • 所提出的算法在低秩转移动态下实现了频率学 regret 边界 $\widetilde{O}(d^2H^2\sqrt{T})$。
  • 这是首次在有限horizon MDP 中,针对带有函数逼近的随机探索算法获得此类 regret 边界的结果。
  • 分析表明,扰动必须大于估计误差,才能确保乐观性,这与线性 bandit 理论一致。
  • 通过仔细调节扰动方差以抵消误差累积,乐观性的概率在时间步之间得以保持。
  • 与乐观 $Q$-学习算法相比,该 regret 边界更差一个 $\sqrt{Hd}$ 因子,因此仍存在疑问:这一差距是否可以被消除?
  • 该算法通过利用秩一更新实现矩阵求逆,保持了计算效率,每轮的运行时间为 $O(d^2AHK^2)$,内存占用为 $O(dAHK)$。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。