Skip to main content
QUICK REVIEW

[论文解读] $Q$-learning with Logarithmic Regret

Kunhe Yang, Lin F. Yang|arXiv (Cornell University)|Jun 16, 2020
Advanced Bandit Algorithms Research参考文献 42被引用 16
一句话总结

该论文在严格正子最优性差距条件下,首次为模型无关的Q-learning算法在回合制表格强化学习中建立了非渐近对数 regret 边界。证明了乐观Q-learning的累积 regret 为 $\mathcal{O}\left(\frac{SAH^{6}}{\Delta_{\min}}\log(SAT)\right)$,与实例相关下界相比仅相差 $\log(SA)$ 因子,且无需事先知晓 $\Delta_{\min}$。

ABSTRACT

This paper presents the first non-asymptotic result showing that a model-free algorithm can achieve a logarithmic cumulative regret for episodic tabular reinforcement learning if there exists a strictly positive sub-optimality gap in the optimal $Q$-function. We prove that the optimistic $Q$-learning studied in [Jin et al. 2018] enjoys a ${\mathcal{O}}\left(\frac{SA\cdot \mathrm{poly}\left(H ight)}{Δ_{\min}}\log\left(SAT ight) ight)$ cumulative regret bound, where $S$ is the number of states, $A$ is the number of actions, $H$ is the planning horizon, $T$ is the total number of steps, and $Δ_{\min}$ is the minimum sub-optimality gap. This bound matches the information theoretical lower bound in terms of $S,A,T$ up to a $\log\left(SA ight)$ factor. We further extend our analysis to the discounted setting and obtain a similar logarithmic cumulative regret bound.

研究动机与目标

  • 为解决模型无关Q-learning是否能在回合制表格马尔可夫决策过程(MDP)中实现对数 regret 的开放问题。
  • 在子最优性差距假设下分析乐观Q-learning,该假设在实际环境中常见。
  • 推导出一个与实例相关下界相比仅相差对数因子的非渐近 regret 边界。
  • 将分析扩展至无限时域折扣设置,并获得类似的 regret 边界。

提出的方法

  • 提出一种新颖的乐观Q-learning分析框架,通过在每个状态-动作层级上对估计误差的加权和来界定 regret。
  • 引入一个 $(C, (1+1/H)w)$-序列,以递归方式控制规划时域内各时间步之间的误差传播。
  • 对乐观盈余概念采用截断技巧,该技巧源自模型基于分析,用于推导出对数 regret。
  • 通过将Q值误差进行 dyadic 分解为区间 $[2^{n-1}\Delta_{\min}, 2^n\Delta_{\min})$,以界定次优动作的数量。
  • 应用集中不等式与递归有界方法,控制所有步骤与层级上的累积误差。
  • 通过调整 regret 定义并用折扣因子 $\gamma$ 有界各项,将分析扩展至折扣设置。

实验结果

研究问题

  • RQ1在严格正子最优性差距条件下,模型无关Q-learning是否能在回合制表格MDP中实现对数 regret?
  • RQ2Jin 等人(2018)提出的乐观Q-learning算法是否能够实现与实例相关下界相匹配的 regret 边界?
  • RQ3在模型无关设置下,regret 如何随规划时域 $H$ 和最小子最优性差距 $\Delta_{\min}$ 变化?
  • RQ4该分析能否扩展至无限时域折扣MDP设置,并获得类似的对数 regret 保证?
  • RQ5regret 对 $H$ 和 $\Delta_{\min}$ 的依赖关系如何?$H^6$ 因子能否被改进?

主要发现

  • 乐观Q-learning算法在回合制表格MDP中实现了 $\mathcal{O}\left(\frac{SAH^{6}}{\Delta_{\min}}\log(SAT)\right)$ 的累积 regret。
  • 该 regret 边界与 Simchowitz 和 Jamieson(2019)提出的实例相关下界相比,仅在 $S$、$A$ 和 $T$ 上相差 $\log(SA)$ 因子。
  • 该算法无需事先知晓 $\Delta_{\min}$,即最小子最优性差距。
  • 对于折扣设置,regret 被有界为 $\mathcal{O}\left(\frac{SA}{\Delta_{\min}(1-\gamma)^6}\log\left(\frac{SAT}{\Delta_{\min}(1-\gamma)}\right)\right)$。
  • 分析表明,对规划时域的 $H^6$ 依赖关系为次优,提示存在改进空间。
  • 该方法成功地将模型基于分析中的乐观盈余技术,通过一种新颖的递归误差有界框架,适配至模型无关Q-learning。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。