[论文解读] $Q$-learning with Logarithmic Regret
该论文在严格正子最优性差距条件下,首次为模型无关的Q-learning算法在回合制表格强化学习中建立了非渐近对数 regret 边界。证明了乐观Q-learning的累积 regret 为 $\mathcal{O}\left(\frac{SAH^{6}}{\Delta_{\min}}\log(SAT)\right)$,与实例相关下界相比仅相差 $\log(SA)$ 因子,且无需事先知晓 $\Delta_{\min}$。
This paper presents the first non-asymptotic result showing that a model-free algorithm can achieve a logarithmic cumulative regret for episodic tabular reinforcement learning if there exists a strictly positive sub-optimality gap in the optimal $Q$-function. We prove that the optimistic $Q$-learning studied in [Jin et al. 2018] enjoys a ${\mathcal{O}}\left(\frac{SA\cdot \mathrm{poly}\left(H ight)}{Δ_{\min}}\log\left(SAT ight) ight)$ cumulative regret bound, where $S$ is the number of states, $A$ is the number of actions, $H$ is the planning horizon, $T$ is the total number of steps, and $Δ_{\min}$ is the minimum sub-optimality gap. This bound matches the information theoretical lower bound in terms of $S,A,T$ up to a $\log\left(SA ight)$ factor. We further extend our analysis to the discounted setting and obtain a similar logarithmic cumulative regret bound.
研究动机与目标
- 为解决模型无关Q-learning是否能在回合制表格马尔可夫决策过程(MDP)中实现对数 regret 的开放问题。
- 在子最优性差距假设下分析乐观Q-learning,该假设在实际环境中常见。
- 推导出一个与实例相关下界相比仅相差对数因子的非渐近 regret 边界。
- 将分析扩展至无限时域折扣设置,并获得类似的 regret 边界。
提出的方法
- 提出一种新颖的乐观Q-learning分析框架,通过在每个状态-动作层级上对估计误差的加权和来界定 regret。
- 引入一个 $(C, (1+1/H)w)$-序列,以递归方式控制规划时域内各时间步之间的误差传播。
- 对乐观盈余概念采用截断技巧,该技巧源自模型基于分析,用于推导出对数 regret。
- 通过将Q值误差进行 dyadic 分解为区间 $[2^{n-1}\Delta_{\min}, 2^n\Delta_{\min})$,以界定次优动作的数量。
- 应用集中不等式与递归有界方法,控制所有步骤与层级上的累积误差。
- 通过调整 regret 定义并用折扣因子 $\gamma$ 有界各项,将分析扩展至折扣设置。
实验结果
研究问题
- RQ1在严格正子最优性差距条件下,模型无关Q-learning是否能在回合制表格MDP中实现对数 regret?
- RQ2Jin 等人(2018)提出的乐观Q-learning算法是否能够实现与实例相关下界相匹配的 regret 边界?
- RQ3在模型无关设置下,regret 如何随规划时域 $H$ 和最小子最优性差距 $\Delta_{\min}$ 变化?
- RQ4该分析能否扩展至无限时域折扣MDP设置,并获得类似的对数 regret 保证?
- RQ5regret 对 $H$ 和 $\Delta_{\min}$ 的依赖关系如何?$H^6$ 因子能否被改进?
主要发现
- 乐观Q-learning算法在回合制表格MDP中实现了 $\mathcal{O}\left(\frac{SAH^{6}}{\Delta_{\min}}\log(SAT)\right)$ 的累积 regret。
- 该 regret 边界与 Simchowitz 和 Jamieson(2019)提出的实例相关下界相比,仅在 $S$、$A$ 和 $T$ 上相差 $\log(SA)$ 因子。
- 该算法无需事先知晓 $\Delta_{\min}$,即最小子最优性差距。
- 对于折扣设置,regret 被有界为 $\mathcal{O}\left(\frac{SA}{\Delta_{\min}(1-\gamma)^6}\log\left(\frac{SAT}{\Delta_{\min}(1-\gamma)}\right)\right)$。
- 分析表明,对规划时域的 $H^6$ 依赖关系为次优,提示存在改进空间。
- 该方法成功地将模型基于分析中的乐观盈余技术,通过一种新颖的递归误差有界框架,适配至模型无关Q-learning。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。