[论文解读] Regret Bounds for Discounted MDPs
本文引入了 $γ$-regret 作为非回合制强化学习的一种新型性能度量,解决了在有限时域设置下平均奖励遗憾的局限性。理论分析表明,$γ$-regret 的增长速率约为 $\left(\frac{\sqrt{SAT}}{(1-\gamma)^{1/2}}\right)$,相较于以往方法,提供了更紧致且更实用的有限时间最优性准则。
Reinforcement learning (RL) has traditionally been understood from an episodic perspective; the concept of non-episodic RL, where there is no restart and therefore no reliable recovery, remains elusive. A fundamental question in non-episodic RL is how to measure the performance of a learner and derive algorithms to maximize such performance. Conventional wisdom is to maximize the difference between the average reward received by the learner and the maximal long-term average reward. In this paper, we argue that if the total time budget is relatively limited compared to the complexity of the environment, such comparison may fail to reflect the finite-time optimality of the learner. We propose a family of measures, called $γ$-regret, which we believe to better capture the finite-time optimality. We give motivations and derive lower and upper bounds for such measures. Note: A follow-up work (arXiv:2010.00587) has improved both our lower and upper bound, the gap is now closed at $ ildeΘ\left(\frac{\sqrt{SAT}}{(1 - γ)^{\frac{1}{2}}} ight)$.
研究动机与目标
- 解决在时间预算 $T$ 相对于环境复杂度较小时,平均奖励遗憾无法准确捕捉有限时间性能的问题。
- 提出 $γ$-regret 作为新的性能度量,更好地反映非回合制马尔可夫决策过程中的有限时域最优性。
- 推导 $γ$-regret 的理论下界与上界,以验证其作为性能度量的适用性。
- 提供一个用于评估和设计强化学习算法的框架,特别关注在时间预算有限时的短期性能。
提出的方法
- 将 $γ$-regret 定义为最优 $γ$-折扣值与在 $T$ 步内实际获得奖励之间的累积差值:$\textnormal{Regret}_{\gamma}(T) = \sum_{h=0}^{T-1}(1-\gamma)V^{*,\gamma}_{s_h} - \sum_{h=0}^{T-1}r_h$。
- 采用双 Q-learning 方法以减轻过估计偏差,并管理非回合制值函数学习中的自相关依赖问题。
- 借鉴回合制强化学习中的证明技术(如 Jin 等,2018),以控制非回合制设置中因无重置而导致的遗憾膨胀。
- 通过分析期望遗憾并结合集中不等式与次优步数的界,建立上界。
- 通过将 Jaksch 等(2010)的两状态 MDP 构造方法适配到折扣设置,推导出下界。
- 使用 $γ$-折扣值函数 $V^{*,\gamma}_s = \sup_\pi \mathbb{E}_\pi[\sum_{h=0}^\infty \gamma^h r_h \mid s_0 = s]$ 作为性能比较的基准。
实验结果
研究问题
- RQ1如何为非回合制强化学习定义一种性能度量,使其在 $T$ 较小时能反映有限时间最优性?
- RQ2为何平均奖励遗憾在时间预算有限、环境复杂的场景下不足以捕捉有限时域性能?
- RQ3所提出的 $γ$-regret 度量的理论下界与上界分别是什么?
- RQ4$γ$-regret 框架是否能带来优于现有平均奖励遗憾公式的算法设计?
- RQ5折扣因子 $\gamma$ 在非回合制设置中如何影响遗憾边界?
主要发现
- 本文建立了期望 $γ$-regret 的理论上界为 $\tilde{O}\left(\frac{\sqrt{SAT}}{(1-\gamma)^{1/2}}\right)$,该界比以往的平均奖励遗憾边界更紧致。
- 上界通过分析次优步数并结合双 Q-learning 与自适应学习率控制遗憾膨胀而推导得出。
- 通过两状态 MDP 构造证明了下界,表明在标准假设下,$γ$-regret 不可能优于 $\Omega\left(\frac{\sqrt{SAT}}{(1-\gamma)^{1/2}}\right)$。
- 后续工作(He 等,2020)填补了上下界之间的差距,确认了该界在 $\tilde{\Theta}\left(\frac{\sqrt{SAT}}{(1-\gamma)^{1/2}}\right)$ 处为紧致界。
- 分析表明,若不施加一致性假设,现有对次优步数的界($N_{\gamma}(\epsilon,\delta)$)无法导出更紧的遗憾边界。
- 所提出的 $γ$-regret 度量避免了将有限时域学习者与无限时域最优策略进行比较的陷阱,尤其在 $T \ll \text{mixing time}$ 时更为显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。