[论文解读] Exploration Bonus for Regret Minimization in Undiscounted Discrete and Continuous Markov Decision Processes
本文提出了 SCAL+ 和 C-SCAL+,这是针对未折扣的马尔可夫决策过程(MDPs)的高效探索算法,通过使用探索奖励实现次线性遗憾。通过在经验估计的 MDP 上直接规划并添加奖励项,它们在显著降低计算复杂度的同时,达到了先前乐观算法(如 SCAL、UCCRL)的遗憾边界,使其成为首个在连续状态未折扣 MDP 中具有遗憾保证的可实现算法。
We introduce and analyse two algorithms for exploration-exploitation in discrete and continuous Markov Decision Processes (MDPs) based on exploration bonuses. SCAL$^+$ is a variant of SCAL (Fruit et al., 2018) that performs efficient exploration-exploitation in any unknown weakly-communicating MDP for which an upper bound C on the span of the optimal bias function is known. For an MDP with $S$ states, $A$ actions and $Γ\leq S$ possible next states, we prove that SCAL$^+$ achieves the same theoretical guarantees as SCAL (i.e., a high probability regret bound of $\widetilde{O}(C\sqrt{ΓSAT})$), with a much smaller computational complexity. Similarly, C-SCAL$^+$ exploits an exploration bonus to achieve sublinear regret in any undiscounted MDP with continuous state space. We show that C-SCAL$^+$ achieves the same regret bound as UCCRL (Ortner and Ryabko, 2012) while being the first implementable algorithm with regret guarantees in this setting. While optimistic algorithms such as UCRL, SCAL or UCCRL maintain a high-confidence set of plausible MDPs around the true unknown MDP, SCAL$^+$ and C-SCAL$^+$ leverage on an exploration bonus to directly plan on the empirically estimated MDP, thus being more computationally efficient.
研究动机与目标
- 开发适用于未折扣 MDP 的高效探索-利用算法,并具备可证明的遗憾保证。
- 解决现有乐观算法在维护合理 MDP 高置信集时的计算低效问题。
- 将探索奖励的应用——常见于多臂赌博机和折扣 MDP 中——扩展到未折扣、一般无限时域 MDP 中。
- 为连续状态未折扣 MDP 提供首个具有遗憾保证的可实现算法。
- 在大幅降低计算复杂度的同时,匹配 SCAL 和 UCCRL 的理论遗憾边界。
提出的方法
- SCAL+ 在离散 MDP 的经验奖励中添加探索奖励,使算法能够直接在估计的 MDP 上进行规划,而非维护一组合理的 MDP 高置信集。
- SCAL+ 中的探索奖励源自最优偏差函数的跨度,其规模为 $\widetilde{O}(c / \sqrt{N(s,a)})$,其中 $c$ 是偏差跨度的上界。
- C-SCAL+ 将探索奖励方法扩展到连续状态 MDP,使用函数逼近和奖励项以确保次线性遗憾。
- 两种算法均基于面对不确定性时的乐观(OFU)原则,但避免了维护一组合理 MDP 所带来的计算开销。
- 算法采用基于回合的学习方法,结合停止时间机制,以确保充分探索并维持对估计 MDP 的高概率置信度。
- 理论分析证明,SCAL+ 实现了 $\widetilde{O}(c\sqrt{\Gamma SAT})$ 的遗憾,且计算成本远低于 SCAL;C-SCAL+ 在连续 MDP 中实现了与 UCCRL 相同的遗憾边界。
实验结果
研究问题
- RQ1探索奖励能否在未折扣 MDP 中有效使用,以实现次线性遗憾,同时避免维护 MDP 的高置信集?
- RQ2能否在保持遗憾保证的前提下,降低如 SCAL 和 UCCRL 等乐观算法的计算复杂度?
- RQ3能否设计一种在连续状态未折扣 MDP 中具有遗憾保证的可实现算法,通过使用探索奖励?
- RQ4基于偏差跨度的探索奖励与基于置信集的方法相比,在遗憾和效率方面有何差异?
- RQ5能否通过在估计 MDP 上直接规划并添加奖励项,高效地应用 OFU 原则于未折扣 MDP 中?
主要发现
- SCAL+ 实现了与 SCAL 相同的遗憾边界——$\widetilde{O}(c\sqrt{\Gamma SAT})$——但通过避免维护高置信集,显著降低了计算复杂度。
- C-SCAL+ 在连续状态未折扣 MDP 中实现了与 UCCRL 相同的遗憾边界,使其成为首个具有此类保证的可实现算法。
- SCAL+ 中的探索奖励规模为 $\widetilde{O}(c / \sqrt{N(s,a)})$,其中 $c$ 是最优偏差函数跨度的上界。
- 在估计 MDP 上直接规划并添加奖励项,可在保持理论遗憾保证的同时实现高效计算。
- 理论分析确认,两种算法通过基于回合的学习和停止时间机制,维持了对估计 MDP 的高概率置信度。
- 结果表明,探索奖励可被有效扩展至未折扣 MDP,弥合了赌博机方法与完整强化学习算法之间的差距。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。