Skip to main content
QUICK REVIEW

[论文解读] Improved Analysis of UCRL2 with Empirical Bernstein Inequality

Ronan Fruit, Matteo Pirotta|arXiv (Cornell University)|Jul 10, 2020
Advanced Bandit Algorithms Research参考文献 14被引用 11
一句话总结

本文提出 UCRL2B,一种用于通信马尔可夫决策过程(MDPs)强化学习的改进型探索-利用算法,通过利用经验伯恩斯坦不等式来收紧奖励和转移概率的置信区间。主要贡献是实现了 $\widetilde{O}(\sqrt{D\Gamma SAT})$ 的遗憾界,相比先前的界限,消除了次优的 $\sqrt{S}$ 因子,并实现了对状态数和动作数更紧密的依赖关系。

ABSTRACT

We consider the problem of exploration-exploitation in communicating Markov Decision Processes. We provide an analysis of UCRL2 with Empirical Bernstein inequalities (UCRL2B). For any MDP with $S$ states, $A$ actions, $Γ\leq S$ next states and diameter $D$, the regret of UCRL2B is bounded as $\widetilde{O}(\sqrt{DΓS A T})$.

研究动机与目标

  • 通过利用更紧致的置信区间,改进 UCRL2 算法在通信 MDP 中的遗憾分析。
  • 通过用经验伯恩斯坦不等式替代霍夫丁置信区间,解决先前遗憾界中 $\sqrt{S}$ 依赖的次优性问题。
  • 实现一个更紧致的遗憾界,其依赖于 $\Gamma$(每个状态-动作对可到达的下一状态的最大数量),而非 $S$(状态总数)。
  • 在高概率保证下,对基于经验伯恩斯坦不等式的 UCRL2(UCRL2B)提供更精细的理论分析。
  • 建立一个遗憾界,其在对数因子范围内与信息论下界一致,相较于先前结果,在状态空间和动作空间大小的依赖关系上有所改进。

提出的方法

  • UCRL2B 使用经验伯恩斯坦不等式而非霍夫丁不等式,构建奖励和转移概率的高概率置信区间。
  • 该算法在一组可能的 MDP 上维护一个扩展的 MDP 模型 $\mathcal{M}_k$,其中每个模型均满足由经验伯恩斯坦不等式导出的置信区间。
  • 在每个阶段 $k$,该算法通过在置信区间约束的 MDP 上使用值迭代,计算最优贝尔曼方程的 $r_{\max}/t_k$-近似解。
  • 该算法使用一种新颖的方差分解和高概率浓度不等式,以控制价值函数估计中平方偏差的总和。
  • 关键技术组件是推导出对总方差 $\sum_t \mathbb{V}_{\widehat{p}_{k_t}(\cdot|s_t)}(\alpha h_{k_t})$ 的高概率上界,该上界在经验伯恩斯坦框架下被证明为 $\widetilde{O}(r_{\max}^2 D T)$。
  • 最终的遗憾界通过结合方差控制、置信区间的紧致性以及对阶段和状态-动作对的仔细联合界分析推导得出,确保了高概率的有效性。

实验结果

研究问题

  • RQ1通过用经验伯恩斯坦不等式替代基于霍夫丁的置信区间,能否改进 UCRL2 的遗憾界?
  • RQ2使用经验伯恩斯坦不等式是否能实现对状态数 $S$ 和动作数 $A$ 的更紧致依赖?
  • RQ3在通信 MDP 中,基于经验伯恩斯坦置信集的最优遗憾标度为何?
  • RQ4能否通过更紧致的浓度不等式,消除先前 UCRL2 遗憾界中的 $\sqrt{S}$ 因子?
  • RQ5与 $S$ 相比,该算法的性能在 $\Gamma$(每个状态-动作对可到达的下一状态的最大数量)上的缩放关系如何?

主要发现

  • UCRL2B 的遗憾以高概率被限制在 $\widetilde{O}(\sqrt{D\Gamma SAT})$ 内,其中 $D$ 为 MDP 直径,$\Gamma$ 为每个状态-动作对可到达的下一状态的最大数量,$S$ 为状态数,$A$ 为动作数,$T$ 为时间范围。
  • 该界限相比 UCRL2 的先前 $\widetilde{O}(DS\sqrt{AT})$ 界,消除了显式的 $\sqrt{S}$ 因子,并以 $\sqrt{\Gamma}$ 取代,而 $\Gamma$ 通常更小。
  • 该改进通过基于经验伯恩斯坦不等式推导出的更紧致置信区间实现,这些区间能更好地捕捉奖励和转移概率的方差。
  • 分析表明,价值函数估计中方差的总和通过一个与 $\widetilde{O}(r_{\max}^2 D T)$ 成比例的高概率上界得到控制,从而实现了更紧致的遗憾控制。
  • 最终的遗憾界在对数因子范围内与信息论下界一致,表明其在 $D$、$\Gamma$、$S$、$A$ 和 $T$ 的依赖关系上接近最优。
  • 该界限在概率至少 $1 - \delta$ 下成立,且对 $\delta$ 的依赖为对数关系,这在类似分析中是标准的,不影响渐近缩放。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。