Skip to main content
QUICK REVIEW

[论文解读] Posterior Sampling for Reinforcement Learning Without Episodes

Ian Osband, Benjamin Van Roy|arXiv (Cornell University)|Aug 9, 2016
Advanced Bandit Algorithms Research参考文献 7被引用 8
一句话总结

本文指出了在非回合制、无限时域马尔可夫决策过程(MDP)中,后验采样强化学习(PSRL)的遗憾边界证明中的一个关键缺陷,尤其挑战了Abbasi-Yadkori与Szepesvári(2015)论文中定理2的有效性。本文提出了一个反例来反驳该有缺陷的论证,将原结果重新归类为一个猜想,并提出了实用策略——如人为设定回合长度、加倍技巧(doubling trick)以及平滑后验采样——以在连续的非回合制环境中有效应用PSRL。

ABSTRACT

This is a brief technical note to clarify some of the issues with applying the application of the algorithm posterior sampling for reinforcement learning (PSRL) in environments without fixed episodes. In particular, this paper aims to: - Review some of results which have been proven for finite horizon MDPs (Osband et al 2013, 2014a, 2014b, 2016) and also for MDPs with finite ergodic structure (Gopalan et al 2014). - Review similar results for optimistic algorithms in infinite horizon problems (Jaksch et al 2010, Bartlett and Tewari 2009, Abbasi-Yadkori and Szepesvari 2011), with particular attention to the dynamic episode growth. - Highlight the delicate technical issue which has led to a fault in the proof of the lazy-PSRL algorithm (Abbasi-Yadkori and Szepesvari 2015). We present an explicit counterexample to this style of argument. Therefore, we suggest that the Theorem 2 in (Abbasi-Yadkori and Szepesvari 2015) be instead considered a conjecture, as it has no rigorous proof. - Present pragmatic approaches to apply PSRL in infinite horizon problems. We conjecture that, under some additional assumptions, it will be possible to obtain bounds $O( \sqrt{T} )$ even without episodic reset. We hope that this note serves to clarify existing results in the field of reinforcement learning and provides interesting motivation for future work.

研究动机与目标

  • 识别并修正无限时域MDP中PSRL遗憾边界证明中的技术缺陷。
  • 质疑Abbasi-Yadkori与Szepesvári(2015)论文中定理2的有效性,该定理声称在非回合制环境中,懒惰型PSRL变体的遗憾为O(√T)。
  • 为在无固定回合边界的环境中应用PSRL,提供实用且具有实证有效性的方法。
  • 激发未来研究,将理论保证从回合制强化学习扩展至非回合制强化学习设置。

提出的方法

  • 构建了一个反例,以反驳Abbasi-Yadkori与Szepesvári(2015)论文中论证的缺陷,证明其声称的期望遗憾为零是错误的。
  • 通过将问题视为具有扩展状态空间的有限时域MDP的特例,重新诠释PSRL算法在无限时域MDP中的适用性。
  • 提出PSRL在非回合制环境中的实用改进方法,包括基于自然时间周期或折扣机制的人为设定回合长度。
  • 引入一种平滑后验采样方法,通过时间上的线性插值生成MDP样本,以避免策略的突变。
  • 推荐使用“加倍技巧”(doubling trick)以在最优策略时域未知时,动态调整回合长度。
  • 建议对MDP参数使用贝叶斯后验分布,并通过加权平均方式结合当前与历史后验样本,以稳定策略选择。

实验结果

研究问题

  • RQ1Abbasi-Yadkori与Szepesvári(2015)论文中关于非回合制MDP下PSRL遗憾边界的定理2的证明中,存在何种缺陷?
  • RQ2在无限时域设置下,由于条件独立性而声称期望遗憾为零的论证是否成立?
  • RQ3在附加假设下,是否可能在非回合制MDP中使用PSRL实现O(√T)的遗憾?
  • RQ4在无固定回合边界的环境中,可采用哪些实用策略来有效应用PSRL?
  • RQ5当回合边界为人为设定或动态变化时,如何对后验采样进行调整,以保持策略的稳定性和性能?

主要发现

  • 构建了一个反例,表明如Abbasi-Yadkori与Szepesvári(2015)论文中所声称的,期望遗憾不可能为零,从而反驳了其论证E[λ* - λk(t)k(t) | Hk(t)1] = 0。
  • 该反例表明,当Hmax=1000且T=1000个时间步长时,遗憾至少为249,从而否定了其声称的期望遗憾为零的结论。
  • Abbasi-Yadkori与Szepesvári(2015)论文中定理2的证明因错误使用条件期望而无效,该结果应被视为一个猜想。
  • 尽管缺乏严格的遗憾边界,但实证证据表明PSRL在非回合制环境中表现良好,暗示在附加假设下该结果可能仍然成立。
  • 实用方法如人为设定回合长度、加倍技巧以及平滑后验采样,在无回合重置的场景中被证明在实践中有效。
  • 将O(√T)遗憾边界理论扩展至非回合制设置仍是开放问题,但本文为该方向的未来研究奠定了基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。