Skip to main content
QUICK REVIEW

[论文解读] Learning Unknown Markov Decision Processes: A Thompson Sampling Approach

Yi Ouyang, Mukul Gagrani|arXiv (Cornell University)|Sep 14, 2017
Advanced Bandit Algorithms Research参考文献 9被引用 14
一句话总结

该论文提出了一种用于学习未知弱连通马尔可夫决策过程(MDP)的强化学习算法——动态回合泰勒斯采样(TSDE)。通过从 MDP 参数的后验分布中进行采样,并结合两种停止准则——状态-动作对访问次数加倍和受控的回合长度增长,TSDE 实现了 $\tilde{O}(HS\sqrt{AT})$ 的贝叶斯期望遗憾边界,与该类 MDP 的最佳已知理论性能一致,并在模拟中优于现有算法。

ABSTRACT

We consider the problem of learning an unknown Markov Decision Process (MDP) that is weakly communicating in the infinite horizon setting. We propose a Thompson Sampling-based reinforcement learning algorithm with dynamic episodes (TSDE). At the beginning of each episode, the algorithm generates a sample from the posterior distribution over the unknown model parameters. It then follows the optimal stationary policy for the sampled model for the rest of the episode. The duration of each episode is dynamically determined by two stopping criteria. The first stopping criterion controls the growth rate of episode length. The second stopping criterion happens when the number of visits to any state-action pair is doubled. We establish $ ilde O(HS\sqrt{AT})$ bounds on expected regret under a Bayesian setting, where $S$ and $A$ are the sizes of the state and action spaces, $T$ is time, and $H$ is the bound of the span. This regret bound matches the best available bound for weakly communicating MDPs. Numerical results show it to perform better than existing algorithms for infinite horizon MDPs.

研究动机与目标

  • 为解决在无特殊结构假设(如常返性或已知常返状态)的一般无限时域 MDP 上缺乏理论基础的泰勒斯采样算法的问题。
  • 设计一种动态回合调度机制,以在弱连通 MDP 中实现强遗憾保证。
  • 通过后验采样和自适应回合终止,实现探索与利用的平衡。
  • 建立与弱连通 MDP 最佳已知理论性能相匹配的遗憾边界。

提出的方法

  • 该算法在每个回合开始时,从对未知 MDP 参数的当前信念中进行后验采样,生成一个模型样本。
  • 每个回合在任一状态-动作对的访问次数加倍(加倍技巧)或回合长度随时间线性增长时结束。
  • 通过增长率准则动态控制回合长度,以确保充分探索并保障遗憾分析的稳定性。
  • 在每个回合中,智能体始终遵循所采样 MDP 的最优平稳策略。
  • 该算法利用贝叶斯推断,并在转移概率上使用狄利克雷先验以维护后验分布。
  • 遗憾分析结合了集中不等式以及对回合数量和跨度的界,推导出最终的遗憾边界。

实验结果

研究问题

  • RQ1泰勒斯采样能否在无结构假设(如常返性或已知常返状态)的一般无限时域 MDP 上有效应用?
  • RQ2在 MDP 的泰勒斯采样中,实现强遗憾边界的必要回合终止准则是什么?
  • RQ3结合增长率控制与访问次数加倍的动态回合长度调度,是否能带来更优的遗憾性能?
  • RQ4所提出的 TSDE 算法在经验上与具有相似遗憾阶的现有算法相比如何?

主要发现

  • TSDE 实现了 $\tilde{O}(HS\sqrt{AT})$ 的贝叶斯期望遗憾边界,与弱连通 MDP 的最佳已知边界一致。
  • 遗憾边界在对数因子范围内是紧的,其数量级接近 $T$ 的理论下界。
  • 在随机生成的 MDP 上的模拟中,TSDE 在期望遗憾方面显著优于 UCRL2、TSMDP 和懒惰 PSRL。
  • 在 RiverSwim 基准测试中,TSDE 超过所有基线方法,包括使用精心选择重采样状态的 TSMDP,凸显了其对模型不确定性的鲁棒性。
  • TSDE 与懒惰 PSRL 之间的性能差距表明,第一种停止准则(增长率控制)在平衡探索与利用方面具有关键作用。
  • 结果表明,尽管分析基于贝叶斯框架,TSDE 在非贝叶斯设置下也可能实现类似的遗憾边界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。