Skip to main content
QUICK REVIEW

[论文解读] Thompson Sampling is Asymptotically Optimal in General Environments

Jan Leike, Tor Lattimore|arXiv (Cornell University)|Feb 25, 2016
Advanced Bandit Algorithms Research参考文献 15被引用 18
一句话总结

该论文证明了在一般随机环境中,Thompson采样在无马尔可夫性、遍历性或完全可观测性假设的前提下,能够实现渐近最优性与次线性遗憾。通过从可数环境类的后验分布中采样,并针对一个能捕捉折扣函数大部分质量的前瞻时域采取最优行动,该方法收敛至最优性能,并在可恢复性条件下实现渐近可忽略的遗憾。

ABSTRACT

We discuss a variant of Thompson sampling for nonparametric reinforcement learning in a countable classes of general stochastic environments. These environments can be non-Markov, non-ergodic, and partially observable. We show that Thompson sampling learns the environment class in the sense that (1) asymptotically its value converges to the optimal value in mean and (2) given a recoverability assumption regret is sublinear.

研究动机与目标

  • 在一般、非马尔可夫、非遍历及部分可观测的随机环境中,建立Thompson采样渐近最优性与次线性遗憾。
  • 通过证明Thompson采样避免先验偏差并实现客观最优性,克服贝叶斯智能体在一般强化学习中的局限性。
  • 为非参数、可数环境类提供理论保证,且无需对遍历性或后验行为施加强假设。
  • 在一般强化学习框架中调和贝叶斯探索与频率学派遗憾界。
  • 证明Thompson采样在温和的可恢复性假设下,可在均值意义下实现渐近最优性,并实现次线性遗憾。

提出的方法

  • Thompson采样从可数个随机环境类的后验分布中采样一个环境模型ρ。
  • 对每个采样的环境ρ,智能体在能捕捉折扣函数大部分质量的前瞻时域内遵循ρ-最优策略。
  • 在每个时间步,通过从后验中重新采样并针对当前有效时域最优行动来更新策略。
  • 分析依赖于可恢复性假设,以确保智能体能够脱离不良状态并最终恢复最优性能。
  • 理论结果通过贝叶斯更新推导,并利用后验集中在与真实环境不可区分的环境上的性质。
  • 通过耦合论证和满足特定可积性与衰减条件的折扣函数,建立遗憾界。

实验结果

研究问题

  • RQ1在无马尔可夫性或遍历性假设的一般随机环境中,Thompson采样能否实现均值意义下的渐近最优性?
  • RQ2在可恢复性条件下,Thompson采样在一般环境中是否产生次线性遗憾?
  • RQ3当先验被错误指定时,Thompson采样与贝叶斯最优智能体在遗憾和收敛性方面有何比较?
  • RQ4Thompson采样能否通过其探索机制实现策略外预测或信息增益?
  • RQ5在所考虑的一般设定下,Thompson采样是否为弱渐近最优?

主要发现

  • Thompson采样在均值意义下渐近最优:策略的折扣价值收敛至该类中所有环境的最优值。
  • 在可恢复性假设下,Thompson采样的最坏情况遗憾为次线性,即Rₘ(πₜ, μ) ∈ o(m)(πₜ为Thompson采样策略)。
  • 收敛性以概率成立,且无需对后验行为或遍历性施加强假设。
  • 该遗憾界是首次在如此一般化的环境中(包括非马尔可夫和部分可观测设定)为Thompson采样建立的。
  • Thompson采样的探索是面向奖励的,而非信息最大化,其探索策略与Bayes-Exp不同。
  • 尽管存在强先验偏差,当先验对ξ赋予高概率时,Thompson采样在贝叶斯混合ξ中仍能实现近似最优性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。