QUICK REVIEW
[论文解读] Thompson Sampling is Asymptotically Optimal in General Environments
Jan Leike, Tor Lattimore|arXiv (Cornell University)|Feb 25, 2016
Advanced Bandit Algorithms Research参考文献 15被引用 18
一句话总结
该论文证明了在一般随机环境中,Thompson采样在无马尔可夫性、遍历性或完全可观测性假设的前提下,能够实现渐近最优性与次线性遗憾。通过从可数环境类的后验分布中采样,并针对一个能捕捉折扣函数大部分质量的前瞻时域采取最优行动,该方法收敛至最优性能,并在可恢复性条件下实现渐近可忽略的遗憾。
ABSTRACT
We discuss a variant of Thompson sampling for nonparametric reinforcement learning in a countable classes of general stochastic environments. These environments can be non-Markov, non-ergodic, and partially observable. We show that Thompson sampling learns the environment class in the sense that (1) asymptotically its value converges to the optimal value in mean and (2) given a recoverability assumption regret is sublinear.
研究动机与目标
- 在一般、非马尔可夫、非遍历及部分可观测的随机环境中,建立Thompson采样渐近最优性与次线性遗憾。
- 通过证明Thompson采样避免先验偏差并实现客观最优性,克服贝叶斯智能体在一般强化学习中的局限性。
- 为非参数、可数环境类提供理论保证,且无需对遍历性或后验行为施加强假设。
- 在一般强化学习框架中调和贝叶斯探索与频率学派遗憾界。
- 证明Thompson采样在温和的可恢复性假设下,可在均值意义下实现渐近最优性,并实现次线性遗憾。
提出的方法
- Thompson采样从可数个随机环境类的后验分布中采样一个环境模型ρ。
- 对每个采样的环境ρ,智能体在能捕捉折扣函数大部分质量的前瞻时域内遵循ρ-最优策略。
- 在每个时间步,通过从后验中重新采样并针对当前有效时域最优行动来更新策略。
- 分析依赖于可恢复性假设,以确保智能体能够脱离不良状态并最终恢复最优性能。
- 理论结果通过贝叶斯更新推导,并利用后验集中在与真实环境不可区分的环境上的性质。
- 通过耦合论证和满足特定可积性与衰减条件的折扣函数,建立遗憾界。
实验结果
研究问题
- RQ1在无马尔可夫性或遍历性假设的一般随机环境中,Thompson采样能否实现均值意义下的渐近最优性?
- RQ2在可恢复性条件下,Thompson采样在一般环境中是否产生次线性遗憾?
- RQ3当先验被错误指定时,Thompson采样与贝叶斯最优智能体在遗憾和收敛性方面有何比较?
- RQ4Thompson采样能否通过其探索机制实现策略外预测或信息增益?
- RQ5在所考虑的一般设定下,Thompson采样是否为弱渐近最优?
主要发现
- Thompson采样在均值意义下渐近最优:策略的折扣价值收敛至该类中所有环境的最优值。
- 在可恢复性假设下,Thompson采样的最坏情况遗憾为次线性,即Rₘ(πₜ, μ) ∈ o(m)(πₜ为Thompson采样策略)。
- 收敛性以概率成立,且无需对后验行为或遍历性施加强假设。
- 该遗憾界是首次在如此一般化的环境中(包括非马尔可夫和部分可观测设定)为Thompson采样建立的。
- Thompson采样的探索是面向奖励的,而非信息最大化,其探索策略与Bayes-Exp不同。
- 尽管存在强先验偏差,当先验对ξ赋予高概率时,Thompson采样在贝叶斯混合ξ中仍能实现近似最优性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。