Skip to main content
QUICK REVIEW

[论文解读] Meta-Thompson Sampling

Branislav Kveton, Mikhail Konobeev|arXiv (Cornell University)|Feb 11, 2021
Advanced Bandit Algorithms Research参考文献 32被引用 4
一句话总结

该论文提出了元-汤普森采样(Meta-Thompson Sampling, MetaTS),一种元学习算法,通过在多个上下文-bandit 任务中交互,维护对实例先验的元后验分布,从而将汤普森采样适应于未知先验。该方法通过随时间学习真实先验,实现了更优的贝叶斯后悔,具有理论保证,并通过实证验证表明其性能与已知先验下的汤普森采样相当。

ABSTRACT

Efficient exploration in bandits is a fundamental online learning problem. We propose a variant of Thompson sampling that learns to explore better as it interacts with bandit instances drawn from an unknown prior. The algorithm meta-learns the prior and thus we call it MetaTS. We propose several efficient implementations of MetaTS and analyze it in Gaussian bandits. Our analysis shows the benefit of meta-learning and is of a broader interest, because we derive a novel prior-dependent Bayes regret bound for Thompson sampling. Our theory is complemented by empirical evaluation, which shows that MetaTS quickly adapts to the unknown prior.

研究动机与目标

  • 为解决在真实臂均值先验未知但来自已知元先验的情况下设计汤普森采样的挑战。
  • 开发一种计算高效的元学习算法,使其能在多个 bandit 任务中根据实际先验自适应调整探索策略。
  • 为汤普森采样提供一种新型的与先验相关的贝叶斯后悔上界,扩展其理论分析。
  • 通过实证方法证明 MetaTS 能够快速适应未知先验,并与已知先验下的汤普森采样性能相当。

提出的方法

  • 在每个任务 s 中,MetaTS 维护对未知实例先验 P_* 的元后验 Q_s,并根据先前任务的观测历史进行更新。
  • 在每个任务 s 中,MetaTS 从 Q_s 中采样一个候选先验 P_s ∼ Q_s,并在 n 轮内使用标准汤普森采样进行决策。
  • 该算法使用共轭先验(如正态分布)以实现高效的后验更新,利用正态分布 bandit 中元后验的闭式更新。
  • MetaTS 在伯努利和高斯 bandit 中均实现了高效实现,其更新基于观测到的奖励和动作选择。
  • 理论分析表明,仅需每任务一次动作选择即可对贝叶斯后悔进行上界估计,改进源于对 P_* 的适应。
  • 该方法可推广至线性 bandit,附录 D 展示了线性 bandit 中元后验的闭式更新。

实验结果

研究问题

  • RQ1能否通过在多个 bandit 实例中交互,利用元学习来改进未知先验下的汤普森采样?
  • RQ2MetaTS 的贝叶斯后悔是否可与已知真实先验下的汤普森采样相媲美?
  • RQ3在与先验相关的后悔上界方面,元学习为汤普森采样带来了哪些理论优势?
  • RQ4MetaTS 对元先验的模型误设有多鲁棒?
  • RQ5MetaTS 在高维或大规模臂数问题中是否仍能保持性能?

主要发现

  • MetaTS 的贝叶斯后悔随着元学习的进行而持续改善,即使在保守分析(仅依赖每任务一次动作选择)下也成立。
  • 实证结果表明,MetaTS 能够快速适应未知先验 P_*,并匹配已知先验下汤普森采样的性能。
  • 当臂数 K 或维度 d 增加时,后悔改进依然保持,但当先验宽度 σ₀ 接近元先验宽度 σ_q 时,改进程度会减弱。
  • MetaTS 对元先验的误设具有鲁棒性,实验中仅观察到轻微性能下降。
  • 推导出一种新型的与先验相关的汤普森采样贝叶斯后悔上界,具有更广泛的理论意义。
  • 在线性 bandit 中,具有高斯噪声的元后验更新具有闭式解,为推广至上下文 bandit 提供了可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。