Skip to main content
QUICK REVIEW

[论文解读] Garbage In, Reward Out: Bootstrapping Exploration in Multi-Armed Bandits

Branislav Kveton, Csaba Szepesvári|arXiv (Cornell University)|Nov 13, 2018
Advanced Bandit Algorithms Research参考文献 30被引用 13
一句话总结

本文提出 Giro,一种多臂赌博机算法,通过使用特殊设计的伪奖励进行非参数自展法,实现有效的探索。该文在伯努利赌博机中证明了 $O(K\Delta^{-1}\log n)$ 的遗憾界,首次为将非参数自展法作为系统性探索策略而非启发式方法提供了形式化依据。

ABSTRACT

We propose a bandit algorithm that explores by randomizing its history of rewards. Specifically, it pulls the arm with the highest mean reward in a non-parametric bootstrap sample of its history with pseudo rewards. We design the pseudo rewards such that the bootstrap mean is optimistic with a sufficiently high probability. We call our algorithm Giro, which stands for garbage in, reward out. We analyze Giro in a Bernoulli bandit and derive a $O(K Δ^{-1} \log n)$ bound on its $n$-round regret, where $Δ$ is the difference in the expected rewards of the optimal and the best suboptimal arms, and $K$ is the number of arms. The main advantage of our exploration design is that it easily generalizes to structured problems. To show this, we propose contextual Giro with an arbitrary reward generalization model. We evaluate Giro and its contextual variant on multiple synthetic and real-world problems, and observe that it performs well.

研究动机与目标

  • 开发一种数据驱动且可调节的多臂和上下文赌博机探索策略,避免依赖置信集或后验分布。
  • 正式证明非参数自展法作为赌博机问题中探索方法的有效性与合理性。
  • 设计一个通用框架,可自然扩展至结构化问题,如线性赌博机和上下文赌博机。
  • 为所提出的算法提供理论遗憾界,确保统计效率。
  • 通过合成数据集和真实世界数据集的实证验证,评估 Giro 及其上下文变体的性能,证明其表现优异。

提出的方法

  • Giro 从智能体的历史奖励中构建非参数自展样本,通过引入伪奖励以确保自展均值的乐观性。
  • 在每次动作选择后,为伪奖励分配极端值(例如 1 或 0),以高概率使自展均值偏向乐观。
  • 该算法选择自展样本中均值最高的动作,从而有效平衡探索与利用。
  • 理论分析表明,自展均值以高概率保持乐观,从而支持紧致的遗憾界。
  • 通过引入与上下文相关的奖励模型,该方法可自然推广至上下文赌博机。
  • 针对伯努利赌博机,通过使用二项分布采样,推导出一种高效实现,避免每轮进行完整重采样。

实验结果

研究问题

  • RQ1在多臂赌博机中,经过精心设计的伪奖励的非参数自展法能否提供理论严谨且实用的探索策略?
  • RQ2此类基于自展法的算法的遗憾性能如何?能否实现接近最优的遗憾界?
  • RQ3该算法在结构化问题(如上下文和线性赌博机)中如何推广?
  • RQ4在实践中,该方法是否优于现有的探索策略,如 ε-贪婪、OFU 和 Thompson 采样?
  • RQ5仅通过自展法的随机化是否足以诱导有效探索,而无需依赖后验采样或置信集?

主要发现

  • Giro 在 $K$-臂伯努利赌博机中实现了 $O(K\Delta^{-1}\log n)$ 的遗憾界,其速率与最优率仅相差对数因子。
  • 伪奖励的设计确保了自展均值以高概率保持乐观,这是遗憾分析的关键。
  • 理论分析揭示,采样分布中的随机化本身(而不仅仅是后验采样)即可诱导有效探索。
  • 实证评估表明,Giro 在合成数据集和真实世界数据集(包括 Adult 和 Covertype 数据集)上均表现优异。
  • 在真实世界场景中,Giro 表现优于基于神经网络的模型,表明复杂模型性能不佳的原因在于泛化问题,而非探索不足。
  • 该算法可自然推广至上下文赌博机,即使在奖励函数为非线性时,其性能依然强劲。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。