Skip to main content
QUICK REVIEW

[论文解读] Stochastic Bandits with Context Distributions

Johannes Kirschner, Andreas Krause|arXiv (Cornell University)|Jun 6, 2019
Advanced Bandit Algorithms Research参考文献 34被引用 17
一句话总结

本文提出了一种新颖的随机上下文Bandit模型,其中环境提供上下文的概率分布而非确切的上下文,且学习者仅能观测到该分布。作者将UCB算法适配到此设定中,证明了线性和核化奖励函数下为O(d√T)的高概率遗憾界,该界为阶最优,当分布为狄拉克δ函数时,该结果推广了标准的上下文Bandit模型。

ABSTRACT

We introduce a stochastic contextual bandit model where at each time step the environment chooses a distribution over a context set and samples the context from this distribution. The learner observes only the context distribution while the exact context realization remains hidden. This allows for a broad range of applications where the context is stochastic or when the learner needs to predict the context. We leverage the UCB algorithm to this setting and show that it achieves an order-optimal high-probability bound on the cumulative regret for linear and kernelized reward functions. Our results strictly generalize previous work in the sense that both our model and the algorithm reduce to the standard setting when the environment chooses only Dirac delta distributions and therefore provides the exact context to the learner. We further analyze a variant where the learner observes the realized context after choosing the action. Finally, we demonstrate the proposed method on synthetic and real-world datasets.

研究动机与目标

  • 解决当真实上下文不可观测、仅能获得上下文分布时的上下文Bandit学习挑战。
  • 开发一种学习算法,使其与基于上下文分布的最佳动作选择竞争,而非与实际观测到的上下文竞争。
  • 建立在特征维度d和时间范围T上阶最优的高概率遗憾界。
  • 通过核均值嵌入和分布风险最小化,将框架扩展至核化奖励函数。
  • 分析一种变体设定,即在动作选择后可观测实际上下文,从而拓展适用范围。

提出的方法

  • 该模型假设在每轮t,环境选择一个上下文分布μt,上下文ct从μt中抽取,但学习者仅能观测到μt。
  • 奖励函数假设为特征向量φx,c的线性函数:f(x,c) = φx,c⊤θ,其中未知参数θ ∈ ℝd。
  • 通过利用观测到的奖励和上下文分布,基于最小二乘估计器构建θ的置信集,将UCB算法适配到此设定。
  • 提出一种实用的算法变体,仅需对上下文分布μt具有采样访问权限,而无需完全掌握其分布。
  • 在核化设定中,假设奖励函数属于已知的再生核Hilbert空间(RKHS),并使用核均值嵌入来估计期望奖励。
  • 分析利用集中不等式和信息论工具,证明线性设定下遗憾界为O(d√T)的高概率形式。

实验结果

研究问题

  • RQ1当真实上下文被隐藏且仅可观测到上下文分布时,上下文Bandit算法能否实现次线性遗憾?
  • RQ2适配于上下文分布的UCB算法,在线性Bandit设定下能否实现阶最优的遗憾?
  • RQ3在上下文分布不确定性存在时,遗憾界如何随特征维度d和时间范围T变化?
  • RQ4能否通过核均值嵌入和分布风险最小化,将该框架扩展至核化奖励函数?
  • RQ5与仅观测分布相比,在动作选择后可观测实际上下文,性能提升如何?

主要发现

  • 所提出的基于UCB的算法在线性Bandit设定下实现了O(d√T)的高概率遗憾界,该界在对数因子范围内为阶最优。
  • 即使环境自适应地选择上下文分布,且学习者仅能观测分布(无法观测实际上下文),该遗憾界依然成立。
  • 该方法推广了标准的上下文Bandit模型:当上下文分布为狄拉克δ分布时,该算法退化为经典UCB算法。
  • 在核化设定中,方法利用核均值嵌入估计期望奖励,并获得依赖于核函数特征谱衰减的遗憾界。
  • 在仅具有上下文分布采样访问的现实场景中,该算法仍保持实用性,无需完整掌握分布知识。
  • 在一种变体设定中,若在动作选择后可观测实际上下文,遗憾界可进一步改善,从而在需要决策时进行上下文预测的应用中实现更优性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。