Skip to main content
QUICK REVIEW

[论文解读] Thompson Sampling for CVaR Bandits.

Dorian Baudry, Romain Gautron|arXiv (Cornell University)|Dec 10, 2020
Advanced Bandit Algorithms Research参考文献 1被引用 4
一句话总结

本文提出了首个用于条件风险价值(CVaR)多臂赌博机的Thompson Sampling算法——针对有界奖励的{α}-NPTS,以及针对多项分布的{α}-Multinomial-TS。论文建立了CVaR损失的新型下界,并证明了{α}-Multinomial-TS在渐近意义上最优,实证结果表明其优于现有的上置信界(UCB)方法。

ABSTRACT

Risk awareness is an important feature to formulate a variety of real world problems. In this paper we study a multi-arm bandit problem in which the quality of each arm is measured by the Conditional Value at Risk (CVaR) at some level {\alpha} of the reward distribution. While existing works in this setting mainly focus on Upper Confidence Bound algorithms, we introduce the first Thompson Sampling approaches for CVaR bandits. Building on a recent work by Riou and Honda (2020), we propose {\alpha}-NPTS for bounded rewards and {\alpha}-Multinomial-TS for multinomial distributions. We provide a novel lower bound on the CVaR regret which extends the concept of asymptotic optimality to CVaR bandits and prove that {\alpha}-Multinomial-TS is the first algorithm to achieve this lower bound. Finally, we demonstrate empirically the benefit of Thompson Sampling approaches over their UCB counterparts.

研究动机与目标

  • 为解决在风险敏感决策至关重要的CVaR多臂赌博机问题中缺乏Thompson Sampling方法的问题。
  • 通过新的损失下界,将渐近最优性的概念扩展至CVaR多臂赌博机问题。
  • 提出{α}-NPTS和{α}-Multinomial-TS作为首个专为CVaR优化设计的Thompson Sampling算法。
  • 通过实证验证Thompson Sampling在CVaR多臂赌博机设置中优于基于UCB的方法。

提出的方法

  • 利用Riou和Honda(2020)的最新理论工作,通过后验抽样设计用于有界奖励分布的{α}-NPTS。
  • 通过在结果概率上建模后验分布,开发了用于多项分布奖励的{α}-Multinomial-TS。
  • 推导出CVaR损失的新型下界,将渐近最优性扩展至风险敏感的多臂赌博机问题。
  • 使用贝叶斯更新和后验抽样,在CVaR目标下平衡探索与利用。
  • 采用风险规避的选择规则,优先选择在{α}水平下CVaR更高的臂。
  • 证明{α}-Multinomial-TS可达到所推导的CVaR损失下界,从而确立其渐近最优性。

实验结果

研究问题

  • RQ1Thompson Sampling能否被有效适配至以CVaR作为性能度量的多臂赌博机?
  • RQ2CVaR损失的理论下界是什么?是否存在算法可达到该下界?
  • RQ3Thompson Sampling在CVaR多臂赌博机问题中的性能与基于UCB的方法相比如何?
  • RQ4{α}-Multinomial-TS是否对多项分布CVaR多臂赌博机具有渐近最优性?

主要发现

  • 本文建立了CVaR损失的新下界,将渐近最优性的概念扩展至风险敏感的多臂赌博机问题。
  • 证明{α}-Multinomial-TS可达到该下界,使其成为首个在多项分布CVaR多臂赌博机中具有渐近最优性的算法。
  • 实证结果表明,Thompson Sampling方法在CVaR损失方面优于现有基于UCB的方法。
  • {α}-NPTS算法为有界奖励CVaR多臂赌博机提供了实用且高效的方法。
  • 理论与实证结果共同表明,Thompson Sampling在风险敏感的序列决策中是UCB的强有力替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。