[论文解读] Thompson Sampling for CVaR Bandits.
本文提出了首个用于条件风险价值(CVaR)多臂赌博机的Thompson Sampling算法——针对有界奖励的{α}-NPTS,以及针对多项分布的{α}-Multinomial-TS。论文建立了CVaR损失的新型下界,并证明了{α}-Multinomial-TS在渐近意义上最优,实证结果表明其优于现有的上置信界(UCB)方法。
Risk awareness is an important feature to formulate a variety of real world problems. In this paper we study a multi-arm bandit problem in which the quality of each arm is measured by the Conditional Value at Risk (CVaR) at some level {\alpha} of the reward distribution. While existing works in this setting mainly focus on Upper Confidence Bound algorithms, we introduce the first Thompson Sampling approaches for CVaR bandits. Building on a recent work by Riou and Honda (2020), we propose {\alpha}-NPTS for bounded rewards and {\alpha}-Multinomial-TS for multinomial distributions. We provide a novel lower bound on the CVaR regret which extends the concept of asymptotic optimality to CVaR bandits and prove that {\alpha}-Multinomial-TS is the first algorithm to achieve this lower bound. Finally, we demonstrate empirically the benefit of Thompson Sampling approaches over their UCB counterparts.
研究动机与目标
- 为解决在风险敏感决策至关重要的CVaR多臂赌博机问题中缺乏Thompson Sampling方法的问题。
- 通过新的损失下界,将渐近最优性的概念扩展至CVaR多臂赌博机问题。
- 提出{α}-NPTS和{α}-Multinomial-TS作为首个专为CVaR优化设计的Thompson Sampling算法。
- 通过实证验证Thompson Sampling在CVaR多臂赌博机设置中优于基于UCB的方法。
提出的方法
- 利用Riou和Honda(2020)的最新理论工作,通过后验抽样设计用于有界奖励分布的{α}-NPTS。
- 通过在结果概率上建模后验分布,开发了用于多项分布奖励的{α}-Multinomial-TS。
- 推导出CVaR损失的新型下界,将渐近最优性扩展至风险敏感的多臂赌博机问题。
- 使用贝叶斯更新和后验抽样,在CVaR目标下平衡探索与利用。
- 采用风险规避的选择规则,优先选择在{α}水平下CVaR更高的臂。
- 证明{α}-Multinomial-TS可达到所推导的CVaR损失下界,从而确立其渐近最优性。
实验结果
研究问题
- RQ1Thompson Sampling能否被有效适配至以CVaR作为性能度量的多臂赌博机?
- RQ2CVaR损失的理论下界是什么?是否存在算法可达到该下界?
- RQ3Thompson Sampling在CVaR多臂赌博机问题中的性能与基于UCB的方法相比如何?
- RQ4{α}-Multinomial-TS是否对多项分布CVaR多臂赌博机具有渐近最优性?
主要发现
- 本文建立了CVaR损失的新下界,将渐近最优性的概念扩展至风险敏感的多臂赌博机问题。
- 证明{α}-Multinomial-TS可达到该下界,使其成为首个在多项分布CVaR多臂赌博机中具有渐近最优性的算法。
- 实证结果表明,Thompson Sampling方法在CVaR损失方面优于现有基于UCB的方法。
- {α}-NPTS算法为有界奖励CVaR多臂赌博机提供了实用且高效的方法。
- 理论与实证结果共同表明,Thompson Sampling在风险敏感的序列决策中是UCB的强有力替代方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。