Skip to main content
QUICK REVIEW

[论文解读] On the Optimality of Perturbations in Stochastic and Adversarial Multi-armed Bandit Problems

Baekjin Kim, Ambuj Tewari|arXiv (Cornell University)|Feb 2, 2019
Advanced Bandit Algorithms Research参考文献 24被引用 3
一句话总结

本文首次为亚高斯奖励下基于扰动的随机多臂赌博机算法建立了统一的遗憾分析,证明了对亚威布尔分布和有界扰动的实例最优遗憾界。此外,本文识别出通过扰动实现极小化极大最优性的根本障碍,表明最优扰动必须为弗雷chet型,尤其在对抗性设置中,Tsallis 熵正则化仍优于已知的扰动方案。

ABSTRACT

We investigate the optimality of perturbation based algorithms in the stochastic and adversarial multi-armed bandit problems. For the stochastic case, we provide a unified regret analysis for both sub-Weibull and bounded perturbations when rewards are sub-Gaussian. Our bounds are instance optimal for sub-Weibull perturbations with parameter 2 that also have a matching lower tail bound, and all bounded support perturbations where there is sufficient probability mass at the extremes of the support. For the adversarial setting, we prove rigorous barriers against two natural solution approaches using tools from discrete choice theory and extreme value theory. Our results suggest that the optimal perturbation, if it exists, will be of Frechet-type.

研究动机与目标

  • 为亚高斯奖励下的基于扰动的随机多臂赌博机算法提供统一的遗憾分析。
  • 识别出扰动算法在何种条件下可实现实例最优遗憾,特别是针对亚威布尔分布和有界支持扰动。
  • 研究扰动是否可在对抗性赌博机中实现极小化极大最优性,以匹配Tsallis熵正则化的性能。
  • 建立理论障碍,以说明在对抗性设置中通过扰动实现极小化极大最优性的两种自然方法为何不可行。

提出的方法

  • 基于亚高斯奖励,推导出使用亚威布尔和有界扰动的跟随扰动领导者(FTPL)算法的一般遗憾界。
  • 应用极值理论和离散选择理论,分析扰动分布的尾部行为及其对遗憾的影响。
  • 利用Gumbel引理及正则化与扰动之间的联系,将具有高斯先验的Thompson采样重新解释为一种扰动算法。
  • 采用Abernethy等人[2]提出的危险率条件,对扰动分布进行分类,并评估其在对抗性赌博机中的适用性。
  • 分析由Tsallis熵诱导的选择概率函数,并证明其无法被任何K ≥ 4个臂的扰动精确复制。
  • 基于渐近尾部行为和极值理论,证明与Tsallis熵等价的扰动必须为弗雷chet型。

实验结果

研究问题

  • RQ1在亚高斯奖励的随机多臂赌博机中,基于扰动的算法在何种条件下可实现实例最优遗憾?
  • RQ2扰动能否在对抗性赌博机中复制Tsallis熵正则化的极小化极大最优遗憾?
  • RQ3是否存在根本性的理论障碍,使得扰动无法匹配基于熵的正则化器(如Tsallis熵)的性能?
  • RQ4在对抗性赌博机中,最优基于扰动的算法所需的分布类(如弗雷chet、Gumbel)是什么?
  • RQ5是否存在一种扰动分布,能精确模拟FTRL在Tsallis熵正则化下的选择概率?

主要发现

  • 本文建立了参数为2的亚威布尔扰动的实例最优遗憾界及其匹配的下尾界,以及在极端位置具有足够质量的有界支持扰动的实例最优遗憾界。
  • 对于有界支持扰动,分析涵盖了均匀分布和Rademacher分布,从而为一种从置信区间边界中随机选择的UCB随机变体建立了新的遗憾界。
  • 证明了具有高斯先验和高斯奖励的Thompson采样等价于具有高斯扰动的基于扰动的算法,将先前仅限于高斯设置的结果推广至更一般情形。
  • 本文证明,当K ≥ 4时,没有任何扰动能精确复制FTRL与Tsallis熵正则化的选择概率,从而解决了关键开放问题。
  • 证明了对现有扰动的更优分析也无法消除遗憾界中的O(√(log K))因子,表明当前扰动族存在固有局限性。
  • 结果表明,若最优扰动存在,其必须为弗雷chet型,依据极值理论及重尾分布中危险率的渐近行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。