Skip to main content
QUICK REVIEW

[论文解读] Bandits with heavy tail

Sébastien Bubeck, Nicolò Cesa‐Bianchi|arXiv (Cornell University)|Sep 8, 2012
Advanced Bandit Algorithms Research参考文献 12被引用 8
一句话总结

本文研究在弱矩假设下的随机多臂赌博机问题,表明有限方差(二阶矩)已足够实现对数 regret,与次高斯性能相当。本文引入了鲁棒均值估计器——截断均值、Catoni 的 M-估计器和均值中位数,以替代经验均值,从而实现随失败概率多项式缩放的置信区间,即使在具有 $1+\varepsilon$ 阶矩($\varepsilon \in (0,1]$)的重尾奖励下,也能实现最优 regret(至多常数因子)。关键结果为 regret 的尺度为 $O\left(\sum_i \left(\frac{1}{\Delta_i}\right)^{1/\varepsilon} \log n\right)$,并给出了匹配的下界,证明该依赖关系不可避免。

ABSTRACT

The stochastic multi-armed bandit problem is well understood when the reward distributions are sub-Gaussian. In this paper we examine the bandit problem under the weaker assumption that the distributions have moments of order 1+ε, for some $ε\in (0,1]$. Surprisingly, moments of order 2 (i.e., finite variance) are sufficient to obtain regret bounds of the same order as under sub-Gaussian reward distributions. In order to achieve such regret, we define sampling strategies based on refined estimators of the mean such as the truncated empirical mean, Catoni's M-estimator, and the median-of-means estimator. We also derive matching lower bounds that also show that the best achievable regret deteriorates when ε<1.

研究动机与目标

  • 分析当奖励分布仅具有 $1+\varepsilon$ 阶有限矩($\varepsilon \in (0,1]$)而非次高斯尾部时的随机多臂赌博机问题。
  • 克服在重尾分布下经验均值的不良集中性质,后者在先前工作中导致次优 regret。
  • 基于鲁棒均值估计器设计采样策略,实现在弱矩假设下的最优 regret 刻度。
  • 建立匹配的上下界,证明所推导的 regret 边界在常数因子内最优。

提出的方法

  • 提出一种通用框架,用于在弱矩条件下利用具有强集中性质的估计器实现鲁棒上置信界(UCB)策略。
  • 采用三种鲁棒均值估计器:截断经验均值、Catoni 的 $M$-估计器和均值中位数估计器,每种均提供次威布尔尾部界。
  • 推导这些估计器的集中不等式,显示偏差概率以 $n^{-\varepsilon}$ 速率衰减,优于经验均值的多项式衰减。
  • 利用这些估计器构建置信区间,从而设计出具有可证明 regret 保证的鲁棒 UCB 算法。
  • 对估计器的矩生成函数应用 Legendre-Fenchel 变换,以导出紧致的置信区间。
  • 基于特定重尾分布提出一种新颖的下界论证,证明 regret 中的 $1/\Delta_i^{1/\varepsilon}$ 依赖关系不可避免。

实验结果

研究问题

  • RQ1当奖励分布仅具有有限方差(即二阶矩)而非次高斯尾部时,是否仍可在随机赌博机中实现对数 regret?
  • RQ2在重尾分布下,鲁棒均值估计器(如截断均值或均值中位数)是否相比经验均值具有显著更好的集中性?
  • RQ3当奖励具有 $1+\varepsilon$ 阶矩($\varepsilon < 1$)时,regret 对差距 $\Delta_i$ 的最优依赖关系为何?
  • RQ4在 $L^{1+\varepsilon}$ 矩假设下,regret 边界中的 $1/\Delta_i^{1/\varepsilon}$ 刻度是否不可避免?
  • RQ5能否推导出匹配的下界,以证明所提出的 regret 边界在常数因子内最优?

主要发现

  • 即使缺乏有限矩生成函数,仅具有有限方差(二阶矩)已足够实现与次高斯奖励下相同阶数的 regret 边界。
  • 对于满足 $\mathbb{E}|X - \mu|^{1+\varepsilon} \leq v$ 的分布,所提策略实现的 regret 为 $R_n \leq \sum_{i:\Delta_i > 0} \left(8\left(\frac{4}{\Delta_i}\right)^{1/\varepsilon} \log n + 5\Delta_i\right)$,其在 $n$ 上为对数尺度。
  • 在重尾下,经验均值无法提供指数尾部界,导致多项式 regret;鲁棒估计器对实现对数 regret 至关重要。
  • regret 边界中 $1/\Delta_i^{1/\varepsilon}$ 的依赖关系不可避免,匹配的下界证明其与上界仅相差常数因子。
  • 截断均值和均值中位数估计器实现了次威布尔尾部行为,满足 $\mathbb{P}(|\widehat{\mu} - \mu| > \eta) \leq C n^{-\varepsilon} \eta^{-(1+\varepsilon)}$,从而支持紧致置信区间。
  • 本文证明,随着 $\varepsilon \to 0$,最佳可实现 regret 会恶化,且在 $L^{1+\varepsilon}$ 矩假设下,$1/\Delta_i^{1/\varepsilon}$ 刻度为最优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。