Skip to main content
QUICK REVIEW

[论文解读] A Scale Free Algorithm for Stochastic Bandits with Bounded Kurtosis

Tor Lattimore|arXiv (Cornell University)|Mar 27, 2017
Machine Learning and Algorithms被引用 8
一句话总结

本文提出了一种针对随机多臂赌博机的无尺度算法,在峰度有界的假设下实现了对数 regret。该算法通过利用中位数-均值估计器和基于峰度推导的置信区间,自适应地处理未知的方差和位置参数,无需事先了解尺度参数即可实现最优的 regret 刻画,推广了以往仅限于高斯分布和均匀分布结果的范围。

ABSTRACT

Existing strategies for finite-armed stochastic bandits mostly depend on a parameter of scale that must be known in advance. Sometimes this is in the form of a bound on the payoffs, or the knowledge of a variance or subgaussian parameter. The notable exceptions are the analysis of Gaussian bandits with unknown mean and variance by Cowan and Katehakis [2015] and of uniform distributions with unknown support [Cowan and Katehakis, 2015]. The results derived in these specialised cases are generalised here to the non-parametric setup, where the learner knows only a bound on the kurtosis of the noise, which is a scale free measure of the extremity of outliers.

研究动机与目标

  • 开发一种赌博机算法,实现对数 regret,且无需事先了解方差或奖励边界等尺度参数。
  • 将以往仅限于高斯分布和均匀分布的无尺度结果推广至非参数设定,使用峰度作为重尾行为的稳健度量。
  • 证明峰度——一种无尺度的异常值可能性度量——足以控制随机赌博机中的置信区间和 regret。
  • 证明该算法在位置和尺度变换下保持不变,从而在不同奖励分布下具有鲁棒性。

提出的方法

  • 该算法使用中位数-均值估计器,稳健地估计每条臂的平均奖励,降低对重尾异常值的敏感性。
  • 基于已知的峰度上界构建置信区间,实现无尺度的置信区间,无需假设次高斯性或有界支撑。
  • 通过结合峰度相关的方差估计,采用类似上置信界(UCB)的策略来管理探索与利用的权衡。
  • regret 分析依赖于基于峰度有界的集中不等式,即使在重尾奖励下也能严格控制估计误差。
  • 该算法在位置和尺度变换下保持不变:对奖励进行常数倍缩放会相应地缩放 regret,但性能保持不变。
  • 理论保证通过自标准化过程和中位数-均值技术推导得出,避免依赖次高斯性或有界方差假设。

实验结果

研究问题

  • RQ1在随机赌博机中,是否可以在不假设已知尺度参数(如方差或有界支撑)的情况下实现对数 regret?
  • RQ2峰度是否足以作为设计鲁棒赌博机算法的充分且无尺度的条件,从而推广至高斯或均匀等参数模型之外?
  • RQ3当仅知道峰度时,赌博机算法的性能如何依赖于奖励分布的尾部行为?
  • RQ4能否设计一种既无尺度又在仅峰度有界的非参数设定下实现最优 regret 的赌博机算法?

主要发现

  • 所提算法实现了如下 regret 上界:$\limsup_{n\to\infty}\frac{\mathcal{R}_{n}}{\log(n)} \leq C\sum_{i:\Delta_{i}>0}\Delta_{i}\left(\kappa-1+\frac{\sigma^{2}_{i}}{\Delta_{i}^{2}}\right)$,其中 $\kappa$ 为峰度的已知上界,$C>0$ 为绝对常数。
  • 该 regret 上界具有尺度和位置不变性,意味着算法性能不受奖励线性变换的影响。
  • 该算法将高斯和均匀赌博机的先前结果推广至非参数类,仅以峰度作为结构假设。
  • 该上界是紧致的,即在参数空间内部,其与已知下界仅相差常数因子,尤其当 $\kappa \ll \kappa_\circ$ 时成立。
  • 分析表明,峰度为尾部行为提供了有意义的代理,即使在方差未知时也能实现鲁棒的置信区间。
  • 该方法在边界情况(如高斯峰度的伯努利分布)下依然有效,尽管 regret 的缩放行为与一般上界不同。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。