Skip to main content
QUICK REVIEW

[论文解读] Efficient-UCBV: An Almost Optimal Algorithm using Variance Estimates

Subhojyoti Mukherjee, K. P. Naveen|arXiv (Cornell University)|Nov 9, 2017
Advanced Bandit Algorithms Research被引用 16
一句话总结

本文提出EUCBV,一种基于UCB的高效算法,用于随机多臂赌博机问题,通过整合方差估计与臂消除策略,实现近乎最优的遗憾边界。通过结合方差感知的置信区间与激进探索及非均匀的臂选择策略,EUCBV实现了与差距无关的遗憾边界$O(\sqrt{KT})$,以及与差距相关的遗憾边界$O\left(\frac{K\sigma^{2}_{\text{max}}\log(T\Delta^{2}/K)}{\Delta}\right)$,在广泛实验中优于UCB1、UCBV、MOSS和OCUCB。

ABSTRACT

We propose a novel variant of the UCB algorithm (referred to as Efficient-UCB-Variance (EUCBV)) for minimizing cumulative regret in the stochastic multi-armed bandit (MAB) setting. EUCBV incorporates the arm elimination strategy proposed in UCB-Improved \citep{auer2010ucb}, while taking into account the variance estimates to compute the arms' confidence bounds, similar to UCBV \citep{audibert2009exploration}. Through a theoretical analysis we establish that EUCBV incurs a \emph{gap-dependent} regret bound of {\scriptsize $O\left( \dfrac{Kσ^2_{\max} \log (TΔ^2 /K)}Δ ight)$} after $T$ trials, where $Δ$ is the minimal gap between optimal and sub-optimal arms; the above bound is an improvement over that of existing state-of-the-art UCB algorithms (such as UCB1, UCB-Improved, UCBV, MOSS). Further, EUCBV incurs a \emph{gap-independent} regret bound of {\scriptsize $O\left(\sqrt{KT} ight)$} which is an improvement over that of UCB1, UCBV and UCB-Improved, while being comparable with that of MOSS and OCUCB. Through an extensive numerical study we show that EUCBV significantly outperforms the popular UCB variants (like MOSS, OCUCB, etc.) as well as Thompson sampling and Bayes-UCB algorithms.

研究动机与目标

  • 开发一种最小化随机多臂赌博机问题中累积遗憾的赌博机算法。
  • 通过将方差估计整合到置信区间中,改进现有UCB变体。
  • 实现阶最优或近乎最优的与差距相关的遗憾边界和与差距无关的遗憾边界。
  • 在多样化实验环境中,超越如MOSS、OCUCB和Thompson采样等最先进算法。
  • 设计一种稳定且具备方差感知能力的算法,在长时 horizon 和高方差最优臂场景下表现良好。

提出的方法

  • EUCBV利用方差估计计算每条臂的更紧致置信区间,类似于UCBV。
  • 它采用UCB-Improved中的臂消除策略,在经过若干轮探索后移除次优臂。
  • 该算法基于方差和置信区间实施非均匀的臂选择,优先选择不确定性更高且潜在回报更好的臂。
  • 通过结合激进探索参数与方差感知置信区间,加速次优臂的消除。
  • 置信区间同时包含每条臂奖励的样本均值和样本方差。
  • 该算法需要将时 horizon $T$ 作为输入,并设计为在$T \geq K^{2.4}$时实现最优遗憾。

实验结果

研究问题

  • RQ1能否有效将方差估计整合到UCB风格算法中以改进遗憾边界?
  • RQ2将臂消除与方差感知置信区间结合,是否能带来优于现有最先进算法的实证性能?
  • RQ3能否使UCB变体在与差距无关的遗憾边界上达到阶最优,同时在与差距相关的遗憾边界上优于UCB1和UCBV?
  • RQ4在小差距和高方差最优臂环境中,EUCBV的表现如何,而贝叶斯方法可能失效?
  • RQ5在长时 horizon 和高臂数场景下,EUCBV是否比Thompson采样和Bayes-UCB更稳定且可扩展?

主要发现

  • EUCBV实现了与差距无关的遗憾边界$O(\sqrt{KT})$,与MOSS和OCUCB的最佳已知边界一致。
  • 其与差距相关的遗憾边界为$O\left(\frac{K\sigma^{2}_{\text{max}}\log(T\Delta^{2}/K)}{\Delta}\right)$,优于UCB1、UCBV和UCB-Improved。
  • 在100条臂和高方差最优臂的实验中,EUCBV显著优于TS-G、BU-G、UCBV、MOSS和OCUCB。
  • 由于采用了激进探索与非均匀臂选择策略,EUCBV优于如UCBV等方差感知算法。
  • 在具有三组方差的均匀差距设置中,EUCBV的遗憾增长远慢于TS-G、MOSS、BU-G、OCUCB和UCBV。
  • 贝叶斯算法如TS-G和BU-G在高方差最优臂场景中失效,而EUCBV保持稳健且高效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。