Skip to main content
QUICK REVIEW

[论文解读] Bounded regret in stochastic multi-armed bandits

Sébastien Bubeck, Vianney Perchet|arXiv (Cornell University)|Feb 6, 2013
Advanced Bandit Algorithms ResearchDecision Sciences参考文献 11被引用 21
一句话总结

本文提出了一种针对随机多臂赌博机的随机化策略,当已知最优均值奖励 $\mu^{(\star)}$ 和最小正差距的下界 $\Delta$ 时,该策略可实现一致有界的遗憾。该策略基于序列似然比检验,两臂情形下遗憾上界为 $\Delta + 16/\Delta$;推广至 $K$ 臂情形时,当 $\varepsilon$ 是 $\Delta$ 的下界时,遗憾呈现 $\sum_{i:\Delta_i>0} \left\{ \Delta_i + \frac{32}{\Delta_i} \log\left(\frac{5}{\varepsilon}\right) \right\}$ 的形式。关键贡献在于证明了仅凭 $\Delta$ 或仅凭 $\mu^{(\star)}$ 无法实现有界遗憾,从而确立了所提方法的极小极大最优性。

ABSTRACT

We study the stochastic multi-armed bandit problem when one knows the value $μ^{(\star)}$ of an optimal arm, as a well as a positive lower bound on the smallest positive gap $Δ$. We propose a new randomized policy that attains a regret {\em uniformly bounded over time} in this setting. We also prove several lower bounds, which show in particular that bounded regret is not possible if one only knows $Δ$, and bounded regret of order $1/Δ$ is not possible if one only knows $μ^{(\star)}$

研究动机与目标

  • 研究在部分先验知识(具体为 $\mu^{(\star)}$ 和 $\Delta$ 的下界)已知时,是否可在随机多臂赌博机中实现有界遗憾。
  • 设计一种随机化策略,在已知 $\mu^{(\star)}$ 和 $\Delta$ 的条件下实现一致有界遗憾,尤其关注两臂情形。
  • 建立紧致下界,证明若仅知 $\Delta$ 或仅知 $\mu^{(\star)}$,则有界遗憾不可能实现,即使在两臂设置下亦然。
  • 将策略推广至 $K$ 臂赌博机,并分析遗憾对 $\varepsilon$(即 $\Delta$ 的下界)的依赖关系,显示其在 $1/\varepsilon$ 上呈对数尺度。

提出的方法

  • 针对已知 $\mu^{(\star)}$ 和 $\Delta$ 的两臂赌博机问题,提出一种基于序列似然比检验的随机化策略,确保遗憾有界。
  • 采用一种随机探索策略,在臂选择的置信度与已知最优均值及差距之间实现平衡。
  • 利用集中不等式与 KL 散度界,推导出两臂情形下遗憾的上界 $\Delta + 16/\Delta$,且该上界对时间跨度 $n$ 一致成立。
  • 通过修改探索调度,将该策略推广至 $K$ 臂情形,基于相同原理,当 $\varepsilon$ 是 $\Delta_i$ 的下界时,遗憾为 $\sum_{i:\Delta_i>0} \left\{ \Delta_i + \frac{32}{\Delta_i} \log\left(\frac{5}{\varepsilon}\right) \right\}$。
  • 提出一种改进策略,将 $\log(1/\varepsilon)$ 替换为 $\log(\Delta_i/\varepsilon)\log\log(1/\varepsilon)$,当 $\Delta_i$ 与 $\varepsilon$ 同阶时,可降低对数依赖程度。
  • 采用信息论工具,包括 Kullback-Leibler 散度与 Hellinger 相似度,推导出非渐近的遗憾下界。

实验结果

研究问题

  • RQ1当已知最优均值 $\mu^{(\star)}$ 和最小正差距 $\Delta$ 的下界时,是否可在随机多臂赌博机中实现一致有界遗憾?
  • RQ2在两臂赌博机设置下,若仅知 $\Delta$ 或仅知 $\mu^{(\star)}$,是否仍可实现有界遗憾?
  • RQ3在已知 $\mu^{(\star)}$ 的 $K$ 臂情形下,遗憾对 $\varepsilon$(即 $\Delta$ 的下界)的最优依赖关系为何?
  • RQ4当 $\varepsilon$ 接近 $\Delta_i$ 时,能否改进遗憾界中对 $1/\varepsilon$ 的对数依赖关系?
  • RQ5当仅知 $\Delta$ 或仅知 $\mu^{(\star)}$ 时,遗憾的极小极大下界为何?该下界与所提策略的上界相比如何?

主要发现

  • 所提策略在已知 $\mu^{(\star)}$ 和 $\Delta$ 的两臂赌博机问题中,实现了 $\Delta + 16/\Delta$ 的一致有界遗憾。
  • 任何仅知 $\Delta$ 的策略,其缩放后遗憾 $\Delta R_n$ 至少以对数速度随 $n$ 增长,证明仅凭 $\Delta$ 无法实现有界遗憾。
  • 任何仅知 $\mu^{(\star)}$ 的策略,其缩放后遗憾 $\Delta R_n$ 至少为 $\log n$ 量级,表明仅凭 $\mu^{(\star)}$ 同样无法实现有界遗憾。
  • 在已知 $\mu^{(\star)}$ 且 $\varepsilon$ 为 $\Delta$ 下界的 $K$ 臂赌博机问题中,该策略实现的遗憾为 $\sum_{i:\Delta_i>0} \left\{ \Delta_i + \frac{32}{\Delta_i} \log\left(\frac{5}{\varepsilon}\right) \right\}$,其常数因子下界紧致。
  • 改进策略将 $\log(1/\varepsilon)$ 项替换为 $\log(\Delta_i/\varepsilon)\log\log(1/\varepsilon)$,当 $\Delta_i$ 与 $\varepsilon$ 同阶时,实现对数对数依赖。
  • 本文建立了非渐近下界,证明 $\mu^{(\star)}$ 与 $\Delta$ 的组合是实现有界遗憾的必要条件,且所提界限为极小极大最优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。