Skip to main content
QUICK REVIEW

[论文解读] Finite-time Regret Bound of a Bandit Algorithm for the Semi-bounded Support Model

Junya Honda, Akimichi Takemura|arXiv (Cornell University)|Feb 10, 2012
Advanced Bandit Algorithms Research参考文献 9被引用 3
一句话总结

本文在半有界支持模型中首次建立了 DMED bandit 算法的有限时间 regret 边界,该模型中奖励支持于 $(-\infty,1]$ 且具有矩生成函数。通过改进大偏差概率并放宽对下界支持的依赖,作者证明了 DMED 在非渐近意义下达到最优渐近性能,从而将该算法的适用范围从有界 $[0,1]$ 支持奖励扩展至更广的分布。

ABSTRACT

In this paper we consider stochastic multiarmed bandit problems. Recently a policy, DMED, is proposed and proved to achieve the asymptotic bound for the model that each reward distribution is supported in a known bounded interval, e.g. [0,1]. However, the derived regret bound is described in an asymptotic form and the performance in finite time has been unknown. We inspect this policy and derive a finite-time regret bound by refining large deviation probabilities to a simple finite form. Further, this observation reveals that the assumption on the lower-boundedness of the support is not essential and can be replaced with a weaker one, the existence of the moment generating function.

研究动机与目标

  • 弥合随机多臂 bandit 问题中 DMED bandit 算法的渐近最优性与有限时间性能之间的差距。
  • 通过证明下界支持(如 $[0,1]$ 中的 0)并非实现最优 regret 所必需,从而放宽对已知下界支持的假设。
  • 在奖励分布的矩生成函数在零附近存在的较弱条件下,推导出 DMED 的非渐近 regret 边界。
  • 证明当模型从 $\mathcal{A}_0$(有界 $[0,1]$)扩展至 $\mathcal{A}$(半有界 $(-\infty,1]$)时,理论 regret 下界保持不变。

提出的方法

  • 作者通过改进经验分歧 $D_{\mathrm{inf}}(\hat{F}_i, \mu)$ 的大偏差概率,推导出有限时间边界,避免依赖于对经验分布的计数或覆盖。
  • 他们利用 Cramér 定理建立的 Kullback-Leibler 散度与矩生成函数之间的对偶性,以控制经验均值和分歧的尾部概率。
  • 一个关键技术步骤是利用矩生成函数的 Legendre 变换,对经验分歧偏离其真实值的概率进行有界。
  • 分析通过将 regret 分解为均值过度估计和低估相关事件,利用非渐近界控制次优臂被抽取的期望次数。
  • 该方法使用新颖的耦合论证和基于矩生成函数的集中不等式,以控制次优臂被抽取的期望次数。
  • 通过在时间步上求和,并对来自尾部概率的指数项应用几何级数界,推导出 regret 边界。

实验结果

研究问题

  • RQ1能否在奖励支持于 $(-\infty,1]$ 的半有界支持模型中,为 DMED 算法建立有限时间 regret 边界?
  • RQ2在 DMED 框架中,假设支持有下界(如 $[0,1]$ 中的 0)是否对实现渐近 regret 边界是本质性的?
  • RQ3能否将 DMED 的 regret 边界扩展至仅在零附近存在矩生成函数的分布,而非有界支持?
  • RQ4当模型从 $\mathcal{A}_0$ 扩展至 $\mathcal{A}$(其中 $\mathcal{A}_0 \subset \mathcal{A}$)时,理论 regret 下界是否保持不变?

主要发现

  • 本文在半有界支持模型 $\mathcal{A}$ 中建立了 DMED 算法的有限时间 regret 边界,其中奖励支持于 $(-\infty,1]$ 且在零附近具有矩生成函数。
  • 该 regret 边界的形式为 $\sum_{i:\mu_i < \mu^*} \frac{\log n}{D_{\mathrm{inf}}(F_i, \mu^*; \mathcal{A})} + O(1)$,与渐近下界仅相差一个常数因子。
  • 作者证明了对所有 $F_i \in \mathcal{A}_0$,有 $D_{\mathrm{inf}}(F_i, \mu^*; \mathcal{A}_0) = D_{\mathrm{inf}}(F_i, \mu^*; \mathcal{A})$,表明在扩展模型下理论下界保持不变。
  • 下界支持的假设并非 DMED 渐近最优性的必要条件;其可被矩生成函数的存在性所替代。
  • 有限时间 regret 边界的推导无需对经验分布进行计数或覆盖,从而避免了先前基于 Sanov 不等式的非渐近分析中出现的难以处理的项。
  • 分析表明,次优臂被抽取的期望次数被有界为指数项之和,从而导致 $n$ 的多对数 regret 边界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。