Skip to main content
QUICK REVIEW

[论文解读] Extended UCB Policy for Multi-Armed Bandit with Light-Tailed Reward Distributions

Keqin Liu, Qing Zhao|arXiv (Cornell University)|Dec 8, 2011
Advanced Bandit Algorithms Research参考文献 7被引用 5
一句话总结

本文通过利用矩生成函数的存在性,将UCB1索引策略扩展至所有轻尾奖励分布(具体为局部次高斯分布),实现了最优的对数 regret。所提出的扩展UCB策略在保持对数 regret 缩放的同时,将适用范围扩展至具有有限支持之外的分布。

ABSTRACT

We consider the multi-armed bandit problems in which a player aims to accrue reward by sequentially playing a given set of arms with unknown reward statistics. In the classic work, policies were proposed to achieve the optimal logarithmic regret order for some special classes of light-tailed reward distributions, e.g., Auer et al.'s UCB1 index policy for reward distributions with finite support. In this paper, we extend Auer et al.'s UCB1 index policy to achieve the optimal logarithmic regret order for all light-tailed (or equivalently, locally sub-Gaussian) reward distributions defined by the (local) existence of the moment-generating function.

研究动机与目标

  • 解决现有UCB策略仅对具有有限支持的奖励分布实现最优 regret 的局限性。
  • 将UCB1索引策略推广至处理所有轻尾奖励分布,其定义基于矩生成函数的局部存在性。
  • 在更宽松的分布假设下,保持最优的对数 regret 阶。
  • 提供一个理论基础坚实的UCB1扩展,使其在更广泛的奖励分布类中保持 regret 最优性。

提出的方法

  • 提出一种扩展的UCB索引,利用轻尾分布的矩生成函数推导出的高阶矩信息。
  • 利用局部次高斯性质来控制尾部概率,并推导每个臂期望奖励的置信区间。
  • 通过将UCB1的采样规则中的有限支持假设替换为矩生成函数的局部存在性条件,来适应该策略。
  • 推导出一种新的上置信界,其缩放比例基于累积量生成函数导出的方差代理参数。
  • 建立一个适用于满足局部次高斯条件的分布的 regret 分析框架。
  • 证明扩展索引策略在保持与UCB1相同对数 regret 阶的同时,适用于更弱的分布假设。

实验结果

研究问题

  • RQ1UCB1策略能否被扩展,以在具有有限支持之外的所有轻尾奖励分布中实现最优 regret?
  • RQ2在多臂赌博机设置中,何种奖励分布条件足以维持对数 regret?
  • RQ3当奖励分布为局部次高斯但不一定有界时,如何调整UCB中的置信区间?
  • RQ4在更广泛的局部次高斯分布类中,是否可能保持最优的 regret 阶?

主要发现

  • 所提出的扩展UCB策略对所有局部次高斯的轻尾奖励分布均实现了最优的对数 regret 阶。
  • regret 边界随时间对数缩放,与多臂赌博机问题的理论下界一致。
  • 该方法消除了对有界奖励的要求,将UCB1推广至具有更重尾部的分布,只要矩生成函数在局部存在即可。
  • 该方法保持了与UCB1相同的 regret 速率,证实该扩展在新的分布假设下未损害性能。
  • 分析表明,局部次高斯条件足以推导出控制 regret 所需的紧密置信区间。
  • 与原始UCB1相比,该扩展策略可应用于显著更广泛的奖励分布类,包括正态分布、指数分布及其他轻尾分布。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。