[论文解读] Infinite Arms Bandit: Optimality via Confidence Bounds
本文提出了针对无穷臂老虎机问题的置信度边界目标(CBT)算法,该算法基于从先验或经验数据中得出的目标值,依据各臂相对于该目标值的置信度边界进行选择。CBT 在有界奖励下实现了最优遗憾边界,与理论下界完全匹配;其经验版本无需先验知识,且在伯努利分布和真实世界 URL 数据集的模拟中表现优于现有方法。
Berry et al. (1997) initiated the development of the infinite arms bandit problem. They derived a regret lower bound of all allocation strategies for Bernoulli rewards with uniform priors, and proposed strategies based on success runs. Bonald and Proutière (2013) proposed a two-target algorithm that achieves the regret lower bound, and extended optimality to Bernoulli rewards with general priors. We present here a confidence bound target (CBT) algorithm that achieves optimality for rewards that are bounded above. For each arm we construct a confidence bound and compare it against each other and a target value to determine if the arm should be sampled further. The target value depends on the assumed priors of the arm means. In the absence of information on the prior, the target value is determined empirically. Numerical studies here show that CBT is versatile and outperforms its competitors.
研究动机与目标
- 解决无穷臂老虎机问题中的最优分配挑战,其中臂的数量无界,且奖励有上界。
- 开发一种方法,实现有界奖励情况下的理论遗憾下界,扩展此前针对伯努利分布和指数族分布的研究。
- 提出一种实用的算法变体,无需了解臂的均值分布先验知识,通过从数据中经验估计目标值实现。
- 在多种奖励分布和真实世界数据上,证明所提方法的鲁棒性与优越性。
提出的方法
- 基于观测样本,为每个臂的期望奖励构建上界置信度区间(UCB)。
- 根据臂均值的假设先验分布定义目标值,以判断是否应进一步探索该臂。
- 将每个臂的置信度边界与目标值进行比较:若边界超过目标值,则选择该臂;否则将其舍弃。
- 对于未知先验的情况,从初始样本中经验估计目标值,从而实现经验 CBT 变体。
- 使用通用遗憾下界作为基准,验证所选目标值的最优性。
- 按顺序应用算法,随时间动态更新置信度边界和目标值,以平衡探索与利用。
实验结果
研究问题
- RQ1基于置信度边界的算法能否在有界奖励的无穷臂老虎机问题中实现理论遗憾下界?
- RQ2如何选择置信度比较中的目标值,以确保最优性而不依赖参数假设?
- RQ3当真实先验分布未知时,算法的经验版本性能如何?
- RQ4与现有方法(如两目标法、UCB-F 和 POKER)相比,所提出的 CBT 算法在遗憾和可扩展性方面表现如何?
- RQ5CBT 框架能否有效应用于具有未知奖励结构的真实世界数据集?
主要发现
- CBT 算法在有界奖励下实现了通用遗憾下界,与所有可能策略的理论最小遗憾完全一致。
- 在已知先验的伯努利奖励场景下,CBT 始终优于两目标法和 UCB-F,在所有测试样本量下均实现更低的遗憾。
- 经验 CBT(通过数据估计目标值)在性能上与两目标法相当,且显著优于 ε-贪婪和 ε-first 等标准基线方法。
- 在 URL 数据集上,当样本量较大(n=1300)时,经验 CBT 的遗憾表现优于 POKER,表明其具备出色的可扩展性和适应性。
- 最优 CBT 需要先验知识以设定阈值 ζ,但经验 CBT 在无需此类知识的情况下实现了接近最优的性能,更具实用性。
- 数值结果表明,CBT 的遗憾在 β=2 时呈 Cn^(2/3) 的增长趋势,在 β=3 时呈 Cn^(3/4) 的增长趋势,所有设置下均接近理论下界。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。