Skip to main content
QUICK REVIEW

[论文解读] Gradient Ascent for Active Exploration in Bandit Problems

Pierre Ménard|arXiv (Cornell University)|May 20, 2019
Advanced Bandit Algorithms Research参考文献 24被引用 10
一句话总结

本文提出了一种计算高效的梯度上升算法,用于在固定置信度设置下进行上下文 bandit 问题中的主动探索。通过使用在线懒惰镜像上升法近似最优采样比例,该方法在显著降低计算成本的同时实现了渐近最优性,相较于每一步求解凹优化问题的方法具有明显优势。

ABSTRACT

We present a new algorithm based on an gradient ascent for a general Active Exploration bandit problem in the fixed confidence setting. This problem encompasses several well studied problems such that the Best Arm Identification or Thresholding Bandits. It consists of a new sampling rule based on an online lazy mirror ascent. We prove that this algorithm is asymptotically optimal and, most importantly, computationally efficient.

研究动机与目标

  • 解决现有主动探索算法在每一步都需要求解复杂凹优化问题所带来的计算低效问题。
  • 开发一种采样规则,使其渐近地匹配最优抽样比例,而无需在每次迭代中精确求解优化问题。
  • 通过梯度上升将主动探索问题与在线凸优化相结合,以提升效率。
  • 在固定置信度设置下证明所提算法的渐近最优性。
  • 展示该方法在各类主动探索 bandit 问题中的广泛适用性,包括最优臂识别和阈值 bandit 问题。

提出的方法

  • 该算法使用在线懒惰镜像上升法,迭代更新各臂的采样分布。
  • 在每一步中,仅计算目标函数的次梯度,避免了对凹优化问题的完整求解。
  • 该方法维护对真实参数的估计,并利用其通过在对偶目标上进行梯度上升来指导采样。
  • 采样规则源自对偶优化问题的解,通过实时梯度步长近似求解。
  • 该方法具有通用性,适用于任意具有不相交、开集且为凸集的主动探索 bandit 问题。
  • 该算法确保停止规则以至少 $1 - \delta$ 的概率满足固定置信度约束。

实验结果

研究问题

  • RQ1能否设计一种计算高效的算法,在固定置信度主动探索 bandit 问题中实现渐近最优性?
  • RQ2如何利用在线梯度上升在每一步中近似最优采样比例,而无需求解凹优化问题?
  • RQ3使用次梯度而非精确解对主动探索算法的渐近性能有何影响?
  • RQ4在哪些类别的 bandit 问题中,所提方法可被证明是渐近最优且高效的?
  • RQ5在样本复杂度和计算成本方面,该算法与现有方法相比表现如何?

主要发现

  • 所提算法具有渐近最优性,其样本复杂度达到了实例相关的下界。
  • 通过在每一步用次梯度计算替代精确优化,显著降低了计算成本。
  • 该方法实现了 $\mathbb{P}_{\mu}(\widehat{i} \neq i(\mu)) \leq \delta$,且期望样本量趋近于信息论下界。
  • 数值实验表明,该算法在样本效率和运行时间方面均优于基线方法。
  • 在某些问题实例中,即使次梯度无界,该算法仍表现出鲁棒性,附录中的反例已验证此特性。
  • 在较弱的正则性条件下,已建立经验采样比例向最优比例收敛的结论。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。