Skip to main content
QUICK REVIEW

[论文解读] Optimal Best-arm Identification in Linear Bandits

Yassir Jedra, Alexandre Proutière|arXiv (Cornell University)|Jun 29, 2020
Advanced Bandit Algorithms Research参考文献 24被引用 19
一句话总结

本文提出了一种新颖的、可扩展的最优臂识别算法,适用于具有有限和连续动作的随机线性 bandits,实现了渐近最优的样本复杂度。该方法采用跟踪-停止原则,结合一种懒惰的动作采样规则,以跟踪最优的抽样比例,并采用与动作数量无关的停止规则,几乎必然且在期望下匹配已知的信息论下界。

ABSTRACT

We study the problem of best-arm identification with fixed confidence in stochastic linear bandits. The objective is to identify the best arm with a given level of certainty while minimizing the sampling budget. We devise a simple algorithm whose sampling complexity matches known instance-specific lower bounds, asymptotically almost surely and in expectation. The algorithm relies on an arm sampling rule that tracks an optimal proportion of arm draws, and that remarkably can be updated as rarely as we wish, without compromising its theoretical guarantees. Moreover, unlike existing best-arm identification strategies, our algorithm uses a stopping rule that does not depend on the number of arms. Experimental results suggest that our algorithm significantly outperforms existing algorithms. The paper further provides a first analysis of the best-arm identification problem in linear bandits with a continuous set of arms.

研究动机与目标

  • 解决在具有有限动作的线性 bandits 中,最优臂识别缺乏简单、可扩展且渐近最优的算法的问题。
  • 弥合现有算法与实例特定的信息论下界在期望样本复杂度上的差距。
  • 开发一种其停止规则或采样规则不依赖于动作数量的方法,以增强可扩展性。
  • 将分析扩展到连续动作的情形,特别是单位球面,并推导样本复杂度下界。
  • 为连续动作提出一种算法,其样本复杂度在阶上匹配所推导的下界。

提出的方法

  • 该算法采用跟踪-停止策略,其中采样规则根据参数向量的最小二乘估计,动态跟踪每个动作的最优抽样比例。
  • 最优抽样比例基于实例特定的样本复杂度下界推导,并且更新频率较低——这使得实现‘懒惰’化,同时不牺牲渐近最优性。
  • 停止规则采用广义似然比检验,并引入一种与动作数量无关的新颖探索阈值。
  • 对于连续动作,算法专为单位球面设计,停止条件被构造以确保 $(\epsilon,\delta)$-PAC 保证。
  • 通过几乎必然和期望分析建立理论保证,利用集中不等式和强制探索以确保收敛。
  • 通过调整跟踪规则的更新频率,可调节该方法的计算复杂度,同时保持理论最优性。

实验结果

研究问题

  • RQ1在线性 bandits 中,能否设计一种最优臂识别算法,使其样本复杂度达到信息论下界,同时保持简单性和可扩展性?
  • RQ2是否存在一种与动作数量无关的停止规则,仍能保证最优臂识别的渐近最优性?
  • RQ3在具有连续动作集合的线性 bandits 中,最优臂识别的实例特定样本复杂度下界是什么?
  • RQ4能否为连续线性 bandits 设计一种算法,其样本复杂度在阶上匹配所推导的下界?
  • RQ5更新最优抽样比例跟踪规则的频率如何影响算法的理论保证和计算成本?

主要发现

  • 所提出的算法在样本复杂度上实现了渐近最优性,几乎必然地匹配已知的实例特定下界。
  • 该算法的期望样本复杂度被限制在 $\frac{d\sigma^2}{\varepsilon\|\mu\|}\log(1/\delta)$ 之内,阶上与下界一致。
  • 停止规则与动作数量无关,使得该方法可扩展至大规模或无限的动作集合。
  • 跟踪规则可更新得足够稀疏,而不会影响渐近最优性,从而可调节计算成本。
  • 对于单位球面上的连续动作,建立了阶为 $\frac{d}{\varepsilon}\log(1/\delta)$ 的样本复杂度下界。
  • 提出了一种连续动作的算法,其样本复杂度在阶上匹配该下界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。