Skip to main content
QUICK REVIEW

[论文解读] Fully adaptive algorithm for pure exploration in linear bandits

Liyuan Xu, Junya Honda|arXiv (Cornell University)|Oct 16, 2017
Advanced Bandit Algorithms Research参考文献 9被引用 18
一句话总结

本文提出了 LinGapE,这是首个针对线性 bandit 中纯探索问题的完全自适应算法,能够根据历史观测动态选择臂,以最小化样本复杂度。在极端情况下,其样本复杂度与理论下界仅相差一个常数因子,显著优于以往的静态或部分自适应方法,在合成与真实世界实验中均表现出色。

ABSTRACT

We propose the first fully-adaptive algorithm for pure exploration in linear bandits---the task to find the arm with the largest expected reward, which depends on an unknown parameter linearly. While existing methods partially or entirely fix sequences of arm selections before observing rewards, our method adaptively changes the arm selection strategy based on past observations at each round. We show our sample complexity matches the achievable lower bound up to a constant factor in an extreme case. Furthermore, we evaluate the performance of the methods by simulations based on both synthetic setting and real-world data, in which our method shows vast improvement over existing methods.

研究动机与目标

  • 解决现有线性 bandit 算法预先固定臂选择序列所导致的样本效率低下问题。
  • 开发一种完全自适应算法,基于所有历史观测动态调整臂的选择,以改善样本复杂度。
  • 理论上证明所提算法的样本复杂度在极端情况下与信息论下界仅相差一个常数因子。
  • 通过实证验证该算法在合成与真实世界场景下,相较于现有方法(包括静态与部分自适应策略)的优越性。

提出的方法

  • 提出 LinGapE,一种完全自适应算法,在每轮中根据所有历史观测选择臂,避免预先固定的臂选择序列。
  • 提出一种新颖的置信区间构造方法,避免自适应策略中固有的 $\sqrt{d}$ 松散性,从而实现更紧致的样本复杂度界。
  • 采用基于差距的探索策略,将采样集中在接近最优的臂附近,减少不必要的采样。
  • 引入基于行列式的信息矩阵分析方法,以限制置信区间的长度,从而改进理论上的样本复杂度界。
  • 借鉴 UGapE 在固定预算设置下的技术,表明该方法可能可扩展至此类场景。
  • 在真实世界实验中,使用 $\lambda = 0.01$ 的正则化最小二乘估计进行参数推断。

实验结果

研究问题

  • RQ1线性 bandit 中的纯探索问题是否能通过完全自适应算法实现接近信息论下界的样本复杂度?
  • RQ2基于历史观测的自适应臂选择与静态或部分自适应策略相比,在样本效率方面有何差异?
  • RQ3为区分接近最优的臂而拉取次优臂(以提高参数估计精度)会产生何种影响?
  • RQ4所提算法是否能在合成与真实世界线性 bandit 场景中均优于现有方法?
  • RQ5随着维度和臂的数量增加,该算法的性能如何变化?

主要发现

  • 在所有臂几乎都最优的极端情况下,LinGapE 的样本复杂度与理论下界(通过 $\mathcal{XY}$-oracle 实现)仅相差一个常数因子。
  • 在 $K = d = 5$ 且 $\Delta \to 0$ 的合成设置中,LinGapE 所需样本数显著少于 $\mathcal{XY}$-static 分配策略,且随着 $\Delta$ 减小,性能差距进一步扩大。
  • 在 Yahoo! Webscope R6A 数据集上,LinGapE 所需样本数相比 $\mathcal{XY}$-static 分配策略减少了约五倍。
  • 该算法通过避免丢弃历史样本,优于 $\mathcal{XY}$-adaptive 分配策略,从而实现更优的实证性能。
  • 当臂的数量增加时,性能提升最为显著,因为 LinGapE 将采样集中在最相关的臂上,而非均匀估计所有臂。
  • 理论样本复杂度界因分析中行列式评估过松而显得偏松,提示通过更紧致的界可进一步改进。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。