Skip to main content
QUICK REVIEW

[论文解读] An efficient high-probability algorithm for Linear Bandits

Gábor Braun, Sebastian Pokutta|arXiv (Cornell University)|Oct 6, 2016
Advanced Bandit Algorithms Research参考文献 14被引用 4
一句话总结

本文为自适应对手下的线性 bandit 问题中 CombEXP 算法提出了一个高概率的遗憾界 $O(T^{2/3})$,将其推广至任意多面体,同时通过线性优化预言机保持计算效率。该方法通过利用方差控制的损失估计和 Bennett 不等式,实现了在高维动作空间中遗憾性能与计算可处理性之间的实用权衡。

ABSTRACT

For the linear bandit problem, we extend the analysis of algorithm CombEXP from [R. Combes, M. S. Talebi Mazraeh Shahi, A. Proutiere, and M. Lelarge. Combinatorial bandits revisited. In C. Cortes, N. D. Lawrence, D. D. Lee, M. Sugiyama, and R. Garnett, editors, Advances in Neural Information Processing Systems 28, pages 2116--2124. Curran Associates, Inc., 2015. URL http://papers.nips.cc/paper/5831-combinatorial-bandits-revisited.pdf] to the high-probability case against adaptive adversaries, allowing actions to come from an arbitrary polytope. We prove a high-probability regret of \(O(T^{2/3})\) for time horizon \(T\). While this bound is weaker than the optimal \(O(\sqrt{T})\) bound achieved by GeometricHedge in [P. L. Bartlett, V. Dani, T. Hayes, S. Kakade, A. Rakhlin, and A. Tewari. High-probability regret bounds for bandit online linear optimization. In 21th Annual Conference on Learning Theory (COLT 2008), July 2008. http://eprints.qut.edu.au/45706/1/30-Bartlett.pdf], CombEXP is computationally efficient, requiring only an efficient linear optimization oracle over the convex hull of the actions.

研究动机与目标

  • 将 CombEXP 算法扩展至自适应对手下线性 bandit 设置中的任意多面体。
  • 建立一个在概率 $1 - \delta$ 下成立的 CombEXP 高概率遗憾界。
  • 仅依赖于动作多面体上的线性优化预言机,保持计算效率。
  • 提供一个理论分析,将先前关于 ComBand 和 CombEXP 的结果推广至高概率情形。
  • 识别出阻碍 CombEXP 扩展至最优 $O(\sqrt{T})$ 遗憾界(在高概率保证下)的关键障碍。

提出的方法

  • 该算法在每轮中使用稀疏近似分布,仅维护动作的期望 $\hat{x}_t$,而非完整动作分布。
  • 通过协方差矩阵 $C_t$ 和参数 $\gamma_t$ 实现损失估计,以控制探索,确保估计损失的方差有界。
  • 应用 Bennett 不等式于真实损失与估计损失之差的集中性界,实现高概率的遗憾控制。
  • 通过动作集 $A$ 中所有动作的并集界,同时以高概率控制所有固定动作的遗憾。
  • 利用多面体的 $\ell_2$-直径 $B$ 和探索协方差矩阵的最小特征值 $\lambda$,推导出损失估计误差的方差与大小界。
  • 通过将遗憾分解为真实损失与估计损失之间的差异,以及由探索策略引起的偏差,分别利用集中不等式进行有界控制。

实验结果

研究问题

  • RQ1CombEXP 能否在保持高概率遗憾界的同时推广至任意多面体?
  • RQ2在自适应对手下,CombEXP 可实现的最紧致高概率遗憾界是什么?
  • RQ3在高概率设置下,是否仅通过线性优化预言机即可保持计算效率?
  • RQ4尽管 GeometricHedge 中存在校正项,为何当前方法仍无法实现最优的 $O(\sqrt{T})$ 遗憾界?
  • RQ5将 CombEXP 扩展至 $O(\sqrt{T})$ 遗憾界所需的恒等式是否成立,且可否被验证?

主要发现

  • 本文在概率 $1 - \delta$ 下建立了 CombEXP 的高概率遗憾界:$O\left(\frac{B^{2}+nB}{\min\{\lambda,1\}}\cdot\ln\frac{2n+2}{\delta}\right)T^{2/3}$。
  • 相同方法对原始 ComBand 算法也给出了 $O(T^{2/3})$ 的高概率遗憾界,尽管相比 GeometricHedge 的 $O(\sqrt{T})$ 较为次优。
  • 该算法通过仅需在动作凸包上进行高效线性优化预言机,即使动作集指数级庞大,也能保持计算效率。
  • 实现 $O(\sqrt{T})$ 遗憾的关键障碍在于一个未被验证的恒等式,该恒等式与逆协方差矩阵和探索权重相关的矩阵等式等价。
  • 若无此恒等式,即使 GeometricHedge 中存在校正项,该方法也无法扩展至实现最优的 $O(\sqrt{T})$ 遗憾界。
  • 该分析为任意时间(any-time)性质,因为参数选择不依赖于时间范围 $T$,且界在时间上一致成立。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。