Skip to main content
QUICK REVIEW

[论文解读] Tight Regret Bounds for Infinite-armed Linear Contextual Bandits

Yingkai Li, Yining Wang|arXiv (Cornell University)|May 4, 2019
Advanced Bandit Algorithms Research参考文献 10被引用 8
一句话总结

本文提出了一种新颖的可变置信水平上置信度上限(VCL-UCB)算法,用于无限动作集的线性上下文多臂老虎机问题,实现了 $O(\sqrt{d^2 T \log T}) \times \mathrm{poly}(\log\log T)$ 的遗憾上界,该上界与现有 $\Omega(\sqrt{d^2 T \log T})$ 的下界仅相差迭代对数因子,从而在该设定下填补了极小化遗憾上界与下界之间的差距。

ABSTRACT

Linear contextual bandit is an important class of sequential decision making problems with a wide range of applications to recommender systems, online advertising, healthcare, and many other machine learning related tasks. While there is a lot of prior research, tight regret bounds of linear contextual bandit with infinite action sets remain open. In this paper, we address this open problem by considering the linear contextual bandit with (changing) infinite action sets. We prove a regret upper bound on the order of $O(\sqrt{d^2T\log T}) imes ext{poly}(\log\log T)$ where $d$ is the domain dimension and $T$ is the time horizon. Our upper bound matches the previous lower bound of $Ω(\sqrt{d^2 T\log T})$ in [Li et al., 2019] up to iterated logarithmic terms.

研究动机与目标

  • 解决线性上下文多臂老虎机在无限动作集下建立紧致遗憾上界的开放问题。
  • 设计一种在所有 $t$ 满足 $|D_t| = \infty$ 的最坏情况设定下实现极小化最优遗憾的算法。
  • 弥合现有上界与无限动作集情形下 $\Omega(\sqrt{d^2 T \log T})$ 下界之间的差距。
  • 克服先前方法在无限动作集下因覆盖网近似而引入的额外 $\log T$ 因子的局限性。
  • 建立一个与下界仅相差迭代对数项的新型遗憾上界。

提出的方法

  • 提出一种 VCL-UCB 算法,根据时间和估计不确定性动态调整置信水平。
  • 利用自归一化经验过程的精确尾部界来控制高维、依赖设定下的估计误差。
  • 引入一种基于期望的遗憾分析方法,避免通常导致 $\log T$ 因子的并集界惩罚。
  • 利用椭球潜力引理来有界时间上逆协方差加权动作范数的和。
  • 设计一种基于 $\alpha^i_{\zeta,t}$ 的递归置信区间精化机制,以平衡探索与利用。
  • 应用詹森不等式于形如 $\sqrt{\tau \log(\tau)}$ 的凹函数,推导出累积遗憾的更紧上界。

实验结果

研究问题

  • RQ1在无限动作集的线性上下文多臂老虎机中,能否实现与 $\Omega(\sqrt{d^2 T \log T})$ 下界匹配的遗憾上界?
  • RQ2能否将先前工作的 $O(\sqrt{d^2 T \log^2 T})$ 上界改进至与 $\Omega(\sqrt{d^2 T \log T})$ 下界相匹配?
  • RQ3在高维、无限动作设定下,能否避免并集界带来的 $\log T$ 惩罚?
  • RQ4能否利用自归一化过程的精确尾部界,在依赖、自适应采样设定下实现更紧的遗憾控制?
  • RQ5具有时变置信水平的 VCL-UCB 策略能否消除无限动作集中对覆盖网的需求?

主要发现

  • 所提出的 VCL-UCB 算法在最坏情况下的期望遗憾为 $O(\sqrt{d^2 T \log T}) \times \mathrm{poly}(\log\log T)$。
  • 该上界与现有 $\Omega(\sqrt{d^2 T \log T})$ 下界仅相差迭代对数因子,从而在无限动作集设定下填补了该差距。
  • 通过采用基于期望的遗憾分解,分析方法避免了标准的并集界惩罚,消除了额外的 $\log T$ 因子。
  • 该方法依赖于自归一化过程的精确尾部界,以及椭球潜力引理的精细化应用。
  • VCL-UCB 框架为处理高维、无限动作的上下文多臂老虎机问题提供了新的技术基础,实现最小遗憾。
  • 结果表明,在无限动作集情形下,先前上界与下界之间 $O(\sqrt{=\log T})$ 的差距已被解决。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。