Skip to main content
QUICK REVIEW

[论文解读] Smooth Contextual Bandits: Bridging the Parametric and Non-differentiable Regret Regimes

Yichun Hu, Nathan Kallus|arXiv (Cornell University)|Sep 5, 2019
Advanced Bandit Algorithms Research参考文献 32被引用 6
一句话总结

本文提出了一种新颖的平滑上下文Bandit算法,通过将期望奖励函数建模为Hölder类(Hölder class)并引入光滑性参数 $\beta$,统一了参数化与不可微 regret 的情形。该算法在所有 $\beta \in (0, \infty]$ 下实现了率最优的 regret,当 $\beta = \infty$ 时恢复对数 regret(参数化情形),当 $\beta < \infty$ 时达到 $\tilde{O}(T^{\frac{\beta+d}{2\beta+d}})$,弥合了全局外推与局部学习策略之间的差距。

ABSTRACT

We study a nonparametric contextual bandit problem where the expected reward functions belong to a Hölder class with smoothness parameter $β$. We show how this interpolates between two extremes that were previously studied in isolation: non-differentiable bandits ($β\leq1$), where rate-optimal regret is achieved by running separate non-contextual bandits in different context regions, and parametric-response bandits (satisfying $β=\infty$), where rate-optimal regret can be achieved with minimal or no exploration due to infinite extrapolatability. We develop a novel algorithm that carefully adjusts to all smoothness settings and we prove its regret is rate-optimal by establishing matching upper and lower bounds, recovering the existing results at the two extremes. In this sense, our work bridges the gap between the existing literature on parametric and non-differentiable contextual bandit problems and between bandit algorithms that exclusively use global or local information, shedding light on the crucial interplay of complexity and regret in contextual bandits.

研究动机与目标

  • 统一研究从不可微($\beta \leq 1$)到参数化($\beta = \infty$)的奖励函数光滑性谱系下的上下文Bandit问题。
  • 弥合现有文献中关于参数化与不可微上下文Bandit研究长期孤立的问题,填补理论空白。
  • 设计一种自适应算法,根据未知的奖励函数光滑性 $\beta$ 平衡全局与局部信息。
  • 建立 regret 的匹配上下界,证明该算法在所有 $\beta \in (0, \infty]$ 下的率最优性。

提出的方法

  • 该算法根据局部密度与光滑性对上下文空间进行自适应的超立方体划分,实现局部学习,同时在可能时保持全局结构。
  • 采用分层探索策略,根据估计的光滑性 $\beta$ 调整探索半径,平衡局部精度与全局外推。
  • 该方法引入了一个边界条件(假设5,iv),以控制近似最优臂混淆的概率,确保 regret 上界随 $\epsilon^{1+\alpha}$ 变化。
  • 采用基于置信区间的选择规则,动态维护活跃臂集合,确保最优臂不会被错误剔除。
  • 该 regret 分析基于一种新颖的分解:将 regret 分解为两部分——在估计良好的区域中因选择次优臂产生的 regret,以及在估计较差的区域中因估计误差产生的 regret。
  • 证明了估计误差与事件失败(通过 $\mathcal{G}_{k-1}$ 与 $\mathcal{M}_{k-1}$ 定义)的高概率界,从而导出与已知下界匹配的紧致 regret 上界。

实验结果

研究问题

  • RQ1如何设计单一算法,使其在所有 Hölder 光滑性水平 $\beta \in (0, \infty]$ 下均实现率最优的 regret?
  • RQ2在非参数上下文Bandit中,全局外推与局部学习之间的根本权衡是什么?
  • RQ3能否设计一种统一算法,弥合参数化Bandit(对数 regret)与不可微Bandit(regret $\sim T^{\frac{\beta+d}{2\beta+d}}$)之间的性能差距?
  • RQ4光滑性 $\beta$、维度 $d$ 与边界条件 $\alpha$ 之间的相互作用如何影响非参数Bandit中的极小化 regret?
  • RQ5当奖励函数光滑但不一定可微时,探索与利用之间的最优平衡是什么?

主要发现

  • 所提算法在所有 $\beta \in (0, \infty]$ 下实现了率最优的 regret,当 $\beta$ 有限时,regret 规模为 $\tilde{O}(T^{\frac{\beta+d}{2\beta+d}})$,与已知下界匹配。
  • 当 $\beta = \infty$(参数化情形)时,算法恢复了对数 regret,确认在无限光滑性下贪婪策略是最优的。
  • 当 $\beta \leq 1$(不可微情形)时,regret 与 $\tilde{O}(T^{\frac{\beta+d}{2\beta+d}})$ 边界一致,复现了先前非参数研究的结果。
  • 该算法自适应地平衡局部与全局学习:当 $\beta$ 较小时使用局部邻域,当 $\beta$ 较大时采用全局外推。
  • 边界条件(假设5,iv)通过控制近似最优臂混淆的概率,使 regret 上界更紧致,改善了对 $\epsilon_k$ 的依赖性。
  • 分析表明,估计误差与事件失败导致的 regret 为 $\tilde{O}(1)$,确保主导项为 $\tilde{O}(T^{\frac{\beta+d}{2\beta+d}})$ 项。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。