Skip to main content
QUICK REVIEW

[论文解读] Contextual Bandits with Continuous Actions: Smoothing, Zooming, and Adapting

Akshay Krishnamurthy, John Langford|arXiv (Cornell University)|Feb 5, 2019
Advanced Bandit Algorithms Research参考文献 55被引用 17
一句话总结

本文提出了一种基于平滑化的新型上下文Bandit方法,适用于连续动作空间,其中策略通过带宽参数 $ h $ 将上下文映射到动作的分布。通过与平滑基准进行比较来衡量遗憾,作者实现了适应未知平滑度的实例相关和最坏情况下的遗憾界,具有最优适应性且无需调参,在无需Lipschitz假设或参数先验知识的良性问题上显著提升了性能。

ABSTRACT

We study contextual bandit learning with an abstract policy class and continuous action space. We obtain two qualitatively different regret bounds: one competes with a smoothed version of the policy class under no continuity assumptions, while the other requires standard Lipschitz assumptions. Both bounds exhibit data-dependent "zooming" behavior and, with no tuning, yield improved guarantees for benign problems. We also study adapting to unknown smoothness parameters, establishing a price-of-adaptivity and deriving optimal adaptive algorithms that require no additional information.

研究动机与目标

  • 为解决现有上下文Bandit算法在连续动作空间中的局限性,特别是对全局Lipschitz假设的依赖以及对未知参数的依赖。
  • 通过在动作上引入平滑基准,设计一种即使损失函数不连续或非平滑时依然有效的遗憾框架。
  • 设计自适应算法,使其能自动调整未知平滑度参数,而无需事先知晓带宽或Lipschitz常数。
  • 实现与策略类复杂度和问题固有结构相适应的最优实例相关和最坏情况下的遗憾保证。
  • 通过在单一算法框架中整合平滑化与自适应性,统一并改进先前的zooming和非参数Bandit方法。

提出的方法

  • 引入一种平滑策略类,其中每个动作 $ a $ 被替换为 $[a-h, a+h]$ 上的均匀分布,从而将基准转化为关于动作的良态连续函数。
  • 定义一种新的遗憾概念——平滑遗憾,将其与平滑策略类中表现最佳的策略进行比较,避免了因损失函数不连续而产生的近似误差。
  • 采用统一的算法框架 $\mathtt{ContinuousEXP4}$,在所有带宽 $ h $ 上运行,实现无需调参的自适应性能。
  • 通过基于观测损失动态细化动作区域的数据依赖性“zooming”行为,提升良性实例下的遗憾表现。
  • 整合 $\mathtt{Corral+EXP4}$,实现对未知平滑度水平的自适应性能,理论保证与下界一致。
  • 运用稳定性和集中性论证,证明即使平滑带宽 $ h $ 未知或变化,该算法仍能保持低遗憾。

实验结果

研究问题

  • RQ1我们能否设计一种适用于连续动作空间的上下文Bandit算法,避免对全局Lipschitz连续性等强假设的依赖?
  • RQ2我们能否在不事先知晓平滑度参数的情况下,实现适应策略类内在复杂度和损失结构的实例相关遗憾界?
  • RQ3是否可能构建一个单一算法,在所有带宽 $ h $ 上均表现最优,且无需手动调参?
  • RQ4当平滑度参数未知时,自适应性的代价是多少,能否被一个实用算法匹配?
  • RQ5与现有zooming和非参数Bandit方法相比,所提出的平滑化框架在遗憾保证和可扩展性方面表现如何?

主要发现

  • 平滑遗憾的最坏情况遗憾为 $ \Theta\left(\sqrt{T/h}\right) $,对于任意固定的 $ h $ 均达到最优速率,即使在无连续性假设下也成立。
  • 对于实例相关遗憾,其界为 $ O\left(\min_{\epsilon} T\epsilon + \theta_h(\epsilon)\right) $,其中 $ \theta_h(\epsilon) \leq 1/(h\epsilon) $,从而在良性问题上实现性能提升。
  • 该算法在所有 $ h \in (0,1] $ 上实现了最优自适应性,遗憾为 $ \Theta\left(\sqrt{T}/h\right) $,与下界仅相差常数因子。
  • 对于Lipschitz损失,该算法实现了 $ \Theta\left(T^{2/3}\sqrt{L}\right) $ 的遗憾,与下界一致,并优于先前结果。
  • 在高维设置下,策略zooming系数 $ \psi_L(\epsilon) $ 被证明为 $ O\left(\frac{L}{L_0} \cdot \frac{\sqrt{d}}{\epsilon}\right) $,从而支持可扩展性能。
  • 建立了下界,表明任何自适应算法都无法实现优于 $ \Omega(T^{2/3}\sqrt{L}) $ 的遗憾,从而证明了所提自适应算法的最优性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。