Skip to main content
QUICK REVIEW

[论文解读] Contextual bandits with surrogate losses: Margin bounds and efficient algorithms

Dylan J. Foster, Akshay Krishnamurthy|arXiv (Cornell University)|Jun 28, 2018
Advanced Bandit Algorithms Research被引用 9
一句话总结

该论文提出了一种新颖的上下文Bandit框架,采用代理损失(特别是ramp损失和hinge损失)推导出基于边距的遗憾界与高效算法。它在 $d$-维空间中建立了Lipschitz上下文Bandit的新型 $\tilde{O}(T^{d/(d+1)})$ 遗憾界,并提出了Hinge-LMC,这是首个在无曲率假设下,针对bandit多类预测具有 $\tilde{O}(\sqrt{dT})$ 错误界的高效算法。

ABSTRACT

We use surrogate losses to obtain several new regret bounds and new algorithms for contextual bandit learning. Using the ramp loss, we derive new margin-based regret bounds in terms of standard sequential complexity measures of a benchmark class of real-valued regression functions. Using the hinge loss, we derive an efficient algorithm with a $\sqrt{dT}$-type mistake bound against benchmark policies induced by $d$-dimensional regressors. Under realizability assumptions, our results also yield classical regret bounds.

研究动机与目标

  • 将基于边距的泛化理论从监督学习推广到具有部分反馈的上下文Bandit设置。
  • 利用凸代理损失(特别是hinge损失)开发计算高效的上下文Bandit算法。
  • 基于度量熵和Rademacher复杂度等顺序复杂度度量,推导出信息论遗憾界。
  • 通过提供首个具有 $\sqrt{dT}$ 类型错误界的高效算法,解决bandit多类预测中的开放问题。
  • 通过自适应极小化最大分析与链式论证,改进Lipschitz和光滑Banach空间设置下的现有遗憾界。

提出的方法

  • 使用ramp损失,基于基准实值回归函数类的顺序度量熵,推导出基于边距的遗憾界。
  • 结合Foster等人(2015)的自适应极小化最大框架与一种“自适应”链式论证,处理对抗性上下文Bandit中的部分反馈。
  • 提出Hinge-LMC,一种利用指数加权、Langevin蒙特卡洛采样以及基于hinge损失代理的结构化动作选择策略的高效算法。
  • 引入SmoothFTL,一种带有平滑的Follow-The-Leader变体,在Lipschitz上下文Bandit的随机设置中匹配信息论界。
  • 采用重要性加权,从部分反馈中形成无偏损失估计,从而在bandit反馈设置中实现稳定优化。
  • 通过自适应周期长度与正则化,平衡探索与利用,使用参数 $\mu$ 控制平滑度与遗憾。

实验结果

研究问题

  • RQ1能否将监督学习中常见的基于边距的泛化界扩展到具有部分反馈的上下文Bandit设置?
  • RQ2当基准策略由 $d$-维回归器诱导且满足可实现性时,上下文Bandit的最优遗憾是多少?
  • RQ3能否设计出使用凸代理损失、具有 $\sqrt{dT}$ 错误界的bandit多类预测高效算法?
  • RQ4度量熵与Rademacher复杂度等顺序复杂度度量如何刻画对抗性上下文Bandit中的遗憾?
  • RQ5能否使非构造性极小化最大分析的理论保证在部分反馈设置中具有算法可实现性?

主要发现

  • 该论文在 $d$-维度量空间中建立了Lipschitz上下文Bandit的新 $\tilde{O}(T^{d/(d+1)})$ 遗憾界,优于Cesa-Bianchi等人(2017)的先前结果 $\tilde{O}(T^{(d+1)/(d+2)})$。
  • 在光滑Banach空间中的bandit多类预测中,该论文实现了 $\tilde{O}(T^{2/3})$ 错误界,将Kakade等人(2008)的结果推广到bandit设置。
  • Hinge-LMC是首个在无曲率假设下,使用代理损失实现 $\sqrt{dT}$ 类型错误界的bandit多类预测高效算法。
  • SmoothFTL在随机Lipschitz上下文Bandit设置中实现了 $\tilde{O}((KT)^{p/(p+1)})$ 遗憾界,其中 $p$ 是上下文空间的覆盖维数。
  • 分析表明,$\tilde{O}(T^{p/(p+1)})$ 边界优于Cesa-Bianchi等人(2017)在相同设置下的 $\tilde{O}(T^{(p+1)/(p+2)})$ 边界。
  • 该框架可推广至具有度量动作空间的设置,在动作空间覆盖维数为 $p_{\mathcal{A}}$ 时,得到 $\tilde{O}(T^{(p + p_{\mathcal{A}}p)/(p + p_{\mathcal{A}}p + 1)})$ 的边界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。