Skip to main content
QUICK REVIEW

[论文解读] Regularized Contextual Bandits

Xavier Fontaine, Quentin Berthet|arXiv (Cornell University)|Oct 11, 2018
Advanced Bandit Algorithms Research被引用 3
一句话总结

本文提出了一种正则化的上下文Bandit算法,该算法将上下文空间划分为若干个桶,并在每个桶中独立求解正则化的多臂Bandit问题。通过一种新颖的边界条件,该算法实现了问题相关的快速收敛率和问题无关的中等收敛率,相较于经典非参数上下文Bandit方法,在Hölder平滑奖励函数下实现了更快的收敛速度。

ABSTRACT

We consider the stochastic contextual bandit problem with additional regularization. The motivation comes from problems where the policy of the agent must be close to some baseline policy which is known to perform well on the task. To tackle this problem we use a nonparametric model and propose an algorithm splitting the context space into bins, and solving simultaneously - and independently - regularized multi-armed bandit instances on each bin. We derive slow and fast rates of convergence, depending on the unknown complexity of the problem. We also consider a new relevant margin condition to get problem-independent convergence rates, ending up in intermediate convergence rates interpolating between the aforementioned slow and fast rates.

研究动机与目标

  • 解决代理策略必须保持接近已知基线策略的上下文Bandit问题。
  • 开发一种非参数算法,同时保持正则化并适应未知的问题复杂度。
  • 利用一种新的边界条件,推导出介于慢速率和快速率之间的收敛速率。
  • 在Hölder平滑奖励函数下,建立关于遗憾的理论保证。
  • 提供一种在无需事先了解问题复杂度的情况下,平衡探索与正则化的策略。

提出的方法

  • 该算法将d维上下文空间划分为B^d个桶,将每个桶视为一个独立的正则化多臂Bandit问题。
  • 在每个桶内,应用一种正则化的UCB风格策略,以平衡探索与对基线策略的接近程度。
  • 正则化项强制学习到的策略保持接近预设的基线策略,以确保稳定性和性能。
  • 引入一种新颖的边界条件,以推导出介于慢速率和快速率之间的中等收敛速率。
  • 理论分析使用了非参数回归技术,包括类似回归直方图的分桶方法以及对奖励函数的Hölder连续性假设。
  • 最优桶大小B被选为T的函数,以最小化遗憾,从而在偏差与方差之间取得平衡。

实验结果

研究问题

  • RQ1当策略必须保持接近基线时,正则化是否能提升上下文Bandit中的收敛速度?
  • RQ2在非参数上下文Bandit中,探索与正则化之间的最优权衡是什么?
  • RQ3在新的边界条件下,问题相关速率与问题无关速率如何相互作用?
  • RQ4能否推导出介于慢速率与快速率之间的中间收敛速率?
  • RQ5在Hölder平滑奖励函数下,正则化上下文Bandit的极小化下界是什么?

主要发现

  • 该算法实现了O((T / log²T)^(-β(1+α)/(2β+d)))的遗憾界,其中α ∈ (0,1),该界介于慢速率与快速率之间。
  • 收敛速率依赖于奖励函数的光滑度β和维度d,且在更高光滑度下性能更优。
  • 一种新的边界条件使得中等收敛速率成为可能,其速度比慢速率快但比快速率慢,具体取决于问题结构。
  • 遗憾界比经典非参数上下文Bandit更紧,尤其当基线策略选择得当时。
  • 建立了Ω(T^(-2β/(2β+d)))的下界,与Hölder光滑性下非参数回归的极小化速率一致。
  • 分析表明,正则化不会降低收敛速度,反而能在高维或复杂上下文中提升鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。