[论文解读] OSOM: A simultaneously optimal algorithm for multi-armed and linear contextual bandits
OSOM 是一种计算高效的算法,在无需事先了解底层奖励结构的情况下,同时在多臂老虎机和线性上下文老虎机设置中实现了最优遗憾。它自适应地在简单臂选择策略与线性上下文策略之间进行选择,在多臂设置下实现问题相关的 O(log n) 遗憾,在线性设置下在随机上下文假设下实现极小化最大遗憾的 Õ((√d + √K)√n) 遗憾。
We consider the stochastic linear (multi-armed) contextual bandit problem with the possibility of hidden simple multi-armed bandit structure in which the rewards are independent of the contextual information. Algorithms that are designed solely for one of the regimes are known to be sub-optimal for the alternate regime. We design a single computationally efficient algorithm that simultaneously obtains problem-dependent optimal regret rates in the simple multi-armed bandit regime and minimax optimal regret rates in the linear contextual bandit regime, without knowing a priori which of the two models generates the rewards. These results are proved under the condition of stochasticity of contextual information over multiple rounds. Our results should be viewed as a step towards principled data-dependent policy class selection for contextual bandits.
研究动机与目标
- 设计一种单一算法,在无需事先了解奖励结构的情况下,同时在简单多臂老虎机和线性上下文老虎机设置中实现最优遗憾。
- 解决现有算法在应用于与其设计意图不同的设置时表现次优的局限性。
- 基于数据驱动的复杂度,在上下文老虎机中实现自适应策略类选择,从而在多样化的奖励生成模型中提升整体性能。
- 在随机上下文假设下,为两种设置下的遗憾最优性提供理论保证。
提出的方法
- OSOM 采用一种模型选择机制,基于置信集和面对不确定性的乐观性,动态地在 UCB 风格的臂选择策略与线性上下文策略之间进行选择。
- 它为线性参数 θ* 维护独立的置信集,并使用自归一化的集中不等式来限制估计误差。
- 该算法采用阈值机制,根据估计的线性效应大小与 θ* 不确定性之间的相对关系来切换策略。
- 它应用矩阵 Freedman 不等式和行列式增长边界来控制置信集大小,确保参数估计的稳定性。
- 该方法使用统一框架对两种设置的遗憾进行分析,同时考虑奖励模型的线性和非线性分量。
- 它利用当 θ* = 0 时,线性模型退化为多臂老虎机这一事实,使 OSOM 自动适应此情况。
实验结果
研究问题
- RQ1能否设计一种单一算法,在多臂老虎机设置中实现问题相关的最优遗憾,同时在线性上下文老虎机设置中实现极小化最大遗憾?
- RQ2能否设计一种计算高效的算法,无需先验知识即可自适应地匹配奖励生成过程的真实复杂度?
- RQ3如何将置信集与模型选择相结合,以确保在两种设置下均实现最优遗憾?
- RQ4在随机上下文假设下,此类自适应算法能提供哪些理论保证?
- RQ5该算法能否同时实现多臂情况下 O(log n) 的遗憾和线性情况下 Õ((√d + √K)√n) 的遗憾?
主要发现
- OSOM 在多臂老虎机设置中实现了 O(log n) 的问题相关遗憾,当奖励与上下文无关时,其遗憾率与 UCB 的最优率一致。
- 在线性上下文老虎机设置中,OSOM 达到了 Õ((√d + √K)√n) 的极小化最大遗憾,与 LinUCB 和 OFUL 的最佳已知边界一致。
- 该算法无需事先知道数据是否服从多臂或线性模型,即可自动适应底层奖励结构。
- 理论分析表明,通过集中不等式,θ* 的大估计误差概率受到限制,从而确保了鲁棒性。
- 通过引理 14 控制设计矩阵的行列式增长,该引理界定了对数行列式增长,支持置信集的构建。
- 在上下文随机生成且不病态的假设下,该算法在两种设置下的遗憾被证明是最优的。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。