Skip to main content
QUICK REVIEW

[论文解读] Improved Optimistic Algorithms for Logistic Bandits

Louis Faury, Marc Abeille|arXiv (Cornell University)|Feb 18, 2020
Advanced Bandit Algorithms Research参考文献 18被引用 10
一句话总结

本文提出了一种新颖的乐观算法用于逻辑斯蒂带 bandits 问题,实现了 $\tilde{\mathcal{O}}(d\sqrt{T} + \kappa)$ 的遗憾界,消除了先前方法中存在问题的 $\kappa^{1/2}$ 依赖性。通过引入对非线性的精细化分析以及一种新型的自归一化鞅 Bernstein 型不等式,该方法在不依赖问题相关常数 $\kappa$ 的主导项的前提下,获得了更紧致的遗憾界。

ABSTRACT

The generalized linear bandit framework has attracted a lot of attention in recent years by extending the well-understood linear setting and allowing to model richer reward structures. It notably covers the logistic model, widely used when rewards are binary. For logistic bandits, the frequentist regret guarantees of existing algorithms are $ ilde{\mathcal{O}}(κ\sqrt{T})$, where $κ$ is a problem-dependent constant. Unfortunately, $κ$ can be arbitrarily large as it scales exponentially with the size of the decision set. This may lead to significantly loose regret bounds and poor empirical performance. In this work, we study the logistic bandit with a focus on the prohibitive dependencies introduced by $κ$. We propose a new optimistic algorithm based on a finer examination of the non-linearities of the reward function. We show that it enjoys a $ ilde{\mathcal{O}}(\sqrt{T})$ regret with no dependency in $κ$, but for a second order term. Our analysis is based on a new tail-inequality for self-normalized martingales, of independent interest.

研究动机与目标

  • 解决现有广义线性带 bandits 算法在逻辑斯蒂带 bandits 场景下因问题相关常数 $\kappa$ 较大而导致的遗憾性能差的问题。
  • 克服由 sigmoid 连接函数非线性性引发的 $\tilde{\mathcal{O}}(\kappa\sqrt{T})$ 遗憾界。
  • 提出一种新的乐观算法,以减少遗憾界主导项中对 $\kappa$ 的依赖。
  • 提供一种自归一化鞅的新尾部不等式,具有独立的理论价值。
  • 回答 Filippi 等人(2010)提出的开放猜想,即改进 GLM-UCB 的遗憾缩放与 $\kappa$ 的关系。

提出的方法

  • 提出一种改进的乐观算法,通过对手术函数曲率的精细化分析,考虑逻辑斯蒂连接函数的非线性结构。
  • 引入一种新型的类似 Bernstein 的不等式,用于自归一化鞅,以控制非线性条件下估计参数的偏离。
  • 基于对数似然函数的 Hessian 矩阵构造置信集,以更准确地捕捉参数估计中的不确定性。
  • 利用椭球潜力引理,将遗憾分解为由逆协方差矩阵加权的特征向量范数的项。
  • 引入参数 $\gamma_T(\delta)$ 以控制置信集宽度,通过 $T$ 和 $d$ 的对数项进行调优。
  • 引入一个二阶项以吸收 $\kappa$ 的依赖性,使其仅出现在低阶项中,而非主导的 $\sqrt{T}$ 项中。

实验结果

研究问题

  • RQ1能否从逻辑斯蒂带 bandits 问题的乐观算法遗憾界主导项中,完全消除 $\kappa$ 的依赖?
  • RQ2是否可能实现 $\tilde{\mathcal{O}}(d\sqrt{T} + \kappa)$ 的遗憾界,而非现有的 $\tilde{\mathcal{O}}(\kappa\sqrt{T})$?
  • RQ3能否推导出一种新的鞅集中不等式,以更好地捕捉逻辑斯蒂连接函数的非线性行为?
  • RQ4修改版的 GLM-UCB 是否如 Filippi 等人(2010)所猜想的那样,实现 $\kappa^{1/2}$ 的遗憾缩放改进?
  • RQ5分析能否扩展至表明 $\kappa$ 仅出现在二阶项中,从而在高曲率场景下显著提升实际性能?

主要发现

  • 所提出的算法实现了 $\tilde{\mathcal{O}}(d\sqrt{T} + \kappa)$ 的遗憾界,与先前工作相比,已从主导项中消除了 $\kappa^{1/2}$ 因子。
  • 本文证实了 Filippi 等人(2010)的猜想,表明修改后的 GLM-UCB 可实现 $\tilde{\mathcal{O}}(d\sqrt{\kappa T})$ 的遗憾界,优于标准的 $\tilde{\mathcal{O}}(\kappa\sqrt{T})$ 边界。
  • 推导出一种针对自归一化鞅的新 Bernstein 型不等式,这对于控制逻辑斯蒂模型中非线性估计误差至关重要。
  • 分析表明,$\kappa$ 的依赖性可被限制在二阶项中,从而在高曲率场景下显著提升算法的实际可用性。
  • 当 $\lambda = d\log T$ 时,置信集宽度参数 $\gamma_T(\delta)$ 的尺度为 $\mathcal{O}(d^{1/2}\log^{1/2}T)$,确保置信集大小仅对数增长。
  • 遗憾界在主导项中与决策集直径无关,这解决了先前方法中 $\kappa$ 随集合大小呈指数增长的关键局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。