Skip to main content
QUICK REVIEW

[论文解读] On the Performance of Thompson Sampling on Logistic Bandits

Shi Dong, Tengyu Ma|arXiv (Cornell University)|May 12, 2019
Advanced Bandit Algorithms Research参考文献 16被引用 4
一句话总结

该论文为逻辑斯蒂老虎机上的汤普森采样建立了贝叶斯后悔界 $\tilde{O}(d\sqrt{T})$,在动作集与参数集相同的情况下,该界与斜率参数 $\beta$ 无关。进一步地,通过引入脆弱性维数 $\eta$ 和最差情况下的最优对数几率 $\lambda$,将结果推广,表明后悔界随 $\tilde{O}(\sqrt{d\eta T}/\lambda)$ 变化,并证明了若不依赖于 $\eta$ 或 $\lambda$,则任何算法都无法实现关于 $T$ 的次多项式后悔。该分析提出了一种针对逻辑斯蒂老虎机的新信息比界,解决了关于先前界中 $\beta$-依赖性的长期开放问题。

ABSTRACT

We study the logistic bandit, in which rewards are binary with success probability $\exp(βa^ op θ) / (1 + \exp(βa^ op θ))$ and actions $a$ and coefficients $θ$ are within the $d$-dimensional unit ball. While prior regret bounds for algorithms that address the logistic bandit exhibit exponential dependence on the slope parameter $β$, we establish a regret bound for Thompson sampling that is independent of $β$. Specifically, we establish that, when the set of feasible actions is identical to the set of possible coefficient vectors, the Bayesian regret of Thompson sampling is $ ilde{O}(d\sqrt{T})$. We also establish a $ ilde{O}(\sqrt{dηT}/λ)$ bound that applies more broadly, where $λ$ is the worst-case optimal log-odds and $η$ is the "fragility dimension," a new statistic we define to capture the degree to which an optimal action for one model fails to satisfice for others. We demonstrate that the fragility dimension plays an essential role by showing that, for any $ε> 0$, no algorithm can achieve $\mathrm{poly}(d, 1/λ)\cdot T^{1-ε}$ regret.

研究动机与目标

  • 解决汤普森采样在逻辑斯蒂老虎机上是否能实现与斜率参数 $\beta$ 无关的后悔界这一开放问题,此前的界显示其存在指数依赖。
  • 为界定逻辑斯蒂老虎机中的信息比发展一种新的信息论分析技术,扩展了对线性和独立老虎机的研究。
  • 定义并分析脆弱性维数 $\eta$,这是一种捕捉不同模型间最优动作敏感度的新统计量,并表明其在后悔界中的核心作用。
  • 建立紧致的后悔下界,证明了若不依赖 $\eta$ 或 $\lambda$,则任何算法都无法实现 $T^{1-\epsilon}$ 的后悔界,其中 $\epsilon > 0$。

提出的方法

  • 提出一种专为逻辑斯蒂老虎机设计的新信息比界,利用逻辑链接函数的结构以及参数空间和动作空间的几何特性。
  • 引入脆弱性维数 $\eta$,定义为:在最多多少个模型中,某一模型的最优动作在另一模型中的成功概率 $\leq 50\%$。
  • 采用贝叶斯后悔框架,通过仔细分析动作与真实参数 $\theta$ 之间的互信息,结合集中与反集中性质,推导出界。
  • 建立一个涉及信息比与动作-参数对对数几率的关键不等式,当 $\mathcal{A} = \Theta$(即动作集与参数集相等)时,可导出 $\tilde{O}(d\sqrt{T})$ 的界。
  • 通过引入 $\lambda$(最差情况下的最优对数几率),将界推广至 $\mathcal{A} \neq \Theta$ 的情形,并表明后悔界随 $\tilde{O}(\sqrt{d\eta T}/\lambda)$ 变化。
  • 利用球形码和内积约束构造下界论证,表明在某些情形下 $\eta$ 可随 $d$ 指数增长,且这种增长对于实现次多项式后悔是不可避免的。

实验结果

研究问题

  • RQ1尽管先前的界显示存在指数依赖,汤普森采样在逻辑斯蒂老虎机上是否仍能实现与斜率参数 $\beta$ 无关的后悔界?
  • RQ2脆弱性维数 $\eta$ 在决定逻辑斯蒂老虎机中后悔的根本限制中起什么作用?
  • RQ3是否可能在不依赖 $\eta$ 或 $\lambda$ 的前提下,实现 $T^{1-\epsilon}$ 的后悔界(对任意 $\epsilon > 0$)?
  • RQ4动作集与参数集的结构如何影响逻辑斯蒂老虎机中学习的难度,特别是在 $\mathcal{A} \neq \Theta$ 的情况下?
  • RQ5信息比框架能否扩展至非线性老虎机(如逻辑斯蒂老虎机)?其中会出现哪些新的技术挑战?

主要发现

  • 当动作集 $\mathcal{A}$ 等于参数集 $\Theta$ 时,汤普森采样实现了 $\tilde{O}(d\sqrt{T})$ 的贝叶斯后悔界,且不依赖于斜率参数 $\beta$。
  • 在 $\mathcal{A} \neq \Theta$ 的一般情形下,后悔界被限定为 $\tilde{O}(\sqrt{d\eta T}/\lambda)$,其中 $\eta$ 为脆弱性维数,$\lambda$ 为最差情况下的最优对数几率。
  • 论文证明了任何算法都无法实现 $\mathrm{poly}(d,1/\lambda) \cdot T^{1-\epsilon}$ 的后悔界(对任意 $\epsilon > 0$),从而确立了 $\eta$ 在后悔界中的本质性作用。
  • 脆弱性维数 $\eta$ 在某些配置下可随 $d$ 指数增长,特别是在最差情况下的最优对数几率 $\iota = 0$ 时,但在大多数实际场景中,其预期增长为与 $d$ 线性相关。
  • 分析表明,从动作集中移除动作可能增加问题的难度,如反例所示:当动作被移除时 $\eta$ 增大,尽管动作空间变小,但学习难度反而上升。
  • 本研究提出的信息比界技术为分析非线性老虎机问题(尤其是指数族奖励)提供了新途径。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。