Skip to main content
QUICK REVIEW

[论文解读] Randomized Exploration in Generalized Linear Bandits

Branislav Kveton, Manzil Zaheer|arXiv (Cornell University)|Jun 21, 2019
Advanced Bandit Algorithms Research参考文献 32被引用 11
一句话总结

本文提出了两种用于广义线性 bandits 的随机探索算法:GLM-TSL,它从后验分布的 Laplace 近似中进行采样;以及 GLM-FPL,它对过去奖励进行扰动并拟合一个模型以引导探索。两种方法均实现了 $\tilde{O}(d\sqrt{n\log K})$ 的遗憾界,相较于之前的工作,对 GLM-TSL 的遗憾界有所改进,并首次为非线性模型中高斯噪声扰动提供了此类界限。

ABSTRACT

We study two randomized algorithms for generalized linear bandits. The first, GLM-TSL, samples a generalized linear model (GLM) from the Laplace approximation to the posterior distribution. The second, GLM-FPL, fits a GLM to a randomly perturbed history of past rewards. We analyze both algorithms and derive $ ilde{O}(d \sqrt{n \log K})$ upper bounds on their $n$-round regret, where $d$ is the number of features and $K$ is the number of arms. The former improves on prior work while the latter is the first for Gaussian noise perturbations in non-linear models. We empirically evaluate both GLM-TSL and GLM-FPL in logistic bandits, and apply GLM-FPL to neural network bandits. Our work showcases the role of randomization, beyond posterior sampling, in exploration.

研究动机与目标

  • 开发并分析广义线性 bandits 的随机探索算法,超越传统的上置信界方法。
  • 通过利用 Laplace 近似,改进广义线性 bandits 中 Thompson 采样变体的遗憾界。
  • 提出一种新颖的基于扰动的探索方法(GLM-FPL),可推广至神经网络等复杂模型。
  • 在特征稀疏性假设下,首次为非线性广义线性 bandits 中高斯噪声扰动提供频率学遗憾保证。
  • 通过逻辑 bandits 的实验验证算法性能,并展示其在神经网络奖励模型中的可扩展性。

提出的方法

  • GLM-TSL 从模型参数后验分布的 Laplace 近似中采样一个广义线性模型。
  • GLM-FPL 对过去奖励的历史进行独立的高斯噪声扰动,并对扰动后的数据拟合一个广义线性模型以指导探索。
  • 算法在每轮中使用随机最大似然估计来平衡探索与利用。
  • 遗憾分析依赖于集中不等式以及 Fisher 信息矩阵的特征值界,以控制估计误差。
  • 理论分析假设特征向量为固定且有界的,并通过改进 Agrawal 和 Goyal(2013b)的证明技术,推导出高概率遗憾界。
  • 实验评估使用逻辑 bandits 和神经网络 bandits 来评估性能与可扩展性。

实验结果

研究问题

  • RQ1在广义线性 bandits 中,通过后验采样实现的随机探索能否实现比现有 UCB 方法更紧的遗憾界?
  • RQ2对奖励历史施加高斯噪声是否能在非线性模型中实现有效探索,并具备理论保证?
  • RQ3GLM-FPL 算法能否扩展至深度神经网络等复杂模型,同时保持优异性能?
  • RQ4在维度 $d$ 和臂的数量 $K$ 上,GLM-TSL 的遗憾界相较于之前工作有何依赖关系?
  • RQ5在何种条件下,尽管存在非线性性和高维特征空间,GLM-FPL 算法仍能保持低遗憾?

主要发现

  • GLM-TSL 实现了 $\tilde{O}(d\sqrt{n\log K})$ 的遗憾界,在有限臂设置下,相较于之前最佳界限,改善了 $\sqrt{d/\log K}$ 的因子。
  • GLM-FPL 的遗憾界是首个在每个特征向量最多只有一个非零元素的假设下,针对非线性广义线性 bandits 中高斯噪声扰动的遗憾界。
  • 实验结果表明,GLM-TSL 和 GLM-FPL 在逻辑 bandits 环境中均达到了最先进性能。
  • GLM-FPL 可直接推广至神经网络 bandits,在高维分类任务中表现出强劲的实验性能。
  • GLM-FPL 中的扰动机制使得在后验采样不可行的复杂模型中也能实现有效探索。
  • 理论分析证实,遗憾随时间与维度呈次线性增长,支持将随机探索方法推广至简单线性模型之外的场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。